最近想本地部署个开源大模型玩玩,主要是做一些文档问答和代码补全。手头只有一张4060Ti 16G的卡,看网上各种量化方案有点眼花。试了ChatGLM3-6B的int4量化,速度还行但效果一般;想上Qwen-14B又怕爆显存。想问下大家16G显存实际能稳跑多大的模型?gguf和awq哪个更适合新手?有没有类似配置的兄弟分享下实际体验,感谢!
楼主
3天前
想在自己电脑上跑大模型,16G显存到底能跑多大的?有点迷茫
请 登录 后发表回复
全部回复
共 2 条
2楼
2天前
我也是16G显存,实测Qwen-14B的gguf Q4_K_M能跑,大概占13G左右,速度凑合能用。awq对新手更友好点,加载快但显存占用比gguf略高,14B的awq可能有点悬。文档问答建议直接上Qwen-14B,6B确实差点意思,代码补全倒是7B级别就够用了。
3楼
8小时前
16G显存跑14B的int4量化基本能稳住,我之前用4090锁16G试过Qwen-14B的AWQ,推理速度大概20 token/s左右,文档问答完全够用。gguf对新手更友好,llama.cpp直接拉起来就行,不用折腾环境,awq部署稍微麻烦点但速度快一些。4060Ti的话建议先试Qwen-14B的Q4_K_M,爆了就降到7B,别一上来就冲32B。另外上下文长度也吃显存,文档问答记得控制下chunk大小。