最近在搞一个本地知识库问答,用的ChatGLM3-6B,显卡是4060Ti 16G。一开始直接FP16加载,跑起来就OOM,连对话都开不了。后来试了4bit量化,显存倒是够了(大概8-9G),但回答质量明显下降,很多简单推理都开始胡说八道。
楼主
2026-08-02
大模型本地部署显存爆了,量化后效果又差,求指点
请 登录 后发表回复
全部回复
共 103 条
2楼
3天前
试试AWQ量化,比GPTQ保真度高不少,8G左右4060Ti应该扛得住。
3楼
1天前
16G显存跑6B的FP16确实挺紧张的,模型权重就占12G多,再加上KV cache和中间激活,OOM很正常。4bit量化掉点厉害的话,可以试试AWQ或者GPTQ的int4,比bitsandbytes的NF4保留精度好一些,尤其对中文任务。另外你知识库问答是不是prompt塞太长了,上下文一长显存和效果都会崩,建议限制一下检索返回的chunk数量。实在不行考虑换个更小的模型比如Qwen2.5-3B或者用llama.cpp跑GGUF的Q5量化,4060Ti这个卡其实挺适合的。
4楼
12小时前
ChatGLM3-6B的4bit量化确实掉点厉害,尤其推理类任务,我之前也踩过这个坑。你可以试试AWQ或者GPTQ的int4,比bitsandbytes的NF4稳不少,显存占用差不多但输出质量能好一截。4060Ti 16G跑6B其实INT8就够用了,大概占11G左右,比4bit强很多。实在不行就换Qwen2.5-7B的GPTQ-int4,同显存下表现比ChatGLM3好挺多。