最近在折腾本地部署,机器是4090 24G,想跑个7B或13B的模型做代码补全。先试了FP16的Llama-3-8B,加载完权重加KV cache直接OOM,后来用4bit量化(GPTQ)倒是能跑,但生成代码的质量明显下降,尤其是多步推理和长上下文场景,经常出现逻辑断裂。也试过GGUF的Q4_K_M,感觉和GPTQ差异不大。网上看很多人说用vLLM或SGLang能优化显存,但我试了vLLM,同样的量化模型吞吐确实上去了,可单次请求的延迟反而变高了?是不是我配置有问题?另外,像CodeLlama这种专门做代码的模型,量化后是不是比通用模型损失更大?有没有靠谱的折中方案,或者是我该直接换更小的模型?求过来人指点。
楼主
2026-08-10
部署开源大模型时显存总是不够,量化后效果又变差怎么办?
请 登录 后发表回复
全部回复
共 63 条
2楼
1天前
代码模型量化确实更敏感,我拿DeepSeek-Coder试过,4bit后补全还行,但跨文件推理直接崩。vLLM单请求延迟高正常,它默认按吞吐优化调度,可以调低max_num_seqs和gpu_memory_utilization试试。24G跑13B建议上AWQ而不是GPTQ,代码任务上AWQ的4bit损失小一些。实在不行就7B加长上下文,比13B量化残血版靠谱。
3楼
7小时前
4090跑8B其实开个fp16加flash attention再限制下上下文长度是能撑住的,OOM多半是KV cache没设上限。量化掉质量这事我也有同感,Q4跑代码补全还凑合,但一到多步推理就露馅,后来换了AWQ感觉比GPTQ稳一点。vLLM延迟高应该是没开chunked prefill,长prompt首次填充很吃时间,调下max_num_batched_tokens会好很多。代码模型量化损失确实更明显,词表里那些符号token对精度挺敏感的,实在不行就上14B的Q5或者换个更小的专用模型吧。
4楼
2小时前
4090跑13B确实有点勉强,不过你试试AWQ量化,比GPTQ在代码任务上稳不少,我实测长上下文下逻辑断裂少很多。vLLM延迟高估计是没开chunked prefill,长prompt会卡住后面的请求排队。代码模型量化损失确实更敏感,可以考虑7B的DeepSeek-Coder,Q5_K_M量化后24G跑起来很舒服,质量也够用。实在不行就双卡或者上A6000,量化终归是妥协。