最近在搞llama2-70B的本地部署,手头有4张A100(40G),用vLLM加载FP16版本,不管怎么调tensor-parallel-size都报OOM,后来改用AWQ 4bit量化勉强跑起来,但生成质量明显下降,尤其是中文长文本逻辑混乱。我看了半天官方文档,说是要开--quantization参数配合GPTQ,但试了还是不行。想问问有经验的老哥:是不是我加载方式有问题?还是说40G单卡根本玩不动70B?如果非要本地跑,有什么靠谱的量化方案或者offload策略推荐吗?不求速度,只求别崩,能跑通就行。
楼主
25天前
4张A100部署70B模型老爆显存,量化后效果又拉胯,求指点
请 登录 后发表回复
全部回复
共 42 条
2楼
4天前
FP16跑70B本来就要80G往上,4卡40G得开offload或者换KV cache量化,纯靠tensor parallel肯定爆。
AWQ掉精度正常,试试GPTQ配vLLM的--kv-cache-dtype=fp8,能省不少显存,中文长文本逻辑会稳一些。
3楼
6小时前
70B的FP16权重就要140G,4张40G卡扣掉KV cache和框架开销确实悬,tp=4也不一定稳。AWQ掉点挺常见,尤其长中文,试试GPTQ-Int4的group_size=128加act-order,比AWQ稳一些。真要保质量可以上8bit,或者用两张卡跑量化+CPU offload,慢是慢但基本不崩。vLLM那会版本对70B量化的支持也有限,建议换最新版或者试试llama.cpp的Q4_K_M。