最近想本地跑Qwen2.5-72B做长文本总结,查了一圈资料有点懵。有的说4张A100够,有的说8张才稳,还有人说用GGUF量化能压到单卡。我试了AWQ 4bit量化,加载时显存直接飙到60G+,用的vLLM,batch_size已经调到1了,上下文长度设8k,还是OOM。看日志好像KV cache占了大头。有没有实际部署过的老哥,说下你们的生产配置?另外,如果换成70B的Llama3,显存压力会小一点吗?或者有没有什么技巧,比如offload到CPU,但推理速度慢到什么程度?求真实数据,别让我瞎试了,实验室经费有限。
楼主
21天前
部署Qwen2.5-72B到底要几张卡?显存爆了求老哥指点
请 登录 后发表回复
全部回复
共 21 条
2楼
7小时前
72B的AWQ 4bit光权重就差不多40G了,你8k上下文KV cache在vLLM里按fp16算,72层每层8个KV头,8k长度大概还要十几G,60G+很正常。4张A100 80G跑AWQ 4bit加8k上下文是够的,但并发基本别想,想稳一点还是8卡。Llama3 70B压力差不多,别指望省多少。真要省钱就上GGUF Q4_K_M配llama.cpp,offload部分层到CPU,速度大概掉到每秒几个token,做离线总结能忍,交互就算了。