最近在试着部署一个70B的LLaMA模型做推理,结果发现单张A100 80G根本塞不下。我用的是FP16加载,但光模型参数就占了130G左右,更别说还有KV cache和中间激活了。我知道可以用量化或者模型并行,但对具体实现不太清楚。比如bitsandbytes的4bit量化会不会掉点很严重?还有,用DeepSpeed的ZeRO-3做多卡推理时,是不是每个卡都要装一个完整的模型副本?我目前手头只有两张A100,实在不想买新卡了。求各位大佬指点下性价比最高的方案,或者推荐一些能跑起来的开源工具链。先谢过了!
楼主
2026-07-19
新手求教:用PyTorch跑70B大模型,显存不够还能怎么抢救一下?
请 登录 后发表回复
全部回复
共 184 条
2楼
5天前
建议直接用vLLM+张量并行,两张卡刚好能塞下70B,比bitsandbytes稳得多。
3楼
1天前
两张A100可以试试vLLM加AWQ量化,70B跑int4差不多够用,掉点比想象中小。
4楼
11小时前
两张A100的话,建议优先试vLLM加AWQ 4bit量化,70B差不多能压到40G以内,单卡就能跑,另一张卡还能专门留出来扛并发。bitsandbytes的NF4掉点其实还好,日常对话基本感知不到,但代码和数学任务确实会弱一些,看你的使用场景了。ZeRO-3推理不是每张卡放完整副本,它是把参数切片分散存,但通信开销不小,两张卡跑70B延迟会比较难受。你这情况性价比最高的还是量化加vLLM,别折腾DeepSpeed推理了。
5楼
11小时前
两张A100试试llama.cpp的4bit量化,基本不掉点还省显存,比DeepSpeed折腾起来省心多了。