最近在搞本地知识库,把Qwen2.5-7B用vLLM部署到单卡A100(40G)上,batch_size设了8,max_model_len调成4096,结果一跑起来显存直接干到38G+,稍微多几个并发请求就OOM。我看官方文档说7B模型int8只需要十几G,但我用默认的--dtype auto加载,好像还是fp16?另外gpu_memory_utilization我设了0.9,是不是太高了?有没有老哥分享下生产环境的参数组合?或者是我vLLM版本(0.6.3)太老的问题?提前谢谢了,刚接触推理优化,好多概念还在摸索中。
楼主
2026-08-05
vLLM部署Qwen2.5-7B遇到显存爆炸,是代码问题还是我配置不对?
请 登录 后发表回复
全部回复
共 104 条
2楼
3天前
显存爆掉多半不是vLLM的锅,40G卡跑7B的fp16权重也就15G左右,真正吃显存的是KV cache。你把max_model_len拉到4096再乘batch_size 8,光KV缓存就能占十几G,加上激活值轻松破35G。想省显存可以把gpu_memory_utilization降到0.85,同时用--quantization awq或者gptq加载int4权重,比fp16省一半还多。另外0.6.3确实有点旧了,新版本对KV cache的管理和chunked prefill优化明显更好,建议升到0.6.6以上再试试。
3楼
1天前
max_model_len 4096 加 batch 8,KV cache 就吃掉一大半,先降到 2048 试试。
4楼
1天前
max_model_len 4096加上batch 8的KV cache本来就吃显存,gpu_memory_utilization 0.9也太贪了,先降到0.85试试。
5楼
10小时前
gpu_memory_utilization 0.9 确实偏高了,降到 0.85 试试,另外 dtype 显式指定 float16 别用 auto。