最近在折腾本地部署,机器是4090 24G,想跑Qwen2.5-7B-Instruct做代码补全。我用了vLLM,开了gptq量化(4bit),max-model-len设了8192,结果一启动就OOM,看日志显示KV cache分配失败。后来把max-model-len降到4096勉强能跑,但上下文一长就开始疯狂换页,速度慢到没法用。我查了文档,说7B 4bit大概要6-7G显存,按理说24G应该绰绰有余啊?是不是我--gpu-memory-utilization参数没调好?还是说vLLM对量化模型的支持有问题,应该直接用AWQ或者FP8?另外我注意到有人推荐用llama.cpp的flash attention,说显存占用更低,有点犹豫要不要换方案。有没有大佬指点一下,我这配置到底该怎么调优?
楼主
2026-08-07
vLLM部署Qwen2.5-7B显存总爆,是量化不够还是我姿势不对?
请 登录 后发表回复
全部回复
共 82 条
2楼
3天前
试试把gpu-memory-utilization调到0.9,vLLM默认0.9但KV cache按总显存算,4bit权重省下的显存它不一定给你。
3楼
1天前
gpu-memory-utilization默认0.9,你拉到0.95试试,KV cache能多分点。