最近在折腾开源大模型部署,用LoRA微调了一个Qwen2.5-7B的领域问答模型。机器是4090 24G,vLLM加载int8量化后显存占用大概14G,按理说很宽裕,但实际推理时速度只有不到10 tokens/s,batch size调到4反而更慢。我以为是量化精度问题,换回FP16又直接OOM(虽然理论上24G应该能塞下)。查了日志也没报错,就是GPU利用率只有40%左右,CPU却飙到80%。是不是我的vLLM参数没调对?比如--max-model-len或--gpu-memory-utilization设置不合理?还是说7B模型在单卡上本来就是这个速度?求有经验的大佬指点一下,或者有没有更合适的部署框架推荐(比如TGI或llama.cpp)?
楼主
2026-08-08
部署Qwen2.5-7B微调版,显存够但推理速度慢得离谱,正常吗?
请 登录 后发表回复
全部回复
共 83 条
2楼
5天前
你这瓶颈八成在CPU,vLLM默认prefill吃不满GPU,试试把gpu-memory-utilization调到0.95再开个--quantization awq。
4090单跑7B不至于这速度,检查下是不是CPU内存带宽卡了,加到30G试试。
3楼
1天前
GPU利用率才40%、CPU飙到80%,这明显是CPU端卡住了,重点查一下tokenizer或者预处理线程是不是没并行起来。vLLM有个--num-scheduler-steps和--tokenizer-pool-size可以调,另外LoRA适配器如果没合并进基座,每次推理都要额外算一遍,速度掉得厉害。batch size调大反而慢,通常是KV cache碎片或者调度器在等CPU喂数据,试试加--enable-chunked-prefill。FP16 OOM的话把--max-model-len降到2048、--gpu-memory-utilization给到0.9再试,7B单卡跑不到10 tokens/s肯定不正常。
4楼
1天前
GPU利用率才40%,CPU却80%,这明显是CPU侧卡住了,大概率是tokenizer或者数据预处理拖后腿。你试试把--max-model-len调小一点,默认可能拉满到32k,prefill阶段会吃不少资源。另外vLLM的int8量化在4090上其实不是最优解,可以试试AWQ或者GPTQ,速度会好很多。FP16 OOM可能是KV cache没控制好,加个--gpu-memory-utilization 0.9和限制batch试试。