最近在搞一个RAG项目,用LoRA微调了Llama 3 8B,微调完导出合并权重后,尝试用vLLM部署到本地一张4090(24G)上。模型量化用的AWQ 4bit,按理说显存占用才7G左右,但实际推理时每秒只能出6-7个token,比我预想的慢太多。我看别人部署同档次模型都能到30-40 token/s。已经确认过vLLM版本是0.5.3,也设置了gpu_memory_utilization=0.9,但感觉它好像没把KV cache用满。想问问是我的量化格式和vLLM兼容性有问题,还是需要额外开启什么并行参数?或者干脆是LoRA合并时权重没处理干净,导致模型结构残留了原版某些慢路径?求有经验的老哥指点一下排查方向,现在卡在这边项目进度完全动不了。