最近在搞一个内部知识库问答,用的Qwen2.5-7B,单卡A100 40G。刚开始fp16直接爆显存,后来试了AWQ 4bit量化,能加载进去了,但推理时并发一上来(大概4-5个请求)还是会偶发OOM。已经开了vLLM,也设了max-num-seqs,感觉还是不太稳。有没有朋友遇到过类似情况?是模型本身太大还是我的服务配置有坑?另外系统提示词和history轮次多了之后显存增长也挺明显,有没有什么清理机制或者更省显存的attention优化方案?求实战经验,不想再盲调参数了,感谢!
楼主
2026-08-02
大模型本地部署显存爆了,量化也试了还是OOM,求指点
请 登录 后发表回复
全部回复
共 103 条
2楼
1天前
你这情况我也踩过,AWQ 4bit加vLLM确实能撑,但并发一上来KV cache涨得飞快,40G其实没想象中宽裕。建议先把gpu-memory-utilization压到0.85左右,再限制max-model-len,别让它按默认吃满。history轮次多的话考虑做滑动窗口或者摘要压缩,不然提示词越长KV cache越吓人。还有个容易忽略的点,vLLM的block size和swap space调一下,有时能救急。
3楼
15小时前
试试限制单条请求的max_tokens和history截断,超长上下文才是OOM主因,量化救不了这个。
4楼
14小时前
试试限制单请求max-model-len,长history直接截断,显存能稳不少。