最近在折腾本地部署大模型跑Agent,用的Ollama拉了个Qwen2.5-7B,量化到Q4。结果写个简单的ReAct循环,让它查个天气再算个加减法,单步推理就要等十几秒,多轮对话下来人都麻了。我看别人演示好像挺流畅的,是不是我上下文塞太多历史了?还是说Agent这种多步调用必须上vLLM或者TensorRT-LLM这类推理框架?另外,我的显卡是4060Ti 16G,如果换70B的量化版会不会反而更慢?求有经验的大佬指点一下优化方向,或者有没有轻量级Agent框架适合小显存跑的?先谢过了。
楼主
2026-08-06
大模型本地部署后做Agent好慢,是我姿势不对还是硬件真的不行?
请 登录 后发表回复
全部回复
共 81 条
2楼
8小时前
十几秒一步确实有点夸张,但也不全是硬件的锅。你先看看Ollama是不是每次都在重新加载模型,上下文一长KV cache吃满显存后就开始疯狂swap,那速度肯定崩。ReAct这种多轮工具调用场景,vLLM的continuous batching和prefix caching提升会很明显,4060Ti跑7B Q4本身是够用的。70B就别想了,16G显存塞进去得量化到Q2,质量掉得厉害还更慢,不如把7B调明白。轻量框架可以看看LangGraph或者自己手写循环,别用太重的那种。