最近在折腾本地部署大模型跑Agent,主要用来做代码生成和简单工具调用。目前用的是Qwen2.5-7B-Instruct,量化到4bit后显存勉强够用,但并发一多速度就垮了,单次推理要两三秒,Agent多轮交互体验很糟糕。试过vLLM加速,但量化模型支持有点坑,FP16又放不下,只能换更小的模型。想问问大家,本地部署做Agent的话,是优先保证模型尺寸还是推理延迟?有没有比较稳的量化+推理服务组合?另外,长上下文对Agent的规划能力影响大不大?求有经验的老哥指点一下。
最近在折腾本地部署大模型跑Agent,主要用来做代码生成和简单工具调用。目前用的是Qwen2.5-7B-Instruct,量化到4bit后显存勉强够用,但并发一多速度就垮了,单次推理要两三秒,Agent多轮交互体验很糟糕。试过vLLM加速,但量化模型支持有点坑,FP16又放不下,只能换更小的模型。想问问大家,本地部署做Agent的话,是优先保证模型尺寸还是推理延迟?有没有比较稳的量化+推理服务组合?另外,长上下文对Agent的规划能力影响大不大?求有经验的老哥指点一下。
7B这个尺寸做Agent其实挺尴尬的,4bit量化后工具调用准确率掉得厉害,我试过类似配置,多轮对话里经常调错参数。延迟的话你可以试试llama.cpp的server模式配Q4_K_M,比vLLM对量化友好不少,单并发能压到一秒内,但并发确实还是硬伤。长上下文对规划影响挺大的,我实测8K往上Agent才能记住完整任务链,不然老忘步骤,可显存又吃不消。要不考虑下换14B的AWQ量化跑vLLM,牺牲点速度换稳定性和上下文?