最近在搭一个轻量级Agent玩,用的Qwen2.5-7B-Instruct接Function Calling,任务就是让它在几个API之间做简单判断(比如查天气→根据结果推荐穿衣)。但发现它经常不按预设的tool schema走,有时候明明该调用search,它却自己脑补一个结果返回给我。甚至偶尔会把上一步的tool结果和用户query搞混,逻辑链条一长就崩。我已经按官方示例写了system prompt和few-shot,温度也调低了,但还是不稳定。想请教下各位,这种情况主要是7B模型本身的指令跟随上限就这样,还是说我的agent循环设计(比如上下文裁剪、错误重试机制)不到位?有没有用同档位模型做Agent调通的大佬分享下经验?