最近在做一个内部知识库的Agent,用Llama-3-8B做底模,自己攒了几千条工具调用的SFT数据(包含意图识别、参数抽取和ReAct格式的推理轨迹),LoRA微调后单轮测试效果还行,但一放进Agent循环里就各种翻车:明明只该调搜索工具,它非要先自己编一段答案;多轮对话里工具结果回来了,它又开始复读之前的错误调用。我检查了数据,格式和官方示例差不多,也做了system prompt固定。想问问有经验的大佬,这种多步工具调用的稳定性,是靠堆高质量轨迹数据硬调,还是应该在解码策略、或者让模型学会“质疑”工具结果上做文章?另外,几千条数据是不是本身就太少了?求指条明路。