最近在做一个本地知识库Agent,想让模型学会调用几个内部API(查库存、下单那种)。我用了Llama3-8B,拿几百条工具调用的对话数据做了LoRA微调,R=8,alpha=16,训练了3个epoch。问题是:模型有时候能正确输出function_call,有时候又直接开始瞎编回复,哪怕输入格式完全一样。感觉像在抽风。我试过加大数据集到2000条,也调过学习率,但还是时好时坏。想问问有没有人遇到过类似情况?是不是我的数据格式里tool的定义方式有问题?还是说8B模型本身做这种结构化输出就不太靠谱,得上更大的模型或者换Qwen?求指点,有点迷茫。