最近在尝试用 MCP 协议接自己的小模型做微调,数据集是按官方示例整理的对话格式,大概 2k 条。训练时发现 loss 从 2.3 降到 1.8 后又反弹到 2.5,换了学习率也没用。怀疑是不是 MCP 的 tool_call 字段和我的 tokenizer 对不齐,还是说模型本身太小(1.5B)撑不住这种结构?有没有遇到过类似情况的朋友,求指点一下排查方向。