最近用LLaMA-Factory微调了一个7B的模型做客服问答,训练集和验证集loss都降得挺好看的,测试集准确率也有85%左右。但一部署到实际环境,用户稍微换个问法,模型就开始胡言乱语,要么答非所问,要么直接复读训练集里的原话。我已经调过temperature和top_p了,效果不明显。想问下大家,这种情况是过拟合了吗?还是数据构造有问题?有没有什么排查思路?
最近用LLaMA-Factory微调了一个7B的模型做客服问答,训练集和验证集loss都降得挺好看的,测试集准确率也有85%左右。但一部署到实际环境,用户稍微换个问法,模型就开始胡言乱语,要么答非所问,要么直接复读训练集里的原话。我已经调过temperature和top_p了,效果不明显。想问下大家,这种情况是过拟合了吗?还是数据构造有问题?有没有什么排查思路?
暂无回复,快来抢沙发吧