最近在试着用LoRA微调一个7B的底座模型,想让它学会某种特定文风。数据集是自己整理的几百条对话,格式也按模板对齐了。训练完loss降到挺低,但一测试就发现,模型输出的内容很死板,甚至有些语句重复,而且稍微超出训练范围的话题就开始胡说八道。对比原模型,感觉能力反而退化了。想问问大家,是不是我的超参数设置有问题?比如学习率、rank值,或者epoch次数?还是说数据量太少、多样性不够?另外,微调后需不需要混合一些通用数据来防止灾难性遗忘?有点迷茫,求有经验的大佬指点一下排查方向。