最近在试着用LoRA微调Llama3-8B,想让它学会我们公司内部的技术文档风格。训练loss降得挺漂亮,从1.8降到0.7左右,但一测试就发现不对劲——模型输出变得很啰嗦,甚至把一些常识性问题也回答得乱七八糟,感觉“学傻了”。我用的数据集大概5000条QA对,学习率设的2e-4,跑了3个epoch。想问问有经验的前辈,这种情况一般是数据量太少导致过拟合,还是学习率/epoch设置太激进?另外,lora的rank设多少比较合适?我试了8和16,感觉效果差别不明显,有点迷茫。