最近在跑一个法律文书摘要的生成任务,基座用的Qwen2.5-7B,用LoRA(r=16, alpha=32)在几千条裁判文书上微调。效果倒是出来了,但发现模型对通用问答能力下降得厉害,比如问它“今天天气怎么样”都会往法律条文上扯。我试过降低学习率到1e-5,也加了5%的通用指令数据做混合,还是没明显改善。看了一些帖子说可能是LoRA作用层数或者秩的问题,但我不太确定该怎么诊断。有没有大佬遇到过类似情况?是继续加大通用数据比例,还是应该调整LoRA的超参,或者干脆换全量微调?顺便问下,有没有什么评估指标能量化“遗忘”程度,而不是光靠人工感觉?谢谢!