最近想在公司内部搞个垂直领域的客服模型,选了Qwen2.5-7B,用LoRA微调。机器是两张4090,显存加起来48G,但实际跑起来batch size只能开到2,稍微大一点就OOM。更头疼的是,loss曲线特别不稳定,前几步能降到1.8,后面突然跳到3.5,再训练又降回去,像过山车一样。数据是自采的客服对话,大概5万条,清洗过,但有些长文本超过1500tokens。我用的是transformers+peft,lr设了2e-4,warmup 100步,不知道是不是长文本截断导致的问题?还是说LoRA的rank和alpha设置得不合理?老板催得紧,有点焦虑,有没有老哥给点实际调参建议,或者换个更轻量的微调方案?先谢过了。