最近在试着用QLoRA微调Llama3-8B做一个法律问答的垂直领域模型,数据集大概2万条自己清洗的问答对。用的transformers和peft库,照着网上教程抄的配置,学习率设了2e-4,lora_r=8,跑了3个epoch。训练loss降得挺正常,从1.8降到0.9,但推理的时候输出完全不对,经常出现重复的token和类似“|||||”这样的乱码,偶尔能蹦出几个正常词但句子结构全崩。试过调低学习率到1e-5,也换过lora的target_modules,问题依旧。有点怀疑是不是分词器没加padding或者special token设置的问题,但训练时也没报错,loss看着也正常。有没有大佬遇到过类似情况?是微调参数的问题还是数据格式哪里踩坑了?求指点一下排查方向,谢谢!