最近在试着用LoRA微调Llama3-8B做中文法律问答,数据集是自己整理的几千条问答对,格式参考了alpaca。训练loss能降到0.8左右,但推理时模型经常生成一堆重复的“###”或者无意义符号,偶尔还会蹦出英文。
我用的peft+transformers,学习率设了2e-4,epoch设了3,max_seq_len是1024。看很多教程说这个参数没问题,但我的输出明显崩了。想问问有经验的朋友,这种情况一般是数据预处理的问题(比如模板没对齐),还是微调过头导致灾难性遗忘?或者跟base model的tokenizer有关?
自己调了一周没头绪,求指点排查方向,感谢!