最近在搞一个私有代码库的补全模型,基于Llama3-8B,用的peft的LoRA,rank设的16,alpha设的32,训练数据是自己爬的几千条项目里的函数级代码片段,按官方模板格式化过。batch size调到1,gradient accumulation设4,显存还是能吃到20G+,用的是单卡4090。更头疼的是,eval loss降到1.2左右就开始回升,验证集上的bleu也一直上不去。我怀疑是不是数据量太小,或者LoRA只微调了attention层不够?也试过把学习率从2e-4降到1e-5,但效果不明显。有没有大佬分享下成功的经验,比如数据增强还是该换更小的基座模型?或者干脆用QLoRA加4bit量化?现在整个人有点懵,感觉微调不是简单堆参数就能搞定的事……