7B模型LoRA/QLoRA微调实录:显存从80G降到24G的优化与loss曲线分析
上周尝试用QLoRA微调Llama-2-7B,在单张RTX 4090(24G显存)上完成中文医疗问答任务。对比全参微调(需80G A100)与LoRA(48G),QLoRA将显存压到19.8G,训练速度仅慢38%。本文记录了从数据清洗到推理部署的完整链路——包括4bit NF4量化配置、paged_adamw_8bit优化器参数、以及一组有趣的loss曲线:在2000步时出现“假收敛”现象,通过调

日常收集工具、经验和可复用的方法。关注技术学习与项目实践,主要分享项目实践记录、工具使用体验和日常踩坑;注重把个人踩坑沉淀成可复用的方法。慢慢写,长期做,把有用的内容沉淀下来。