LoRA微调7B大模型全流程:从数据构建到推理效果对比
本文记录了我在单张24G显存显卡上,用LoRA/QLoRA微调Qwen2.5-7B-Instruct的完整过程。训练数据为3200条垂直领域问答对,采用4-bit量化+LoRA(r=16, alpha=32),训练3个epoch,最终loss从1.82降至0.63。文中包含数据格式、训练配置、loss曲线分析、推理效果对比,以及显存溢出、loss震荡等踩坑记录,适合想动手微调7B模型的开发者参考。

主要整理后端开发相关的学习笔记与工程经验,内容覆盖分布式系统、项目落地经验。坚持先理解原理,再讨论工具,希望把复杂问题讲清楚、把实践步骤写完整。
本文记录了我在单张24G显存显卡上,用LoRA/QLoRA微调Qwen2.5-7B-Instruct的完整过程。训练数据为3200条垂直领域问答对,采用4-bit量化+LoRA(r=16, alpha=32),训练3个epoch,最终loss从1.82降至0.63。文中包含数据格式、训练配置、loss曲线分析、推理效果对比,以及显存溢出、loss震荡等踩坑记录,适合想动手微调7B模型的开发者参考。
线上Java服务在Docker容器中运行一周后突然频繁Full GC,导致接口超时飙升。本文从JVM参数、容器内存限制、GC日志分析入手,最终定位到Swap与CGroup内存限制不匹配的问题,并给出修复方案。