7B模型LoRA微调实录:显存8G→6.2G的QLoRA榨干每一兆显存
本文记录基于ChatGLM3-6B的LoRA/QLoRA微调全过程。通过bitsandbytes的4bit NF4量化+LoRA(秩=8,alpha=16),将单卡显存需求从全参微调的84G压至6.2G,在单张RTX 3090上完成医疗问答任务微调。训练3个epoch后,BLEU从13.8提升至22.4,但发现灾难性遗忘问题——通用能力下降11.7%。文中给出完整的量化配置、训练脚本、loss曲线

专注于AI应用开发的工程化与业务落地。持续实践数据治理与评测、智能体工作流设计,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。
本文记录基于ChatGLM3-6B的LoRA/QLoRA微调全过程。通过bitsandbytes的4bit NF4量化+LoRA(秩=8,alpha=16),将单卡显存需求从全参微调的84G压至6.2G,在单张RTX 3090上完成医疗问答任务微调。训练3个epoch后,BLEU从13.8提升至22.4,但发现灾难性遗忘问题——通用能力下降11.7%。文中给出完整的量化配置、训练脚本、loss曲线
微调一个7B模型(这里以Qwen2-7B-Instruct为例)从全参到LoRA再到QLoRA,显存占用从24G+一路压到6.2G,但推理效果在特定任务上却出现了分化。本文记录了完整的微调流程:数据预处理(1.2万条指令数据)、训练配置(LoRA rank=64, alpha=128)、loss曲线分析,以及微调前后在代码生成和数学推理上的效果对比。结论:QLoRA在4-bit量化下训练,推理质量
一个内部报表接口因串行调用三次外部HTTP服务,高峰期平均延迟2.8秒,F5健康检查频繁超时。用asyncio搭配aiohttp重写后,在Python 3.8.10、单机4核8G环境下,接口P95延迟从3100ms降至420ms,QPS从120提升至850,CPU峰值反而下降15%。本文记录了从同步到异步的完整改造过程,包括Semaphore限流、超时控制、连接池复用等关键细节,以及两个隐藏极深的
用一张3090显卡,花3小时微调开源7B模型,让它在特定指令任务上的准确率从68%提升到91%。本文将完整记录使用LoRA/QLoRA微调ChatGLM3-6B的过程,从数据清洗、训练配置、损失曲线分析到推理效果对比,包含可复现的代码和踩坑记录。不吹不黑,只看具体参数和实测数字。