最近想自己微调一下Qwen2.5-7B模型做垂直领域任务,用的两张4090,显存24G。试了LoRA,batch_size调到1,gradient_accumulation_steps也设了4,但跑不到几百步就OOM。看HuggingFace官方文档说用bitsandbytes量化到4bit可以省显存,加载是成功了,但训练时loss反而比fp16高不少,不知道是不是我参数设错了?另外,有没有必要用DeepSpeed ZeRO Stage 2或者3?看网上说两张卡用Stage 2效果不大,但显存确实紧张。有没有老哥分享下实际能跑起来的配置,或者换个更小参数的模型(比如1.8B)会不会更适合新手入门?求指点,感谢!