最近想试试本地跑代码补全,看大家吹Qwen2.5-Coder很强,就下了个7B的GGUF量化版,用Ollama加载。结果我的笔记本是RTX 4060 8G显存,模型刚加载就占了6.5G,稍微写长一点代码就开始疯狂swap,卡成PPT。
最近想试试本地跑代码补全,看大家吹Qwen2.5-Coder很强,就下了个7B的GGUF量化版,用Ollama加载。结果我的笔记本是RTX 4060 8G显存,模型刚加载就占了6.5G,稍微写长一点代码就开始疯狂swap,卡成PPT。
8G显存跑7B确实有点勉强,我之前用4060试过,上下文一长就爆。后来换成了DeepSeek-Coder的1.3B版本,量化后只占1.5G左右,补全速度飞快,质量也够日常用。你要是不追求复杂推理,可以试试StarCoder2的3B,比7B轻不少,显存压力小很多。或者干脆用LM Studio调小n_ctx和batch size,能省出不少空间。