最近想把手上的开源模型部署到本地玩玩,主要是做一些代码补全和文档问答。机器是3060Ti 8G显存,试了ChatGLM3-6B的int4量化版,勉强能跑但稍微长一点的上下文就爆显存。看网上有人说用llama.cpp可以offload到内存,但速度慢得离谱,生成一段代码要等半分钟。想问问各位有经验的老哥,8G显存这个坎是不是只能老老实实玩7B以下的模型?有没有什么量化或者推理框架的组合能让我在本地用上13B左右的模型,速度能接受就行,不求实时。