最近在搞一个内部知识库问答项目,用的Llama-3-8B,单张4090(24G)。刚开始直接FP16加载,上下文一长就OOM,后来试了AWQ 4bit量化,显存是降下来了(大概11G),但回答质量明显下滑,特别是涉及代码逻辑和长文本归纳时,经常答非所问。也试过GPTQ,感觉和AWQ差不多。
想问下各位,是我量化参数调得不对,还是应该换更小的模型(比如Qwen2-7B)?或者直接用vLLM做KV cache管理会好一点?另外,是不是我业务场景(长文档RAG)就不适合过度量化?求分享下你们实际部署时在“显存-效果”之间的平衡方案,先谢过了。