RAG召回率从61%到89%:chunk重构与Embedding选型全记录
一个月前,我们内部知识库问答系统的准确率卡在61%,用户问“A类设备保修政策”,系统总召回一段关于B类设备报废流程的废话。经过对chunk切分策略的三轮调整、Embedding模型从bge-small切换至bge-m3,再引入BGE-reranker-v2-m3后,最终在1287条真实测试集上,Recall@5从61.2%提升至89.4%,答案相关度人工评分从3.1分升至4.5分。本文记录完整优化

正在把零散知识连接成完整能力。当前重点关注移动端开发,通过性能优化、问题排查与调试持续提升能力;倾向用真实案例代替空泛结论,并把过程整理成可复用的学习记录。
一个月前,我们内部知识库问答系统的准确率卡在61%,用户问“A类设备保修政策”,系统总召回一段关于B类设备报废流程的废话。经过对chunk切分策略的三轮调整、Embedding模型从bge-small切换至bge-m3,再引入BGE-reranker-v2-m3后,最终在1287条真实测试集上,Recall@5从61.2%提升至89.4%,答案相关度人工评分从3.1分升至4.5分。本文记录完整优化
在处理2500万条768维向量、QPS峰值要求800+的RAG生产环境中,我先后用Milvus 2.4.1和Qdrant 1.9.2搭建了检索服务。实测结果:Milvus在16C32G配置下P99延迟9.2ms,Qdrant同样配置P99延迟14.7ms;但Qdrant的磁盘占用仅为Milvus的41%。本文用真实部署步骤、参数调优和压测数据,讲清楚两者在资源瓶颈和查询模式上的本质差异,帮你避开选