Milvus与Qdrant选型实测:千万级向量检索下的部署与资源博弈
在电商以图搜图业务中,面对1000万条768维向量,Milvus 2.4与Qdrant 1.9在同等硬件下表现迥异。Milvus靠Knowhere索引库在查询延迟上胜出(P99 12ms vs 18ms),但Qdrant的Rust底层将内存占用压低了近40%。本文给出双系统的Docker Compose部署、压测脚本及调参全过程,并曝光一个Milvus的段文件合并坑——不处理的话,写入吞吐会直接腰

把零散灵感沉淀为可复用的方法,关注技术学习与数字生活,记录知识体系搭建、学习路径整理和真实实践中的思考;习惯用项目结果检验技术判断。技术会变化,解决问题的方法值得长期积累。
在电商以图搜图业务中,面对1000万条768维向量,Milvus 2.4与Qdrant 1.9在同等硬件下表现迥异。Milvus靠Knowhere索引库在查询延迟上胜出(P99 12ms vs 18ms),但Qdrant的Rust底层将内存占用压低了近40%。本文给出双系统的Docker Compose部署、压测脚本及调参全过程,并曝光一个Milvus的段文件合并坑——不处理的话,写入吞吐会直接腰
在私有知识库问答项目中,基线RAG体系(BGE-large + 固定256字chunk)的Hit@5召回率仅61.3%,答案准确率不足五成。本文记录完整调优链路:通过自适应chunk(按Markdown标题与段落切分,窗口重叠64字)将召回率提升至74.8%;切换bge-m3 embedding(输出维度1024)后召回率升至81.2%,但引入bge-reranker-large进行二阶段精排后,
本文详细讲解如何利用LangChain框架与DeepSeek大模型,结合本地文档构建RAG知识库。从环境配置、文档切分、向量存储到检索问答,全程附带代码示例与踩坑记录,适合AI开发者直接上手实践。