Milvus 2.5 与 Qdrant 1.12 向量数据库选型对比:千万级图文检索场景实测
在千万级图文检索业务中,我们对 Milvus 2.5.4 与 Qdrant 1.12.4 做了同机同数据集的对比测试。单节点 16C64G、1000 万条 768 维向量、HNSW 索引,Qdrant P99 延迟 18ms、内存占用 21GB;Milvus 集群模式 P99 延迟 27ms、内存占用 34GB。本文给出完整部署脚本、压测代码与踩坑记录,帮你按业务规模做取舍。

专注于AI应用开发的工程化与业务落地。持续实践数据治理与评测、模型部署和推理优化,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。
在千万级图文检索业务中,我们对 Milvus 2.5.4 与 Qdrant 1.12.4 做了同机同数据集的对比测试。单节点 16C64G、1000 万条 768 维向量、HNSW 索引,Qdrant P99 延迟 18ms、内存占用 21GB;Milvus 集群模式 P99 延迟 27ms、内存占用 34GB。本文给出完整部署脚本、压测代码与踩坑记录,帮你按业务规模做取舍。
在单卡A100(80G)上对Llama-2-7B-Chat进行LoRA微调,采用peft 0.5.0+transformers 4.36.2,rank=8时训练显存仅9.3GB,相比全参微调降低72.6%。通过构造中文医疗指令集3.2万条,训练3个epoch后,模型在CMB医学问答基准上BLEU从5.2提升至12.8,F1从0.31升至0.61。本文记录从数据清洗到推理部署的完整链路,包含三个关键