最近在搞本地知识库问答,用的Qwen2.5-7B,嵌入模型用的bge-m3。数据量大概几十万条文本分片,目前用Chroma存的向量,但检索速度越来越慢,而且感觉召回率一般。看了Milvus和Weaviate,但部署起来感觉有点重,还要配etcd那些。想问问各位,有没有轻量一点但性能靠谱的方案?或者Chroma是不是我哪里配置没调好?另外,混合检索(向量+关键词)是不是必须的?求指条明路,不想在基建上耗太多时间。
最近在搞本地知识库问答,用的Qwen2.5-7B,嵌入模型用的bge-m3。数据量大概几十万条文本分片,目前用Chroma存的向量,但检索速度越来越慢,而且感觉召回率一般。看了Milvus和Weaviate,但部署起来感觉有点重,还要配etcd那些。想问问各位,有没有轻量一点但性能靠谱的方案?或者Chroma是不是我哪里配置没调好?另外,混合检索(向量+关键词)是不是必须的?求指条明路,不想在基建上耗太多时间。
几十万分片用Chroma确实会有点吃力,它更适合小规模快速验证。可以试试Qdrant,单机Docker就能跑,不用etcd那些,性能比Chroma好不少,迁移成本也低。混合检索我觉得挺有必要的,纯向量对关键词匹配确实弱,尤其专有名词多的时候,BM25加向量召回率提升很明显。