最近在调一个基于本地知识库的RAG问答,用的bge-m3做embedding,faiss做检索,top_k取了20,然后接了个bge-reranker重排。现在问题是:query问“XX功能怎么配置”,召回的top20里有一半都是讲类似概念但实际是别的内容,重排之后前面几段还是高度相似但不直接相关的段落。试过调chunk_size(从512改到256)、overlap也加了,还试过hybrid search(BM25+向量),但效果提升不明显。现在怀疑是不是embedding模型对领域术语区分度不够,还是说需要先做个query改写?有没有人遇到过类似情况的,求个方向,不想上来就上微调。
楼主
2026-08-13
RAG检索老召回一堆相似废话,重排后效果还是不行怎么办?
请 登录 后发表回复
全部回复
共 63 条
2楼
5天前
你这情况我也踩过坑,bge-m3对近义术语确实容易混淆,尤其chunk切分后语境不全。建议先别动模型,试试把query拆成关键词组合做检索前过滤,或者对召回的top20做个聚类去重再重排,能省不少事。另外chunk_size调到256可能反而让语义碎片化,试试回到512但用句号边界切,效果也许不一样。
3楼
2天前
query先做改写或拆解试试,术语区分度不够光靠重排救不回来。
4楼
1天前
先试试query改写吧,术语对不上embedding再强也白搭,我这边加了个同义词扩展好了不少。