最近在搭一个本地知识库问答,用的Chroma+LangChain。一开始用的OpenAI的ada-002,效果还行,但为了省钱换了开源的BGE-large-zh,结果检索出来的top5相关度明显变差,很多明明在文档里写得很清楚的答案都召不回来。我已经把chunk size从500调到200,也试了overlap,还是不行。想问问大家,换Embedding模型之后是不是必须重新调整个pipeline?还是说我应该直接改检索策略(比如换成混合检索)?有没有什么通用的调试思路,还是说只能一个个试?有点迷茫,求指点。