最近在用LangChain + Chroma搭一个私有知识库的RAG服务,文档主要是产品手册和技术规范,大概2000多页PDF。预处理时用了500字符、overlap 50的固定分块,Embedding用的bge-large-zh-v1.5。部署到生产后,用户反馈检索结果经常答非所问,比如问“保修政策”却返回“安装步骤”。我自己测试了top-k=5的结果,感觉召回的片段确实不相关,但单独看这些片段本身又是文档里的正常内容。现在有点迷茫,不知道是分块策略太死板(比如没有按标题/段落切分),还是Embedding对中文长文本支持不够?另外有没有必要先做一下query改写或者混合检索(比如BM25+Rerank)?求有部署经验的前辈指点一下排查思路,谢谢。