最近在搭一个文档问答的RAG系统,用的是LangChain + 开源Embedding模型。现在的情况是,文档内容其实都能检索到,但排到最前面的几个chunk常常不是真正包含答案的那几段,导致LLM回答容易编。我试过调top_k、换相似度算法,效果都不明显。我现在是按固定500字符硬切的,带一点重叠。想问问大家,是不是这种通用文档不太适合固定窗口切块?有没有什么更合理的切块策略,或者需要结合文档结构(比如标题、段落)来做?顺便问下,重排序(rerank)是不是必须上的?目前预算有限,想先搞清楚优先级。先谢谢各位了。