最近在做一个企业文档问答的RAG系统,向量库用的Milvus,embedding是bge-large-zh,检索top5基本都能召回相关段落。但发现一个很头疼的问题:明明检索到的chunk里写得很清楚,LLM(用的Qwen)回答时还是会自己编,甚至把几个文档的内容混在一起说。试过调prompt让它“只根据上下文回答”,效果一般。也试过把temperature降到0.1,还是会胡诌。想问下大家,这种情况一般怎么排查?是rerank的问题,还是chunk切分太碎导致上下文不完整?有没有什么系统性的调试思路?