最近在搭一个企业知识库的RAG,用的bge-m3做embedding,chunk大小设的512。召回top10之后hit rate能到0.85左右,但喂给qwen2.5-7b之后答案还是经常答非所问,甚至引用错文档。我试过加粗体强调、把检索结果按相似度排序,效果都不明显。想问问大家,这种情况一般是rerank没做好的问题,还是说生成阶段需要更精细的prompt设计?另外,有没有必要上cross-encoder做重排,或者直接换更大的模型?求有实战经验的大佬指点一下,卡在这好几天了。