最近在做一个基于RAG的客服Agent,发现多轮对话场景下效果很差。比如用户先问“退换货政策是什么”,我检索到了相关文档;接着用户问“那运费谁出”,这时候检索就完全跑偏了,召回的都是不相关的物流文档。我试过把上一轮的检索结果拼到当前query里,结果又引入了噪音,模型开始答非所问。想请教一下大家,多轮RAG到底该怎么处理历史上下文和检索的关系?是每轮都重新检索,还是维护一个对话级的向量摘要?有没有比较成熟的做法?