最近在做一个基于RAG的问答Agent,用的LangGraph+向量库。单轮查询效果还行,但一旦用户连续追问,比如先问“A公司财报”,再问“他们的毛利率呢”,我就得把历史query和当前query一起塞给检索器。结果发现两个问题:一是塞太多历史,检索出来的chunk相关性明显下降;二是LLM的context窗口被历史记录和检索结果挤爆,回答反而变蠢。试过只保留最近一轮,但有些指代又丢了。想问下各位,你们在做Agent+RAG的时候,上下文管理这块是直接截断,还是有什么类似query改写或者记忆压缩的技巧?希望有实际项目经验的朋友指点下,感激不尽。