刚用Ollama跑通Qwen2.5-7B,指令遵循还行,但一遇到多轮文档问答就露馅。我试过把历史对话和检索片段全塞进system prompt,结果模型开始复读旧内容,甚至把用户问句当成资料的一部分。后来看教程说要用分隔符和角色标记,我加了<|im_start|>这种,但感觉还是乱。想请教一下,在不开微调的前提下,写长上下文模板时,历史轮次、检索片段、当前问题这三个部分到底按什么顺序组织最稳? 还有,那个“关键信息强调”是放在user里重复一遍有效,还是单独搞个“记忆块”更不容易让模型精分?求实战经验,别甩论文。