最近在做一个小的 Agent demo,用的是 ReAct 那套 Thought/Action/Observation 循环。发现如果 prompt 里强制要求每步都输出 Thought,模型有时候会编一些看起来合理但实际没用的推理,反而干扰后面的 Action;但如果不强制,直接让它出 Action,多步任务又容易跑偏。试了 few-shot 里加 CoT 示例、也试了在 system prompt 里写「先思考再行动」,效果都不太稳定。想问问大家实际做 Agent 的时候,Thought 这块是怎么处理的?是必须显式输出,还是靠模型内部推理就行?有没有比较稳的 prompt 模板参考一下?