最近在做一个基于 ReAct 的 Agent,底层用 PyTorch 2.3 想靠 torch.compile 加速推理。结果发现只要 Agent 在循环里根据工具返回结果动态拼 prompt,再走 LLM 前向,compile 就疯狂 graph break,日志里一堆 “dynamic control flow” 警告,性能反而比 eager 还慢。试过把工具调用那部分拆出去单独 compile,但 KV Cache 的管理又对不上。想问问社区里做 Agent 推理优化的朋友,你们是干脆放弃 compile,还是有什么把动态路由部分静态化的 trick?