最近在本地用FastAPI + vLLM部署了个Qwen2.5-7B,想接个Agent做数据库查询和API调用。用的是LangChain的ReAct框架,但每次工具调用返回稍微慢一点(比如查库要2-3秒),模型就直接超时或者跳过工具瞎编答案。调大了max_execution_time也没用,日志里看到是tool calling的response parsing卡住了。想问下各位大佬,生产环境部署Agent时,工具调用的超时和重试到底该怎么设计?是换框架还是得自己写调度层?有点迷茫,求指点。