最近在折腾MCP(Model Context Protocol)工具服务器,把几个本地推理模型封装成了MCP server,用PyTorch做后端。客户端是多轮对话,每轮都会调一次工具,但跑几轮之后请求就超时了,日志里显示“tool call timeout”。我看了下,单次推理明明很快(1-2秒),但累计到第3、4轮就开始卡死。怀疑是不是PyTorch的显存/线程没释放干净,或者MCP的session状态没处理好?还是说MCP本身就不适合这种高频、有状态的推理场景?求有经验的大佬指点下,换gRPC或者直接REST会不会更稳?