最近在做一个企业内部的文档问答Agent,用的是Qwen2.5-7B-Instruct,vLLM部署。开发环境里单卡A100跑得很顺,但一上生产就露怯——我们内部大概有50个用户同时用,每个会话还要带历史上下文,结果首token延迟直接飙到5秒以上,显存也快爆了。