刚把用LoRA微调好的Qwen2.5-7B接到FastAPI上做本地服务,显卡是4090(24G),加载的是4bit量化版,显存占用才11G左右。但测试单轮对话时发现生成速度只有每秒2-3个token,CPU和GPU利用率都不到30%,感觉不对劲。网上看别人部署同尺寸模型都能到10+ token/s,想问问是哪里出了问题——是FastAPI异步处理没写对吗?还是说量化+LoRA合并后的权重反而拖慢推理?或者需要调vLLM或者TGI这类专用框架?有没有大佬指点下排查方向,万分感谢。