最近在 Ubuntu 上用一张 4090 试着部署 Qwen2.5-7B-Instruct,用的是 transformers + accelerate,模型加载正常,显存占用大概 15G 左右,但生成速度只有 5-8 tokens/s,感觉不太对劲。我试过设置 torch_dtype=torch.float16,也装了 flash-attn,但速度没明显变化。看别人说 4090 跑 7B 应该能到 30+ tokens/s,有点迷茫。是我没用 vLLM 或 llama.cpp 这类推理框架的原因吗?还是 batch size、max_new_tokens 这些参数没设对?求有经验的老哥指点一下,感谢!