最近在实验室的3090(24G)上部署Qwen2.5-7B-Instruct,用的是vLLM框架,FP16精度。模型加载没问题,显存占用大概15G左右,但推理速度实测只有5-6 tokens/s,batch size=1的时候。试过调整gpu_memory_utilization到0.9,也开了enforce_eager=False,提升不明显。看网上有人说同配置能跑到30+ tokens/s,是我哪里配置有问题吗?还是说3090本身就这个水平?有没有遇到过类似情况的朋友,求指点一下方向。
最近在实验室的3090(24G)上部署Qwen2.5-7B-Instruct,用的是vLLM框架,FP16精度。模型加载没问题,显存占用大概15G左右,但推理速度实测只有5-6 tokens/s,batch size=1的时候。试过调整gpu_memory_utilization到0.9,也开了enforce_eager=False,提升不明显。看网上有人说同配置能跑到30+ tokens/s,是我哪里配置有问题吗?还是说3090本身就这个水平?有没有遇到过类似情况的朋友,求指点一下方向。
5 tokens/s确实太离谱了,3090跑7B FP16正常怎么也有30+,查下是不是PCIe带宽或者驱动版本拖后腿了。