最近在把公司的一个Qwen2.5-7B模型部署到内网给业务部门用,用的vLLM,两张3090(24G)做张量并行,量化用的AWQ 4bit。理论上显存占用也就15G左右,但实际跑起来单请求延迟要3-4秒,吞吐才20 tokens/s左右,完全达不到业务要求(他们想要50+)。我已经开了continuous batching,max_num_seqs也调到256了,但还是上不去。GPU利用率看了下只有40%左右,感觉没有吃满。有没有大佬遇到过类似情况?是量化后反而变慢了吗,还是我的并行/调度参数设置有问题?或者是不是该换TensorRT-LLM?现在有点迷茫,求指点方向。