最近在跟着教程用VLLM部署Qwen2.5-7B-Instruct做API服务,我显卡是4090 24G。之前用AutoModel直接加载推理,开bf16大概占14G左右,跑得很顺畅。但换成VLLM的LLM(model=path)之后,启动就报CUDA OOM,试了加--gpu-memory-utilization 0.8也没用,看日志好像是把KV cache和权重全塞进去了?不太理解为什么VLLM显存占用反而比原生推理高这么多,是哪里没配对吗?比如需要手动指定max-model-len或者把tensor parallel关掉?求有经验的朋友指点一下,网上搜了一圈都是讲A100的,我这种消费级卡是不是更适合用ollama之类的?