最近把微调好的Qwen2.5-7B部署到线上(vLLM+FP16),发现同样的Prompt在本地测试时输出很稳,一上生产就经常答非所问,甚至偶尔输出乱码。本地是单卡A100,线上是4卡A10做tensor parallel,温度、top_p都设置一致了。想问问各位老哥:是不是量化或者并行策略会影响生成质量?还是说vLLM的sampling参数和transformers的默认行为有差异?另外,生产环境需要加system prompt来固定格式,但本地没加,会不会是这原因?有点迷茫,求指点排查思路。