最近在把公司一个小模型(7B量化版)部署到本地做私有化测试,用的vLLM框架。跑起来倒是没问题,但Prompt效果特别飘。同一个Prompt模板,有时候回答很准,有时候就胡说八道。我试过调temperature、top_p,也换过几种system prompt写法,感觉变化不大。有人说要针对模型微调,但现阶段没这个预算。所以想问问有经验的朋友:本地部署场景下,Prompt工程和大模型API调用时有什么本质区别?有没有什么像样的模板规范或者参数组合技巧,能让输出更稳定一点?真诚求教,别嫌问题太基础。