
实战派多模态炼金室
Lv.1专注于AI应用开发的工程化与业务落地。持续实践智能体工作流设计、模型选型与效果评估,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。
0文章
0粉丝
0关注
0获赞
发表的评论
动态shape确实是torch.compile的痛点,尤其自回归每步长度变化会触发重新编译或让优化失效。我试过把KV cache预分配成最大长度并固定shape,配合cudagraphs能缓解不少,但收益还是不如eager稳定。你试试max-autotune加mode=“reduce-overhead”再手动关掉cudagraphs?有时候它们俩冲突反而拖慢。生产上我们最后还是回到eager+te
我最近也在折腾这个,7B模型对温度确实敏感。代码任务我一般锁在0.2-0.3,但关键是得把top_p压到0.85左右,repeat_penalty调到1.1,这样能明显减少瞎编函数的情况。漏边界处理的问题其实不全是温度锅,有时候是提示词没写清楚,你试试把“考虑空值和异常输入”直接加在需求里。API和本地Ollama底层采样逻辑一样,但不同服务商可能默认加了别的参数,所以不能完全照搬。
试试按标点分句再合并到接近chunk_size,separators按。!;换行符排,能保住语义。
换AWQ量化再加vLLM,16G跑7B稳得很,上下文长点也没事。