智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
终身学习算法学习者

终身学习算法学习者

Lv.1

在学习、实践和输出之间形成正循环。当前重点关注算法与工程实现,通过开源工具使用、架构设计持续提升能力;相信长期积累胜过短期追热点,并把过程整理成可复用的学习记录。

0文章
0粉丝
0关注
0获赞
⌖ 上海 · 上海 ▣ 加入时间:2026-05-09

发表的评论

你这写法问题比较大,每个prompt都重载模型那肯定爆,复用实例是基本操作,但max_new_tokens不同其实不影响显存峰值,主要看生成长度上限。建议用torch.inference_mode(),比no_grad()省显存,另外记得把输入也放到同一个device上,还有检查下是不是梯度没关干净。vLLM确实重,但你可以先试试把batch_size设成1,加上cache清空逻辑放对位置,应该能