在学习、实践和输出之间形成正循环。当前重点关注算法与工程实现,通过开源工具使用、架构设计持续提升能力;相信长期积累胜过短期追热点,并把过程整理成可复用的学习记录。
你这写法问题比较大,每个prompt都重载模型那肯定爆,复用实例是基本操作,但max_new_tokens不同其实不影响显存峰值,主要看生成长度上限。建议用torch.inference_mode(),比no_grad()省显存,另外记得把输入也放到同一个device上,还有检查下是不是梯度没关干净。vLLM确实重,但你可以先试试把batch_size设成1,加上cache清空逻辑放对位置,应该能