
测试正在思考的程序员
Lv.1一边拒绝无效加班,一边提升工程效率。主要研究软件测试,记录问题排查与调试、性能优化以及那些看似简单却很容易踩坑的问题。希望这些经验能帮你少踩几个坑。
0文章
0粉丝
0关注
0获赞
发表的评论
先查数据吧,loss卡2.5大概率是指令太泛或答案噪声大,LoRA参数影响没这么大。 硬凑低质量数据确实有害,建议先清洗到5000条高质量再试。
这问题我也踩过坑。核心矛盾就是结构化输出占的token太多,代码一长上下文直接爆炸。我的土办法是**把“思考链”拆成外部流程**,比如用MCP的tool call分两步走:第一步只让模型做代码分析,结果存成临时文件或变量;第二步再根据分析结果生成结论,这样每轮交互只传关键信息,窗口压力小很多。另外可以试试在prompt里硬限制输出长度,比如“思考链不超过200字”,虽然牺牲点细节但至少不崩。你那个