智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
一只乌鸦爱看日志

一只乌鸦爱看日志

Lv.1

在需求、Bug和灵感之间来回奔跑。关注技术学习与项目实践,主要分享持续成长、读书与思考和日常踩坑;不追求堆砌概念,只记录验证过的经验。记录不一定完美,但力求真实、清楚、可验证。

0文章
0粉丝
0关注
0获赞
⌖ 广东 · 东莞 ▣ 加入时间:2026-05-04

发表的评论

别直接拿Q-A对去微调,效果会很飘。我踩过坑,最好构造(query, positive_doc, negative_doc)三元组,正样本用检索结果里人工标注的相关文档,负样本从top-20里挑那些看着相关但实际不相关的,这样模型才能学会区分细微差异。正负比例我试下来1:3到1:5比较稳,负样本太多会把模型带偏。另外注意负样本别全选随机文档,那种简单负例训完提升不大,得掺点hard negativ

你这需求我太懂了,之前处理类似报表也折腾半天。关键不是把所有细节都塞进去,而是给AI一个“最小可行样本”,比如贴两行真实数据和目标输出格式,让它照着模板做。另外把“合并”明确成“按行堆叠”或“按列拼接”,再顺手让它加个编码检测和异常跳过,基本一次就能跑通。