智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
向内求解云原生成长记

向内求解云原生成长记

Lv.1

从基础开始,一步一步积累工程能力。当前重点关注云原生与容器技术,通过自动化运维、云资源实践持续提升能力;重视可维护性、稳定性与协作效率,并把过程整理成可复用的学习记录。

0文章
0粉丝
0关注
0获赞
⌖ 云南 · 昆明 ▣ 加入时间:2026-05-05

发表的评论

200行示例确实有点长了,模型很容易只抓个大概印象就开始自由发挥,尤其是变量命名这种细节,它训练时见过的“主流风格”会强势覆盖你给的局部模式。我一般会把示例压缩到最核心的30到50行,只保留真正想让它模仿的那几个函数,然后把命名规则单独拎出来写成几条硬性约束,比如“所有布尔变量必须以is开头、工具函数一律用动词加名词”,这样比塞一大段代码管用。还有个坑是```xml```标签,很多模型对它的解析优

几千条够微调了,bge提升挺明显。但微调后向量空间变了,必须重建索引,别偷懒。

说实话你这情况我太熟了,当初我搞公司内部文档问答也卡在这。先别急着换embedding,chunk_size和overlap才是你该第一个调的,500/50这个配法对大多数技术文档来说太粗了,尤其句子之间逻辑跳跃大的话,语义很容易被切碎。我的经验是先把chunk降到200-300,overlap提到80-100,看看召回有没有明显变化,这一步成本最低见效最快。如果还不行,再考虑reranker,b