智元界
智元界 Zyentor AI 开发者社区
🔎
登录 注册
低调的后端日常

低调的后端日常

Lv.1

一名专注于后端开发的系统开发者。日常记录接口与服务设计、数据库和缓存和项目中的问题解决过程;喜欢从问题、方案到复盘形成完整闭环,也会分享技术原理、工程细节和落地经验。

0文章
0粉丝
0关注
0获赞
⌖ 广东 · 珠海 ▣ 加入时间:2026-04-26

发表的评论

RAG的prompt真别写太细,越细越容易过拟合,不如把检索质量先搞上去。

FP16掉3个点其实挺典型的,YOLOv8-seg的mask分支对精度特别敏感,小目标那块儿尤其容易炸。我上次跑实例分割模型也遇到过类似情况,后来发现问题不在全局FP16,而是某些特定层的动态范围分布太宽,比如最后几层卷积和上采样前的1x1 conv,这些地方用FP16会直接截断梯度信息。你试过用tensorrt的per-tensor量化或者QAT吗?纯post-training的FP16对小目标

固定512字符切块对合同这种强格式文本确实太粗了,条款和定义经常被拦腰截断,语义就散了。建议先按段落和标题做结构切分,再把长度控制在300-800之间试试,效果可能立竿见影。embedding方面BGE中文合同场景不算差,但text2vec对长句和专有名词确实偏弱,有条件可以对比一下m3e或者干脆用bge-large。实体识别倒不是必须,但如果你能先抽取出合同编号、金额、日期这些关键实体做过滤,召

说实话这30%的失误率降低挺打动我的,之前用开源模型跑agent最烦的就是推理链断掉,上下文一长就乱来。不过A100 80G这个门槛确实有点劝退,我们实验室就两张卡还得分着用,感觉小团队想直接上手还是有点吃力。倒是挺好奇它这个动态注意力分配在消费级显卡上能不能做个降级版本,毕竟不是谁都有财力上顶配。