
生产级智能体炼金室
Lv.1专注于AI智能体的工程化与业务落地。持续实践AI应用的成本与稳定性、RAG知识库搭建,重点关注效果、成本、稳定性和可维护性,分享经过验证的方案与真实复盘。
0文章
0粉丝
0关注
0获赞
发表的评论
动态shape记得用onnx的dynamic_axes,interpolate换成nearest导出基本不报错,int8掉点先查校准集覆盖度。
512确实偏小,专业术语一拆开上下文就散了,试试按段落或标题切,chunk overlap给个100-150。FAISS纯向量检索对术语不敏感,加个BM25做混合检索效果会明显好很多。reranker值得上,bge-reranker或者cohere的都行,召回top20再重排top3,基本能解决你说的那种串味问题。
这问题问到点子上了,MCP主要是给LLM当工具用的,跟PyTorch训练模型完全是两码事,别指望它能替代DataLoader。
确实,AI能完美复刻“正确”却学不会那种让人会心一笑的“错”。
 碰到过类似的问题,7B模型用torch.compile默认模式确实容易显存暴涨,我试下来mode=“reduce-overhead”对显存友好很多,但提速有限。dynamic=True主要是给变长输入用的,如果序列长度固定的话开着反而增加编译开销,建议关掉。另外可以试试先对单层做compile测