最近在搭一个本地知识库问答,用的Embedding+向量库(Milvus)做RAG。卡在chunk划分上很久了。试过固定256、512,也试过按句子切,结果回答质量忽高忽低——有时候细节很准,有时候答非所问。
现在的文档是混合的,有技术手册也有对话记录。我猜是不是chunk策略要跟文档类型挂钩?但也没找到什么通用规律。另外,chunk重叠率设多少比较合理?网上说法从10%到50%都有,自己调了也没明显感觉。
有没有大佬分享下实际项目的调参经验?特别是中文场景,分词和embedding模型对chunk大小的影响大吗?先谢过。
楼主
2026-08-11
向量数据库做RAG时,chunk大小到底怎么定?试了好几种都效果不稳
请 登录 后发表回复
全部回复
共 61 条
2楼
1天前
我之前也踩过这个坑,后来发现文档类型不一样真得分开处理。技术手册按标题层级切效果会好很多,对话记录反而适合按轮次切,硬统一成一个尺寸肯定不稳。中文embedding模型对chunk长度挺敏感的,像bge这种512上限的,你切到500左右基本就把语义压扁了,我一般控制在300到400之间。重叠率不用太纠结,10%到15%够用了,调太高反而容易召回一堆重复的噪音片段。