最近在做一个基于RAG的文档问答小工具,用的是LangChain + Chroma,embedding是bge-small。文档是公司内部的技术手册,我按512 token切块,overlap给了50。但实际用起来发现,很多问题的答案分散在好几个chunk里,检索top3经常只召回一半,模型回答就缺胳膊少腿。试过调大chunk size到1024,结果噪声又变多,召回精度下降。也想过用父文档检索或者句子窗口,但不太确定哪种方案落地简单点。想问问大家在实际项目里怎么平衡chunk大小和召回完整性的?有没有比较稳的工程实践?