最近在搭一个垂直领域的客服问答RAG,语料大概几万条技术文档。现在卡在embedding这步了,用的bge-m3和OpenAI的text-embedding-3-small对比,检索出来的top5结果怎么看都觉得闭源的效果更贴合语义。但我又不想全上闭源API,成本先不说,数据隐私也是问题。想问问大家,是不是我微调bge的路子没走对?还是说在中文长文档场景下,开源模型天花板就摆在那了?有没有用Qwen或者GTE系列调出效果的兄弟,分享下你的预处理或者训练技巧?另外,混合检索(比如加BM25)能不能弥补这块差距?求真实经验,别发论文链接,我看了头大。