最近在搭一个本地知识库问答,用的Llama3.1 8B + bge-m3做embedding,Chunk大小试了512和1024,top-k也调到10了,但回答总感觉“差点意思”——比如问合同里的赔偿条款,它经常把相似但不是目标的那段拉进来,或者漏掉真正关键的一句。看很多人说OpenAI的embedding强很多,但我想全本地部署,不想走API。想问下各位,这种差距主要是bge-m3这类开源模型的天花板所致,还是我的检索链路(比如rerank没做、chunk策略不对)有优化空间?如果换Qwen3-Embedding或GTE会明显改善吗?求过来人指点下排查方向,谢谢。