最近在搭一个本地知识库问答,用的ChatGLM3做生成,embedding试了m3e-base和bge-large-zh,检索出来的片段感觉相关性还行,但最后回答经常答非所问。我怀疑是embedding和生成模型之间的“语义断层”问题,尤其是长文档切分后,chunk之间上下文丢失很严重。有没有大佬遇到过类似情况?是必须上重排模型(比如bge-reranker)才能救回来,还是说切分策略(比如重叠窗口、按标题切)更关键?另外,如果只用CPU跑推理,有没有比较轻量但中文效果不拉胯的embedding方案?求指条明路,折腾两周了有点想放弃了……