最近在做一个基于内部文档的问答机器人,用的LangChain + OpenAI embedding + Pinecone。本地测试时Top-5召回率看着还行,但一上线处理真实用户查询就露馅了——很多细节问题答非所问,甚至漏掉关键数字。