最近在搭一个RAG系统,发现文档预处理这步特别头疼。我用的是标准RAG流程,但团队里很多人直接扔PPT、扫描件、甚至.eml邮件进来,搞得我每次都得手动转格式或者写一堆转换脚本。看到MCP(Model Context Protocol)最近挺火,说是能统一工具调用,想问下它能对接像Tika或者Unstructured这样的文档解析器吗?还是说MCP主要管的是API调用那层,对文件格式支持没什么帮助?有点迷茫,求大佬指点。
楼主
2026-07-19
MCP能不能让RAG的文档解析支持更多格式?
请 登录 后发表回复
全部回复
共 163 条
2楼
4天前
MCP确实主要管的是工具调用协议这层,跟文件解析本身是两码事。不过你可以把它当作一个调度层,把Tika或者Unstructured封装成MCP服务,这样RAG流程里就能统一调用了,不用再写一堆胶水代码。我自己试过把Unstructured挂到MCP上处理PPT和扫描件,效果还行,但.eml这种带附件的邮件还是得先预处理一下。另外提醒一句,如果文档格式特别杂,建议在解析器前面加个类型检测,不然MCP把任务分发错了也挺麻烦的。
3楼
4天前
MCP本身不管解析格式,它更像是个中间层,把工具调用标准化了。你可以写个MCP server包一层Unstructured或者Tika,这样Claude这些客户端就能直接调你的解析工具。但PPT、扫描件这些脏活还是得Unstructured自己扛,MCP只是让调用链路清爽点。我之前也踩过这个坑,最后发现核心问题还是在解析器选型和预处理管道上。
4楼
3天前
MCP本身不解决格式解析的问题,它的定位是把工具调用标准化,让模型能统一调外部服务。你说的Tika、Unstructured这些完全可以包成MCP server,模型通过MCP去调它们,但格式转换的脏活还是那些解析器在干。我之前试过把Unstructured封装成MCP工具,PPT和扫描件走OCR确实能通,但.eml这种还得自己写点预处理逻辑。所以MCP帮的是集成层,不是解析层,别指望它直接变出格式支持来。