把 PDF / Office / 扫描件等复杂文档,高精度转成 LLM 能直接吃的 Markdown / JSON
更新于 2026-08-06 · v3.4(2026/06/18)
← 返回汇总文档解析引擎:把"看不懂"的 PDF,变成 LLM 的"饲料"
OpenDataLab 出品的开源文档解析引擎,用 VLM + OCR 双引擎把 PDF / DOCX / PPTX / XLSX / 图片 / 网页解析成结构化 Markdown 与 JSON。脱胎于 InternLM 大模型预训练的数据清洗流程,现已成为 RAG、Agent、知识库构建的"数据预处理标配"。适合任何需要把非结构化文档喂给 LLM 的场景。
精度基准 OmniDocBench v1.6,End-to-End Overall 分;Stars 截至 2026-07。
公式、表格、版面结构全丢,LLM 拿到一堆乱序字符,RAG 检索准确率崩盘。
按页计费、无法私有部署、不能定制,企业级知识库和敏感文档场景被卡脖子。
预训练 / RAG 的数据质量直接决定模型能力上限——文档解析是 LLM 数据飞轮的第一环。
MinerU 不是"又一个 OCR 工具",而是为大模型时代的数据清洗而生的解析引擎。它脱胎于 InternLM 的预训练数据管线,目标只有一个:把真实世界的复杂文档,无损地变成 LLM 能高效消费的结构化数据。
| 解析后端 | 精度 (OmniDocBench) | 纯 CPU | 最小显存 | 适用场景 |
|---|---|---|---|---|
pipeline | 86.47 | ✅ | 4GB | 兼容性优先,CPU 可跑,无幻觉 |
vlm-engine | 95.39 (high) | ❌ | 8GB | 精度优先,vLLM/LMDeploy 推理 |
hybrid-engine | 95.30 | ❌ | 8GB | VLM 精度 + 原生文本,低幻觉 |
vlm-http-client | 95.39 | ✅ | 2GB | 接 OpenAI 兼容服务端,边缘设备 |
OmniDocBench v1.6 End-to-End Overall 分。内存最低 16GB(推荐 32GB+),磁盘最低 20GB(推荐 SSD)。
Python / Go / TypeScript SDK · CLI · REST API · Docker
mineru.net 在线版 · Gradio WebUI · 桌面客户端
# 安装(uv 加速) pip install uv uv pip install -U "mineru[all]" # GPU 环境,直接解析 mineru -p <input_path> -o <output_path> # 纯 CPU / 边缘设备,指定 pipeline 后端 mineru -p <input.pdf> -o <out/> -b pipeline
支持 PDF / 图片 / DOCX / PPTX / XLSX 单文件或目录输入。Windows / Linux / macOS 全平台,Python 3.10-3.13。
Linux / Windows(WSL2) 官方镜像,规避环境依赖地狱。
昇腾 / 寒武纪 / 燧原 / 摩尔线程 / 昆仑芯 / 海光 / 壁仞 等 10+ 厂商。
内置 FastAPI + Gradio WebUI,CLI / API / WebUI 多形态编排。
| 项目 | 定位 | 技术路线 | 原生文本 PDF | 扫描件 | 关系 |
|---|---|---|---|---|---|
| pdf-inspector | 路由 + 规则解析 | 纯 Rust,零 ML | 极快 | ❌ | 上游互补:先分类,原生文本它处理,扫描件交给 MinerU |
MinerU | 端到端产品 | VLM+OCR 双引擎 | 慢 | ✅ | — 本页 — |
| DeepSeek-OCR | VLM 模型 | 单一视觉语言模型 | 慢 | ✅ 强 | 直接竞品:同为 VLM 路线,DeepSeek 更简洁,MinerU 工程更全 |
三者组合 > 单选:pdf-inspector 做网关 → 原生文本它自己处理 → 扫描件按需转交 MinerU 或 DeepSeek-OCR。
不要二选一,组合使用才是生产最优解:
pdf-inspector 直接提取,亚秒级,零 GPU 成本。
按需选:MinerU(工程生态全,本页)或 DeepSeek-OCR(单模型简洁)。GPU 只花在真正需要的地方。
文档解析是 LLM 时代的"数据预处理基础设施"。MinerU 以 76.9k stars 和学术研究双轮驱动,已坐稳开源文档解析头把交椅。随着 Agent 生态对"读取真实文档"需求爆发,MCP Server + 多 SDK 接入让它从"工具"升级为"平台"。
LLM 吃的不是 PDF,是结构化数据——MinerU 就是那台"饲料机"。
如果你在做 RAG / Agent / 知识库 / 预训练数据清洗,且需要处理非结构化文档,MinerU 是当前开源生态里精度最高、生态最全、国产芯片适配最好的选择。先用 pipeline 后端在 CPU 上跑通验证效果,再按需升级 VLM 后端。配合 pdf-inspector 做前置路由可大幅降本。