🔥 项目详情

MinerU

把 PDF / Office / 扫描件等复杂文档,高精度转成 LLM 能直接吃的 Markdown / JSON

opendatalab/MinerU Apache 2.0 + 附加条件 Python 3.10-3.13 76.9k★

更新于 2026-08-06 · v3.4(2026/06/18)

← 返回汇总
项目速览

一句话定位

文档解析引擎:把"看不懂"的 PDF,变成 LLM 的"饲料"

OpenDataLab 出品的开源文档解析引擎,用 VLM + OCR 双引擎把 PDF / DOCX / PPTX / XLSX / 图片 / 网页解析成结构化 Markdown 与 JSON。脱胎于 InternLM 大模型预训练的数据清洗流程,现已成为 RAG、Agent、知识库构建的"数据预处理标配"。适合任何需要把非结构化文档喂给 LLM 的场景。

项目速览

核心数据

76.9k
GitHub Stars
95.39
VLM 精度 (OmniDocBench)
109
OCR 支持语种
10+
国产 AI 芯片适配

精度基准 OmniDocBench v1.6,End-to-End Overall 分;Stars 截至 2026-07。

为什么存在

文档解析的三道坎

传统 OCR 只识字

公式、表格、版面结构全丢,LLM 拿到一堆乱序字符,RAG 检索准确率崩盘。

商业方案贵且黑盒

按页计费、无法私有部署、不能定制,企业级知识库和敏感文档场景被卡脖子。

大模型自己爱吃"脏数据"

预训练 / RAG 的数据质量直接决定模型能力上限——文档解析是 LLM 数据飞轮的第一环。

🔥 核心理念

从 InternLM 预训练走出来

MinerU 不是"又一个 OCR 工具",而是为大模型时代的数据清洗而生的解析引擎。它脱胎于 InternLM 的预训练数据管线,目标只有一个:把真实世界的复杂文档,无损地变成 LLM 能高效消费的结构化数据。

InternLM 预训练 → 数据清洗需求 → MinerU 开源 → RAG/Agent 生态标配
🔥 核心机制

VLM + OCR 双引擎架构

INPUT 复杂文档源 PDF / 扫描件 / 图片 Office 文档 DOCX / PPTX / XLSX DUAL ENGINE 解析层 pipeline 后端 布局检测 + OCR + 公式 + 表格 兼容性强 · CPU 可跑 · 精度 86.47 PaddleOCR · UniMERNet · fast-langdetect VLM 后端 视觉语言模型端到端解析 高精度 · 精度 95.39 vLLM / LMDeploy / mlx 推理 hybrid-engine VLM 精度 + 原生文本抽取 低幻觉 · 精度 95.30 融合两者优势 OUTPUT Markdown JSON 公式 LaTeX 表格 HTML
核心解析引擎 输入/输出格式 混合后端
核心机制

解析能力清单

性能数据

三种后端精度对比

解析后端精度 (OmniDocBench)纯 CPU最小显存适用场景
pipeline86.47✅4GB兼容性优先,CPU 可跑,无幻觉
vlm-engine95.39 (high)❌8GB精度优先,vLLM/LMDeploy 推理
hybrid-engine95.30❌8GBVLM 精度 + 原生文本,低幻觉
vlm-http-client95.39✅2GB接 OpenAI 兼容服务端,边缘设备

OmniDocBench v1.6 End-to-End Overall 分。内存最低 16GB(推荐 32GB+),磁盘最低 20GB(推荐 SSD)。

集成生态

即插即用进 LLM 工作流

AI 编程工具 (MCP Server)
  • Cursor
  • Claude Desktop
  • Windsurf
RAG 框架原生集成
  • LangChain / LlamaIndex
  • RAGFlow / RAG-Anything
  • Dify / FastGPT / Flowise

开发者接入

Python / Go / TypeScript SDK · CLI · REST API · Docker

零代码使用

mineru.net 在线版 · Gradio WebUI · 桌面客户端

快速上手

三行命令跑起来

# 安装(uv 加速)
pip install uv
uv pip install -U "mineru[all]"

# GPU 环境,直接解析
mineru -p <input_path> -o <output_path>

# 纯 CPU / 边缘设备,指定 pipeline 后端
mineru -p <input.pdf> -o <out/> -b pipeline

支持 PDF / 图片 / DOCX / PPTX / XLSX 单文件或目录输入。Windows / Linux / macOS 全平台,Python 3.10-3.13。

部署形态

私部署 · 全离线

Docker 一键起

Linux / Windows(WSL2) 官方镜像,规避环境依赖地狱。

国产芯片全适配

昇腾 / 寒武纪 / 燧原 / 摩尔线程 / 昆仑芯 / 海光 / 壁仞 等 10+ 厂商。

服务化部署

内置 FastAPI + Gradio WebUI,CLI / API / WebUI 多形态编排。

适用场景

谁在用它

学术背书

持续演进的研究线

核心论文谱系
  • MinerU (2024):开源精准文档抽取方案
  • MinerU 2.5 (2025):解耦式 VLM,高效高分辨率解析
  • MinerU 2.5-Pro (2026):大规模数据中心的解析极限
  • MinerU-Diffusion:用扩散解码重新定义文档 OCR
配套生态
  • OmniDocBench:文档解析评测基准
  • PDF-Extract-Kit:高质量 PDF 抽取工具箱
  • UniMERNet:公式识别模型
  • magic-html:网页抽取工具
风险提示

需要权衡的点

🔥 横向对比

PDF 解析光谱:三层不是竞品

项目定位技术路线原生文本 PDF扫描件关系
pdf-inspector路由 + 规则解析纯 Rust,零 ML极快❌上游互补:先分类,原生文本它处理,扫描件交给 MinerU
MinerU端到端产品VLM+OCR 双引擎慢✅— 本页 —
DeepSeek-OCRVLM 模型单一视觉语言模型慢✅ 强直接竞品:同为 VLM 路线,DeepSeek 更简洁,MinerU 工程更全

三者组合 > 单选:pdf-inspector 做网关 → 原生文本它自己处理 → 扫描件按需转交 MinerU 或 DeepSeek-OCR。

🔥 横向对比

MinerU vs DeepSeek-OCR:同为 VLM,路线有别

MinerU(本页)
  • 哲学:双引擎(pipeline+VLM),按场景切换
  • 强项:工程完整(CLI/API/WebUI/Docker/MCP)
  • License:Apache-2.0 + 附加条件
  • 成熟度:生产级,5712 commits,v3.4
  • 集成:LangChain/Dify/RAGFlow/MCP/多 SDK
  • 适合:要稳定产品、要 RAG 生态、要国产芯片
DeepSeek-OCR
  • 哲学:单一 VLM 吃天下,端到端
  • 强项:扫描件、手写、低质量图像
  • License:MIT(更宽松)
  • 成熟度:偏研究,7 commits
  • 集成:仅 vLLM/Transformers
  • 适合:只要 OCR 精度,能自己封装工程
最佳实践

三者组合:成本最优架构

不要二选一,组合使用才是生产最优解:

PDF 输入 → pdf-inspector 分类 → 分流
~54% 原生文本

pdf-inspector 直接提取,亚秒级,零 GPU 成本。

~46% 扫描/混合

按需选:MinerU(工程生态全,本页)或 DeepSeek-OCR(单模型简洁)。GPU 只花在真正需要的地方。

潜力评估

未来空间

文档解析是 LLM 时代的"数据预处理基础设施"。MinerU 以 76.9k stars 和学术研究双轮驱动,已坐稳开源文档解析头把交椅。随着 Agent 生态对"读取真实文档"需求爆发,MCP Server + 多 SDK 接入让它从"工具"升级为"平台"。


评分
9.0 / 10
状态:tracking(生态成熟,持续追踪)
总结

一句话带走

LLM 吃的不是 PDF,是结构化数据——MinerU 就是那台"饲料机"。

如果你在做 RAG / Agent / 知识库 / 预训练数据清洗,且需要处理非结构化文档,MinerU 是当前开源生态里精度最高、生态最全、国产芯片适配最好的选择。先用 pipeline 后端在 CPU 上跑通验证效果,再按需升级 VLM 后端。配合 pdf-inspector 做前置路由可大幅降本。


上一个
video-shotcraft
下一个
pdf-inspector
1 / 19