前言
DeepSeek无法识别PDF、图表、Word文档。用 MinerU 就可以把各种文档转成 AI 能读的Markdown格式实现文件阅读
一、准备工作
| 工具 | 用途 | 说明 |
|---|---|---|
| Python 3.10+ | MinerU 运行基础环境 | 推荐 Anaconda 独立环境,规避依赖冲突 |
| Node.js & npm | MinerU 命令行安装包管理器 | 可通过 conda install nodejs 安装 |
| MinerU | 文档 / 图像转换核心工具 | npm install -g mineru-open-api 全局安装 |
| MinerU API Token(推荐) | 解除免费版文件 / 页数限制 | mineru.net 注册免费领取,每日 5000 次调用额度 |
二、命令行配置与使用
终端手动调用 MinerU 是配置自动化 Skill 的前置基础。
2.1 安装 mineru
npm install -g mineru-open-api2.2 安装验证
mineru-open-api --version输出版本号即代表安装成功。
2.3 两种运行模式
2.3.1 快速模式(无需 Token,存在限制)
mineru-open-api flash extract 你的文件.pdf- 限制条件:PDF 文件 ≤ 10MB、页数 ≤ 20;
- 默认直接在终端输出解析文本;
- 自定义输出文件夹:增加参数
-O ./output_folder。
2.3.2 高精度模式(推荐,需绑定免费 Token)
- 前往官网 mineru.net 微信扫码注册登录,在「API Manage Token」页面生成专属 Token;
- 终端绑定 Token(仅首次配置执行):
mineru-open-api auth
# 然后根据终端提示粘贴复制的 Token- 完整转换示例(PDF 转 Markdown,输出至 out 文件夹):
mineru-open-api extract 减少steam内存占据.pdf -O ./out -F markdown- 免费额度:每日支持 5000 份文件,总计 1000 页;
- 文件上限:单文件 200MB、600 页以内;
- 支持导出格式:markdown、html、latex、docx。
绝大多数论文、扫描文档会超出快速模式限制,且高精度模式识别表格、公式、图片文字效果显著更优,建议必配 Token。
三、将 MinerU 配置为 Cloud Code 的 Skill
本章节实现核心功能:AI 代理自动调用 MinerU 处理文件,仅通过自然语言下发指令即可完成文档解析。
3.1 一键配置指令(直接复制给 Cloud Code Agent)
- 让 AI 先列出可选 skill:
请帮我查找适用于 Claude Code 的 MinerU 的 skill 技能,先不要直接进行配置,先告诉我有哪些 skill 可选。先前我已经通过以下命令进行了配置:npm install -g mineru-open-api- 让 AI 安装配置:
请帮我安装配置适用于现在的 Claude Code 的 MinerU 的使用技能(skill),并告诉我下载来源、使用方法。AI 会自动下载、部署 Skill 文件,配置完成后技能列表会出现「PDF Converter - MinerU」。
3.2 配置完成后使用示例
直接对话下发自然语言指令,代理自动完成文档转换 + AI 分析:
把当前目录下的这篇 PDF 论文转成 Markdown。
读取这个 Word 文档,总结核心内容。
分析这张图片里的表格数据,导出为 HTML。
将这个 Excel 文件转换为 Markdown 表格。流程逻辑:Agent 调用 MinerU 解析文件 → 生成结构化 Markdown/HTML → DeepSeek 读取结构化文本完成问答、总结、数据分析。
参考文献: