精选的想法、故事和创意,全部汇集于此!

文章背景图

为 DeepSeek V4 Pro 接入视觉模块 其一:MinerU

2026-08-13
86
- 字
- 分钟

前言

DeepSeek无法识别PDF、图表、Word文档。用 MinerU 就可以把各种文档转成 AI 能读的Markdown格式实现文件阅读

一、准备工作

工具 用途 说明
Python 3.10+ MinerU 运行基础环境 推荐 Anaconda 独立环境,规避依赖冲突
Node.js & npm MinerU 命令行安装包管理器 可通过 conda install nodejs 安装
MinerU 文档 / 图像转换核心工具 npm install -g mineru-open-api 全局安装
MinerU API Token(推荐) 解除免费版文件 / 页数限制 mineru.net 注册免费领取,每日 5000 次调用额度

二、命令行配置与使用

终端手动调用 MinerU 是配置自动化 Skill 的前置基础。

2.1 安装 mineru

npm install -g mineru-open-api

2.2 安装验证

mineru-open-api --version

输出版本号即代表安装成功。

2.3 两种运行模式

2.3.1 快速模式(无需 Token,存在限制)

mineru-open-api flash extract 你的文件.pdf
  • 限制条件:PDF 文件 ≤ 10MB、页数 ≤ 20;
  • 默认直接在终端输出解析文本;
  • 自定义输出文件夹:增加参数 -O ./output_folder。

2.3.2 高精度模式(推荐,需绑定免费 Token)

  1. 前往官网 mineru.net 微信扫码注册登录,在「API Manage Token」页面生成专属 Token;
  2. 终端绑定 Token(仅首次配置执行):
mineru-open-api auth
# 然后根据终端提示粘贴复制的 Token
  1. 完整转换示例(PDF 转 Markdown,输出至 out 文件夹):
mineru-open-api extract 减少steam内存占据.pdf -O ./out -F markdown
  • 免费额度:每日支持 5000 份文件,总计 1000 页;
  • 文件上限:单文件 200MB、600 页以内;
  • 支持导出格式:markdown、html、latex、docx。

绝大多数论文、扫描文档会超出快速模式限制,且高精度模式识别表格、公式、图片文字效果显著更优,建议必配 Token。

三、将 MinerU 配置为 Cloud Code 的 Skill

本章节实现核心功能:AI 代理自动调用 MinerU 处理文件,仅通过自然语言下发指令即可完成文档解析。

3.1 一键配置指令(直接复制给 Cloud Code Agent)

  1. 让 AI 先列出可选 skill:
请帮我查找适用于 Claude Code 的 MinerU 的 skill 技能,先不要直接进行配置,先告诉我有哪些 skill 可选。先前我已经通过以下命令进行了配置:npm install -g mineru-open-api
  1. 让 AI 安装配置:
请帮我安装配置适用于现在的 Claude Code 的 MinerU 的使用技能(skill),并告诉我下载来源、使用方法。

AI 会自动下载、部署 Skill 文件,配置完成后技能列表会出现「PDF Converter - MinerU」。

3.2 配置完成后使用示例

直接对话下发自然语言指令,代理自动完成文档转换 + AI 分析:

把当前目录下的这篇 PDF 论文转成 Markdown。
读取这个 Word 文档,总结核心内容。
分析这张图片里的表格数据,导出为 HTML。
将这个 Excel 文件转换为 Markdown 表格。

流程逻辑:Agent 调用 MinerU 解析文件 → 生成结构化 Markdown/HTML → DeepSeek 读取结构化文本完成问答、总结、数据分析。


参考文献:

原创

为 DeepSeek V4 Pro 接入视觉模块 其一:MinerU

本文链接: 为 DeepSeek V4 Pro 接入视觉模块 其一:MinerU

本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

评论交流
1 条

文章目录