本文由deepseek通过以下视频提炼
前言
配置好该工具后,可将 PDF、扫描件、图片、Word、Excel、PPT 等文件精准转换为 Markdown、HTML、LaTeX 等格式,支持 OCR、表格识别、公式识别,让 DeepSeek 实现图像、文档读取解析能力。
一、为什么需要给 DeepSeek 配上 “眼睛”
DeepSeek 原生 API 不支持视觉多模态,无法直接识别图像、PDF、复杂文档;文献阅读、图表分析、扫描件文字提取等场景仅靠纯文本接口无法实现。
此前尝试调用第三方免费图像识别 API 存在三大缺陷:
不稳定:小型平台易关停、接口失效;
精度低:复杂公式、表格、扫描文档识别效果差;
不可复现:接口来源不固定,无法标准化教学部署。
MinerU 工具简介
MinerU 是上海人工智能实验室开源工具,GitHub Star 超 56000,支持 PDF、图片、Word/Excel/PPT 全格式高精度解析。本文完整讲解终端部署 + Cloud Code Skill 自动化调用方案,赋予 DeepSeek 视觉文档处理能力。
核心理念:MinerU 将图片、文档转换为 AI 可读的 Markdown/HTML 结构化文本,DeepSeek 基于结构化文本完成分析、总结、推理,整套流程可由 AI 代理全自动执行,无需人工介入。
二、准备工作
三、命令行配置与使用
终端手动调用 MinerU 是配置自动化 Skill 的前置基础。
3.1 安装mineru
npm install -g mineru-open-api3.2 安装验证
mineru-open-api --version输出版本号即代表安装成功。
3.3 两种运行模式
① 快速模式(无需 Token,存在限制)
mineru-open-api flash extract 你的文件.pdf限制条件:PDF 文件≤10MB、页数≤20;
默认直接在终端输出解析文本;
自定义输出文件夹:增加参数 -O ./output_folder。
② 高精度模式(推荐,需绑定免费 Token)
前往官网 mineru.net 微信扫码注册登录,在「API Manage Token」页面生成专属 Token;
终端绑定 Token(仅首次配置执行):
mineru-open-api auth
# 然后根据终端提示粘贴复制的 Token完整转换示例(PDF 转 Markdown,输出至 out 文件夹)
mineru-open-api extract 减少steam内存占据.pdf -O ./out -F markdown免费额度:每日支持 5000 份文件,总计 1000 页;
文件上限:单文件 200MB、600 页以内;
支持导出格式:markdown、html、latex、docx。
绝大多数论文、扫描文档会超出快速模式限制,且高精度模式识别表格、公式、图片文字效果显著更优,建议必配 Token。
四、将 MinerU 配置为 Cloud Code 的 Skill
本章节实现核心功能:AI 代理自动调用 MinerU 处理文件,仅通过自然语言下发指令即可完成文档解析。
4.1 一键配置指令(直接复制给 Cloud Code Agent)
请帮我查找适用于ClaudeCode的MinerU的skill技能,先不要直接进行配置,先告诉我有哪些skill可选。先前我已经通过以下命令进行了配置:npminstall-g mineru-open-api请帮我安装配置适用于现在的ClaudeCode的MinerU的使用技能(skill),并告诉我下载来源、使用方法。
AI 会自动下载、部署 Skill 文件,配置完成后技能列表会出现「PDF Converter - MinerU」。
4.2 配置完成后使用示例
直接对话下发自然语言指令,代理自动完成文档转换 + AI 分析:
把当前目录下的这篇 PDF 论文转成 Markdown。
读取这个 Word 文档,总结核心内容。
分析这张图片里的表格数据,导出为 HTML。
将这个 Excel 文件转换为 Markdown 表格。
流程逻辑:Agent 调用 MinerU 解析文件→生成结构化 Markdown/HTML→DeepSeek 读取结构化文本完成问答、总结、数据分析。
五、实战演示:DeepSeek 全自动文献分析完整流程
将 Nature 子刊 PDF 论文放入项目文件夹;
指令:“请使用 MinerU 将这篇论文转换为 Markdown,然后分析它的核心工作流程和结论。”
Agent 自动执行文件转换,生成同名 .md 文件与配套图片资源文件夹;
DeepSeek 读取转换后的结构化文档,输出论文分析结果。
实测效果:MinerU 对表格、公式、图片内嵌文字还原度极高,转换后 Markdown 排版与原 PDF 高度一致,AI 理解无阻碍,彻底解决 DeepSeek 原生无法读图、读文档的短板。
六、全文总结
通过 MinerU + Cloud Code Skill 组合,为 DeepSeek V4 Pro 补充完整视觉文档处理能力,可实现以下功能:
PDF、Word、PPT、Excel、图片一键转换 Markdown / HTML / LaTeX;
自动识别图片内文字、复杂表格、专业公式;
自然语言驱动 AI 代理全自动完成整套文档分析工作流。
整套方案开源免费、部署轻量化,全流程在 VS Code 内闭环,无需切换外部软件,大幅拓展 DeepSeek 实际落地场景。
感谢各位读者反馈与社群分享,有想看的其他教程可留言,祝开发顺利!