精选的想法、故事和创意,全部汇集于此!

文章背景图

为 DeepSeek V4 Pro 接入视觉模块 其二:戴上 DeepSeek 的眼睛

2026-08-13
0
-
- 分钟

原生 DeepSeek 不支持多模态识图,直接上传图片它只能瞎写 OCR 脚本硬猜,识别效果极差。上一篇用 MinerU 解决了「读文档」,这篇给 DeepSeek 戴上「眼睛」:装一个 Cloud Vision Skill 识图插件,再配阿里云百炼的免费视觉模型,图片内容一眼看懂。

一、配置识图能力,让 DeepSeek 读取图片

思路很简单:DeepSeek 不能看图,但可以调外部视觉模型。用 Cloud Vision Skill 把识图能力接进来,底层走阿里云百炼的免费多模态模型,不用花一分钱。

1.1 安装 Cloud Vision Skill 识图插件

插件全称 Cloud Vision Skill,核心作用就是给没有视觉能力的大模型拓展图片解析功能。最简安装方式:用 Codex 新建对话,发送指令:

帮我安装一下 Cloud Vision Skill

AI 会自动检索并完成插件部署。

1.2 申请阿里云百炼识图模型密钥

选用阿里云百炼免费多模态模型作为识图辅助工具:

  1. 登录阿里云百炼平台,复制对应的模型 code 编码;
  2. 进入平台 API-KEY 管理页面,创建全新密钥,复制保存密钥。

1.3 一键自动配置识图环境

回到 Codex 对话窗口,粘贴复制好的百炼模型 code 与 API 密钥,发送指令:

帮我配置好环境

AI 将自动完成识图插件全部环境参数配置,插件在下一轮对话自动生效。

二、识图功能实测验证

新建空白对话,上传一张无任何文字的图片素材,发送提问:

这是什么?你看得到吗?

客户端会自动调用 Cloud Vision Skill 插件解析图片内容,若能精准描述画面物体、背景、特征,代表识图拓展功能部署成功。

三、方案总结

  1. 搭配免费阿里云视觉模型,补齐 DeepSeek 原生不支持看图的短板;
  2. 整套流程无需 GPT 账号、无需官方付费订阅,零成本降低使用门槛。

感谢他们为本文做出的贡献

https://www.bilibili.com/video/BV13wGT6uEts/

https://github.com/asuojun/claude-vision-skill

https://bailian.console.aliyun.com/cn-beijing?tab=costing-balance#/costing-balance/free-quota

原创

为 DeepSeek V4 Pro 接入视觉模块 其二:戴上 DeepSeek 的眼睛

本文链接: 为 DeepSeek V4 Pro 接入视觉模块 其二:戴上 DeepSeek 的眼睛

本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

评论交流

文章目录