精选的想法、故事和创意,全部汇集于此!

文章背景图

为 DeepSeek V4 Pro 接入视觉模块 其二:戴上 DeepSeek 的眼睛

2026-08-13
15
- 字
- 分钟

原生 DeepSeek 不支持多模态识图,直接上传图片它只能瞎写 OCR 脚本硬猜,识别效果极差。 可以装 Cloud Vision Skill 识图插件,再配阿里云百炼的免费视觉模型,图片内容一眼看懂。

一、配置识图能力,让 DeepSeek 读取图片

Cloud Vision Skill 可以把其他模型识图能力接进来,底层走阿里云百炼的免费多模态模型,不用花一分钱。

1.1 安装 Cloud Vision Skill 识图插件

插件全称 Cloud Vision Skill,核心作用就是给没有视觉能力的大模型拓展图片解析功能。最简安装方式:用 Codex 新建对话,发送指令:

帮我安装一下 Cloud Vision Skill

1.2 申请阿里云百炼识图模型密钥

选用阿里云百炼免费多模态模型作为识图辅助工具:

  1. 登录阿里云百炼平台,复制对应的模型 code 编码;
  2. 进入平台 API-KEY 管理页面,创建全新密钥,复制保存密钥。

1.3 一键自动配置识图环境

回到 Codex 对话窗口,粘贴复制好的百炼模型 code 与 API 密钥,发送指令:

帮我配置好环境

AI 将自动完成识图插件全部环境参数配置,插件在下一轮对话自动生效。

二、识图功能实测验证

新建空白对话,上传一张无任何文字的图片素材,发送提问:

这是什么?你看得到吗?

上传后客户端会自动调 Cloud Vision Skill 解析。能说清楚画面里是什么、背景和特征,就是装好了。

三、缺点

必须把图片保存在本地给出路径,不然ai无法看到图片


参考文献:

原创

为 DeepSeek V4 Pro 接入视觉模块 其二:戴上 DeepSeek 的眼睛

本文链接: 为 DeepSeek V4 Pro 接入视觉模块 其二:戴上 DeepSeek 的眼睛

本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

评论交流

文章目录