精选的想法、故事和创意,全部汇集于此!

文章背景图

带上deepseek的眼睛

2026-08-11
4
-
- 分钟
https://www.bilibili.com/video/BV13wGT6uEts/

原生 DeepSeek V4 Flash 不支持多模态图像识别,直接上传图片无法解析内容,模型会自动编写 OCR 脚本强行识别,识别效果极差。可通过云端免费视觉模型搭配插件补足识图能力,该功能无法直接在 CC Switch 配置,需要安装专用技能插件。

一、配置识图能力,让 DeepSeek 读取图片

1.1 安装 Cloud Vision Skill 识图插件

插件全称 Cloud Vision Skill,核心作用为给无视觉能力的大模型拓展图片解析功能。最简安装方式:Codex 新建对话,发送指令:帮我安装一下 Cloud Vision Skill,AI 会自动检索并完成插件部署。

1.2 申请阿里云百炼识图模型密钥

选用阿里云百炼免费多模态模型 qwen3.7-flash 作为识图辅助工具:

  1. 登录阿里云百炼平台,复制对应的模型 code 编码;

  2. 进入平台 API-KEY 管理页面,创建全新密钥,复制保存密钥。

1.3 一键自动配置识图环境

回到 Codex 对话窗口,粘贴复制好的百炼模型 code 与 API 密钥,发送指令:帮我配置好环境。AI 将自动完成识图插件全部环境参数配置,插件在下一轮对话自动生效。

二、识图功能实测验证

新建空白对话,上传无任何文字的图片素材,发送提问:这是什么?你看得到吗?客户端会自动调用 Cloud Vision Skill 插件解析图片内容,若能精准描述画面物体、背景、特征,代表识图拓展功能部署成功。

三、方案总结

  1. 搭配免费阿里云视觉模型,补齐 DeepSeek 原生不支持看图的短板;

  2. 整套流程无需 GPT 账号、无需官方付费订阅,降低使用门槛。

原创

带上deepseek的眼睛

本文链接: 带上deepseek的眼睛

本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

评论交流

文章目录