原生 DeepSeek 不支持多模态识图,直接上传图片它只能瞎写 OCR 脚本硬猜,识别效果极差。 可以装 Cloud Vision Skill 识图插件,再配阿里云百炼的免费视觉模型,图片内容一眼看懂。
一、配置识图能力,让 DeepSeek 读取图片
Cloud Vision Skill 可以把其他模型识图能力接进来,底层走阿里云百炼的免费多模态模型,不用花一分钱。
1.1 安装 Cloud Vision Skill 识图插件
插件全称 Cloud Vision Skill,核心作用就是给没有视觉能力的大模型拓展图片解析功能。最简安装方式:用 Codex 新建对话,发送指令:
帮我安装一下 Cloud Vision Skill1.2 申请阿里云百炼识图模型密钥
选用阿里云百炼免费多模态模型作为识图辅助工具:
- 登录阿里云百炼平台,复制对应的模型 code 编码;
- 进入平台 API-KEY 管理页面,创建全新密钥,复制保存密钥。
1.3 一键自动配置识图环境
回到 Codex 对话窗口,粘贴复制好的百炼模型 code 与 API 密钥,发送指令:
帮我配置好环境AI 将自动完成识图插件全部环境参数配置,插件在下一轮对话自动生效。
二、识图功能实测验证
新建空白对话,上传一张无任何文字的图片素材,发送提问:
这是什么?你看得到吗?上传后客户端会自动调 Cloud Vision Skill 解析。能说清楚画面里是什么、背景和特征,就是装好了。
三、缺点
必须把图片保存在本地给出路径,不然ai无法看到图片
参考文献: