阿里千问开源了一个新项目 qwen-mm-plugins,可以把多模态能力挂给现有的 Agent。

我最近正好写了两篇 DeepSeek 视觉相关的文章:
- 为 DeepSeek V4 Pro 接入视觉模块 其一:MinerU
- 为 DeepSeek V4 Pro 接入视觉模块 其二:带上deepseek的眼睛
有朋友问我,这个东西是不是更好?所以我想看看这个插件能不能平替这两个方案。
试了一圈,结论是:在我使用的环境下,它除了阅读长视频、生成 SRT 字幕这一块能用,其他的都能被平替,或者根本用不上。
并且我发现,它和 claude-vision-skill 都有一个非常搞人的问题——都不能读剪贴板里的文件。
正常人应该是先把文件 Ctrl+C 复制下来,再 Ctrl+V 直接粘贴到对话框里发出去。但这样操作,没有识图能力的 AI 根本读不到内容。所以得做一个非常反人类的操作:把复制的文件先保存到本地,再把路径丢给 AI。
这个问题我搜遍了全网,至今没找到解决方法。
倒是用 AI Agent 部署花费了我超多的 Token。
碎碎念: DeepSeek V4 更新了 Pro 的正式版,价格随高峰期变动。 我本来以为正常使用这些模型的高峰期会在休息时间,没想到是工作时间段。这说明上班摸鱼用 Vibe Coding 的人还是挺多的呀。 最近听说公司回聘程序员,因为 AI 不能压榨(笑)