精选的想法、故事和创意,全部汇集于此!

文章背景图

原生 Windows 折腾 Qwen-MM-Plugins:踩了 8 个坑,最后还是卸了

2026-08-12
8
-
- 分钟

原生 Windows 折腾 Qwen-MM-Plugins:踩了 8 个坑,最后还是卸了

真实折腾记录:2026-08-12,在没有 WSL、没有 git 的原生 Windows 上,手动装配 Qwen-MM-Plugins 全套能力,装完用了一圈又卸掉。

参考项目:QwenLM/Qwen-MM-Plugins


需求

Claude Code 好用,但我的模型通道(DeepSeek 这类)原生没有识图能力。想让 Agent 能读截图、处理长视频,就得外挂视觉能力。网上搜到 Qwen-MM-Plugins——阿里系开源插件,一次性给 Claude Code 加 8 个能力:识图、云端 VL/Omni、长视频记忆、搜索、视频剪辑……看起来最全。

但我的环境很特殊:Windows 10 原生,无 WSL 发行版、无 bash、无 git,claude CLI 不在 PATH。官方安装器面向 Linux/macOS/WSL2,原生 Windows 标注"尚未完成验证"。于是只能手动装配。下面是全程踩坑实录,给想在原生 Windows 上折腾的人省点时间。

  • 环境:Windows 10 原生,无 WSL、无 bash、无 git、claude CLI 不在 PATH
  • 账号:阿里云百炼,模型 qwen3.5-omni-plus-2026-03-15(定版快照)

一句话结论

原生 Windows 上为识图折腾它,不值;它唯一让我觉得"这套东西有点东西"的,只有 video-memory(长视频记忆)。

  • 识图(core + api)那部分,因为"粘贴的截图要找文件路径"而失败——最终被 claude-vision-skill--clipboard(直接读剪贴板)秒杀;
  • 长视频(video-memory)是真价值,但我已有更顺手的方案:B 站视频字幕一键存进 Obsidian 本地知识库,交给 AI 整理
  • 最终:卸载 Qwen-MM-Plugins,识图改用 claude-vision-skill。

踩坑实录

坑 1:官方安装器在原生 Windows 上根本跑不了

官方 install.sh 引导器面向 Linux/macOS/WSL2,原生 Windows 标注"尚未完成验证"。我的环境连 bash 都没有,wsl --list 也是空。所以唯一路径是手动装配uvx 从本地源码构建包 + 手动注册 skill + 手动注册 MCP server。

坑 2:uv 和 ffmpeg 都得自己装,ffmpeg 装完不在 PATH

  • uv:python -m pip install uv(简单,装完直接可用);
  • ffmpeg:winget install --id Gyan.FFmpeg -e,但 winget 装完当前终端 PATH 不刷新,必须手动把 ...\Gyan.FFmpeg_...\ffmpeg-9.0-full_build\bin 加进用户 PATH 并重开终端,否则 read_video / 转写全报"找不到 ffmpeg"。

坑 3:源码放中文路径,uv 构建直接失败

工作目录在 F:\桌面\...(含中文),uvx --from "F:\桌面\...\[core]" 构建报错。必须把源码复制到纯 ASCII 路径C:\Users\Administrator\qwen-mm-plugins\Qwen-MM-Plugins-main)才构建成功。

坑 4:模型默认值不是你的型号,要改 4+ 处

源码默认 VL 模型 qwen3.7-plus、Omni 模型 qwen3.5-omni-plus(无日期后缀)。你的账号开通的是定版快照 qwen3.5-omni-plus-2026-03-15,不改默认值直接 404。要改的位置:

文件 改什么
src/shared/api_openai.py DEFAULT_MODEL
src/shared/api_omni.py DEFAULT_OMNI_MODEL
src/capabilities/video-memory/skill/script/build_memory/llm_client.py DEFAULT_MODEL
src/capabilities/video-memory/skill/script/build_memory/pipeline_worker.py --model 默认值
(Mac/Linux 还要改)build_memory.sh MODEL="..."

坑 5:API key 要双保险

  • ~/.qwen-mm-plugins/config(KEY=VALUE 每行一行)——源码约定:环境变量 > 配置文件 > 默认值,GUI 启动的客户端不继承 shell export,config 文件是兜底;
  • 另外在 .mcp.json / ~/.claude.json 每个 server 的 env 块里再冗余写一份。

坑 6:改完源码要重建,uvx 有缓存

改完模型默认值后直接跑 MCP server,uvx 用的是缓存的旧 wheel。必须 uvx --from "<路径>[@x]" --refresh qwen-mm-plugins-<cap> 或清 %LOCALAPPDATA%\uv\cache,改动才生效。

坑 7:装完必须重启 Claude Code

skill 和 MCP 都是启动时加载的,装完不重启,工具根本不出现。第一次折腾时还以为装失败了。

坑 8:8 个能力大半用不上

能力 评价 最终处置
core(本地读图/视频/文档) 读图被剪贴板方案取代 卸载
api(云端 VL / Omni / OCR / ASR) 识图同上;音视频理解有更顺手的方案 卸载
video-memory(长视频记忆) 唯一真价值:层次图记忆 + 语义检索,30min+ 视频独一份 卸载(有替代)
search(联网/反查图) 联网搜索被 tavily 覆盖,反查图要另配 Serper key 不装
video-edit / blender / freecad / edu-agent 需要额外装 Blender/FreeCAD/Node 等,不需要 不装

用下来的真实感受

识图:输给了 claude-vision-skill

Qwen-MM-Plugins 的 read_image / vision_chat 都要先拿到图片的绝对路径再喂给模型。但你在对话框粘贴截图时,文件可能落在项目目录,也可能落在 %TEMP%\ScreenShot_*.png——大海捞针。每张图都要先 PowerShell 搜目录、猜最新文件,才能读。

而 claude-vision-skill 直接 --clipboard系统剪贴板:截图后剪贴板里还有图,粘贴即读,零找路径。识图这一仗,简单粗暴的脚本完胜。

长视频:video-memory 是这套东西最亮的部分,但被更顺手的方案取代

30 分钟以上视频,它构建一棵 4 层记忆树(Root → SuperEvent → MacroEvent → Subgraph),之后支持:语义搜实体/事件、搜屏幕文字(比分/字幕)、搜语音台词、按时间定位、事件计数。这个思路确实是独一份的。但实际体验下来,构建记忆要跑一整遍 ASR + VL(烧 token),而我的真实需求——“把视频内容沉淀成能搜索的本地知识”——用更简单的链路就解决了:

替代方案(视频内容 → 本地知识库)

  1. 批量视频转字幕:用批量转字幕小工具,或通义听悟做 AI 转写(免费额度充足);
  2. B 站视频一键存 ObsidianBilibili-Obsidian-Clipper 浏览器插件抓取视频字幕(作者/AI 字幕、多语言),配合 Obsidian Local REST API 插件(本地 HTTP,端口 27123)直接写成本地 Markdown;
  3. AI 整理:仓库里写 CLAUDE.md 定死输出规范,用 Obsidian 的 Terminal / Claudian 插件调 Claude,把纯文本字幕整理成结构化笔记;
  4. 结果进知识库随时全文搜索,原字幕归档。

详见原文:B站视频一键保存到 Obsidian:打通本地知识库

相比之下 video-memory 的"4 层图记忆 + 语义检索"更适合对单个长视频做深度问答(“45:30 发生了什么”、“进了几个球”),但为了这个去跑一整遍 ASR+VL 构建,日常知识沉淀场景不值。所以还是卸了。

最终取舍

处置
Qwen-MM-Plugins 全部 skill + MCP ✅ 卸载(源码、配置、CLAUDE.md 全清)
识图 ✅ 改用 claude-vision-skill(--clipboard 读剪贴板)
长视频 ✅ 改用 B 站字幕→Obsidian+AI 方案(tMtijfVX

经验

这次折腾最大的收获是三个判断:

  1. 识别类能力,剪贴板方案永远比路径方案好用。 只要"找文件路径"这一步让 Agent 来做,体验就崩了;直接读剪贴板才是人机协作的正确姿势。
  2. 能力最全 ≠ 最合适。 Qwen-MM-Plugins 一次给 8 个能力,但真正让我觉得"有点东西"的只有一个 video-memory,其余都有更轻的替代。装东西前先想清楚自己到底要哪一项。
  3. 原生 Windows 折腾这类 Linux 向项目,成本极高。 光 uv、ffmpeg、ASCII 路径、模型默认值、uvx 缓存这几个坑就够喝一壶——不是非装不可,真不建议碰。

给后来人的建议:

  • 只在原生 Windows 上为了识图装它? 别折腾,直接上 claude-vision-skill 这类剪贴板方案;
  • 真的需要 video-memory 这种长视频图记忆? 可以装,但只装 video-memory 一个能力即可(core 会被它自动依赖),其他按需;
  • 无论如何:先确认 uv + ffmpeg + ASCII 路径 + 模型默认值 四件套,装完记得重启 Claude Code

参考资料

原创

原生 Windows 折腾 Qwen-MM-Plugins:踩了 8 个坑,最后还是卸了

本文链接: 原生 Windows 折腾 Qwen-MM-Plugins:踩了 8 个坑,最后还是卸了

本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

评论交流

文章目录