原生 Windows 折腾 Qwen-MM-Plugins:踩了 8 个坑,最后还是卸了
真实折腾记录:2026-08-12,在没有 WSL、没有 git 的原生 Windows 上,手动装配 Qwen-MM-Plugins 全套能力,装完用了一圈又卸掉。
需求
Claude Code 好用,但我的模型通道(DeepSeek 这类)原生没有识图能力。想让 Agent 能读截图、处理长视频,就得外挂视觉能力。网上搜到 Qwen-MM-Plugins——阿里系开源插件,一次性给 Claude Code 加 8 个能力:识图、云端 VL/Omni、长视频记忆、搜索、视频剪辑……看起来最全。
但我的环境很特殊:Windows 10 原生,无 WSL 发行版、无 bash、无 git,claude CLI 不在 PATH。官方安装器面向 Linux/macOS/WSL2,原生 Windows 标注"尚未完成验证"。于是只能手动装配。下面是全程踩坑实录,给想在原生 Windows 上折腾的人省点时间。
- 环境:Windows 10 原生,无 WSL、无 bash、无 git、claude CLI 不在 PATH
- 账号:阿里云百炼,模型
qwen3.5-omni-plus-2026-03-15(定版快照)
一句话结论
原生 Windows 上为识图折腾它,不值;它唯一让我觉得"这套东西有点东西"的,只有 video-memory(长视频记忆)。
- 识图(core + api)那部分,因为"粘贴的截图要找文件路径"而失败——最终被 claude-vision-skill 的
--clipboard(直接读剪贴板)秒杀; - 长视频(video-memory)是真价值,但我已有更顺手的方案:B 站视频字幕一键存进 Obsidian 本地知识库,交给 AI 整理;
- 最终:卸载 Qwen-MM-Plugins,识图改用 claude-vision-skill。
踩坑实录
坑 1:官方安装器在原生 Windows 上根本跑不了
官方 install.sh 引导器面向 Linux/macOS/WSL2,原生 Windows 标注"尚未完成验证"。我的环境连 bash 都没有,wsl --list 也是空。所以唯一路径是手动装配:uvx 从本地源码构建包 + 手动注册 skill + 手动注册 MCP server。
坑 2:uv 和 ffmpeg 都得自己装,ffmpeg 装完不在 PATH
- uv:
python -m pip install uv(简单,装完直接可用); - ffmpeg:
winget install --id Gyan.FFmpeg -e,但 winget 装完当前终端 PATH 不刷新,必须手动把...\Gyan.FFmpeg_...\ffmpeg-9.0-full_build\bin加进用户 PATH 并重开终端,否则read_video/ 转写全报"找不到 ffmpeg"。
坑 3:源码放中文路径,uv 构建直接失败
工作目录在 F:\桌面\...(含中文),uvx --from "F:\桌面\...\[core]" 构建报错。必须把源码复制到纯 ASCII 路径(C:\Users\Administrator\qwen-mm-plugins\Qwen-MM-Plugins-main)才构建成功。
坑 4:模型默认值不是你的型号,要改 4+ 处
源码默认 VL 模型 qwen3.7-plus、Omni 模型 qwen3.5-omni-plus(无日期后缀)。你的账号开通的是定版快照 qwen3.5-omni-plus-2026-03-15,不改默认值直接 404。要改的位置:
| 文件 | 改什么 |
|---|---|
src/shared/api_openai.py |
DEFAULT_MODEL |
src/shared/api_omni.py |
DEFAULT_OMNI_MODEL |
src/capabilities/video-memory/skill/script/build_memory/llm_client.py |
DEFAULT_MODEL |
src/capabilities/video-memory/skill/script/build_memory/pipeline_worker.py |
--model 默认值 |
(Mac/Linux 还要改)build_memory.sh |
MODEL="..." |
坑 5:API key 要双保险
~/.qwen-mm-plugins/config(KEY=VALUE 每行一行)——源码约定:环境变量 > 配置文件 > 默认值,GUI 启动的客户端不继承 shell export,config 文件是兜底;- 另外在
.mcp.json/~/.claude.json每个 server 的env块里再冗余写一份。
坑 6:改完源码要重建,uvx 有缓存
改完模型默认值后直接跑 MCP server,uvx 用的是缓存的旧 wheel。必须 uvx --from "<路径>[@x]" --refresh qwen-mm-plugins-<cap> 或清 %LOCALAPPDATA%\uv\cache,改动才生效。
坑 7:装完必须重启 Claude Code
skill 和 MCP 都是启动时加载的,装完不重启,工具根本不出现。第一次折腾时还以为装失败了。
坑 8:8 个能力大半用不上
| 能力 | 评价 | 最终处置 |
|---|---|---|
core(本地读图/视频/文档) |
读图被剪贴板方案取代 | 卸载 |
api(云端 VL / Omni / OCR / ASR) |
识图同上;音视频理解有更顺手的方案 | 卸载 |
video-memory(长视频记忆) |
唯一真价值:层次图记忆 + 语义检索,30min+ 视频独一份 | 卸载(有替代) |
search(联网/反查图) |
联网搜索被 tavily 覆盖,反查图要另配 Serper key | 不装 |
video-edit / blender / freecad / edu-agent |
需要额外装 Blender/FreeCAD/Node 等,不需要 | 不装 |
用下来的真实感受
识图:输给了 claude-vision-skill
Qwen-MM-Plugins 的 read_image / vision_chat 都要先拿到图片的绝对路径再喂给模型。但你在对话框粘贴截图时,文件可能落在项目目录,也可能落在 %TEMP%\ScreenShot_*.png——大海捞针。每张图都要先 PowerShell 搜目录、猜最新文件,才能读。
而 claude-vision-skill 直接 --clipboard 读系统剪贴板:截图后剪贴板里还有图,粘贴即读,零找路径。识图这一仗,简单粗暴的脚本完胜。
长视频:video-memory 是这套东西最亮的部分,但被更顺手的方案取代
30 分钟以上视频,它构建一棵 4 层记忆树(Root → SuperEvent → MacroEvent → Subgraph),之后支持:语义搜实体/事件、搜屏幕文字(比分/字幕)、搜语音台词、按时间定位、事件计数。这个思路确实是独一份的。但实际体验下来,构建记忆要跑一整遍 ASR + VL(烧 token),而我的真实需求——“把视频内容沉淀成能搜索的本地知识”——用更简单的链路就解决了:
替代方案(视频内容 → 本地知识库):
- 批量视频转字幕:用批量转字幕小工具,或通义听悟做 AI 转写(免费额度充足);
- B 站视频一键存 Obsidian:Bilibili-Obsidian-Clipper 浏览器插件抓取视频字幕(作者/AI 字幕、多语言),配合 Obsidian Local REST API 插件(本地 HTTP,端口 27123)直接写成本地 Markdown;
- AI 整理:仓库里写
CLAUDE.md定死输出规范,用 Obsidian 的 Terminal / Claudian 插件调 Claude,把纯文本字幕整理成结构化笔记; - 结果进知识库随时全文搜索,原字幕归档。
详见原文:B站视频一键保存到 Obsidian:打通本地知识库
相比之下 video-memory 的"4 层图记忆 + 语义检索"更适合对单个长视频做深度问答(“45:30 发生了什么”、“进了几个球”),但为了这个去跑一整遍 ASR+VL 构建,日常知识沉淀场景不值。所以还是卸了。
最终取舍
| 项 | 处置 |
|---|---|
| Qwen-MM-Plugins 全部 skill + MCP | ✅ 卸载(源码、配置、CLAUDE.md 全清) |
| 识图 | ✅ 改用 claude-vision-skill(--clipboard 读剪贴板) |
| 长视频 | ✅ 改用 B 站字幕→Obsidian+AI 方案(tMtijfVX) |
经验
这次折腾最大的收获是三个判断:
- 识别类能力,剪贴板方案永远比路径方案好用。 只要"找文件路径"这一步让 Agent 来做,体验就崩了;直接读剪贴板才是人机协作的正确姿势。
- 能力最全 ≠ 最合适。 Qwen-MM-Plugins 一次给 8 个能力,但真正让我觉得"有点东西"的只有一个 video-memory,其余都有更轻的替代。装东西前先想清楚自己到底要哪一项。
- 原生 Windows 折腾这类 Linux 向项目,成本极高。 光 uv、ffmpeg、ASCII 路径、模型默认值、uvx 缓存这几个坑就够喝一壶——不是非装不可,真不建议碰。
给后来人的建议:
- 只在原生 Windows 上为了识图装它? 别折腾,直接上 claude-vision-skill 这类剪贴板方案;
- 真的需要 video-memory 这种长视频图记忆? 可以装,但只装
video-memory一个能力即可(core 会被它自动依赖),其他按需; - 无论如何:先确认 uv + ffmpeg + ASCII 路径 + 模型默认值 四件套,装完记得重启 Claude Code。
参考资料
- Qwen-MM-Plugins 项目:github.com/QwenLM/Qwen-MM-Plugins
- claude-vision-skill(识图替代方案):github.com/asuojun/claude-vision-skill
- Bilibili-Obsidian-Clipper(长视频替代方案):github.com/haixiong1997/Bilibili-Obsidian-Clipper
- 相关博客:B站视频一键保存到 Obsidian:打通本地知识库