Pi Desktop / Codex / DSH 同任务实测对比
本次,分别测试 Pi Desktop、Codex 和 DSH。让他们读视频并根据视频内容生成视频标题进行重命名
综合来看:
Pi 的 Token 最少、完成速度最快,但任务质量最差;Codex 消耗较高,但最终任务效果最好;DSH 处于两者之间,但耗时最长、Token 也最高。
1. 数据对比
| 指标 | Pi | Codex(本会话) | DSH |
|---|---|---|---|
| 任务耗时 | 2分53秒 | 4分50秒 | 7分42秒 |
| 总 Token(含缓存) | 223,841 | 1,164,738 | 1,200,761 |
| 未缓存输入 | 53,644 | 51,179 | 71,237 |
| 缓存读取 | 165,376 | 1,108,992 | 1,122,816 |
| 输出 Token | 4,821 | 4,567 | 6,708 |
| 缓存命中率 | 75.5% | 95.59% | 94.03% |
2. 任务质量排名
🥇 Codex:任务效果最好
任务质量:第一
Codex 在这次测试中的最终完成效果最好。
主要表现:
- 对任务要求理解最准确
- 执行过程更加完整
- 最终成果完成度最高
- 出现严重理解偏差的情况最少
- 能更好地把任务真正做完,而不是单纯减少 Token
虽然 Codex 的总 Token 达到了:
1,164,738 Token
明显高于 Pi,但其中绝大部分来自缓存读取。
Codex 的未缓存输入实际上只有:
51,179 Token
甚至比 Pi 的 53,644 Token 还低。
缓存命中率达到:
95.59%
因此不能简单根据「总 Token」判断 Codex 实际成本很高。
结论:如果优先考虑最终成果质量,Codex 是这次测试里明显最好的选择。
🥈 DSH:任务质量中等
任务质量:第二
DSH 的整体理解能力位于 Codex 和 Pi 之间。
表现特点:
- 没有出现特别严重的任务理解错误
- 整体方向基本正确
- 但最终成果不足 / 没有形成理想的最终成果
- 完成质量明显不如 Codex
- 同时执行时间最长
DSH 耗时:
7分42秒
总 Token:
1,200,761
也是三者中最高。
未缓存输入:
71,237 Token
同样是三者最高。
所以 DSH 这次测试比较明显的问题是:
花费了最多时间和最多 Token,但最终任务质量只有中等。
从「资源消耗 → 最终成果」的转换效率来看,这次表现不算理想。
🥉 Pi Desktop:速度最快、Token 最低,但质量最差
任务质量:第三
Pi 最大的优势非常明显:
- Token 最少
- 执行速度最快
整个任务只用了:
2分53秒
总 Token:
223,841
相比 DSH:
- 总 Token 少约 81.4%
- DSH 的总 Token 约为 Pi 的 5.36 倍
- 用时少约 4分49秒
- 耗时缩短约 62.6%
- DSH 耗时约为 Pi 的 2.67 倍
即使只比较未缓存输入:
- Pi:53,644
- DSH:71,237
Pi 仍然少约:
24.7%
所以单纯看运行效率:
Pi 是三者里最快、最省 Token 的。
但是最大的代价就是:
任务质量也是三者里最差的。
说明 Pi 更倾向于快速完成任务、控制上下文和 Token 使用,但这种压缩会影响复杂任务的理解深度与最终成果质量。
3. 三者核心差异
| 项目 | Pi | Codex | DSH |
|---|---|---|---|
| 任务质量 | ❌ 最差 | ✅ 最好 | ⚠️ 中等 |
| 完成速度 | ✅ 最快 | 🟡 中等 | ❌ 最慢 |
| 总 Token | ✅ 最低 | 较高 | ❌ 最高 |
| 未缓存输入 | 🟡 中等 | ✅ 最低 | ❌ 最高 |
| 缓存命中率 | ❌ 最低 | ✅ 最高 | 很高 |
| 最终成果 | 较差 | ✅ 最好 | 不理想 |
| 严重理解错误 | 较明显 | ✅ 最少 | 没有明显严重错误 |
| 综合任务完成能力 | 较弱 | ✅ 最强 | 中等 |