精选的想法、故事和创意,全部汇集于此!

文章背景图

GPT在各个agent里的表现

2026-10-05
0
- 字
- 分钟

Pi Desktop / Codex / DSH 同任务实测对比

本次,分别测试 Pi Desktop、Codex 和 DSH。让他们读视频并根据视频内容生成视频标题进行重命名

综合来看:

Pi 的 Token 最少、完成速度最快,但任务质量最差;Codex 消耗较高,但最终任务效果最好;DSH 处于两者之间,但耗时最长、Token 也最高。

1. 数据对比

指标 Pi Codex(本会话) DSH
任务耗时 2分53秒 4分50秒 7分42秒
总 Token(含缓存) 223,841 1,164,738 1,200,761
未缓存输入 53,644 51,179 71,237
缓存读取 165,376 1,108,992 1,122,816
输出 Token 4,821 4,567 6,708
缓存命中率 75.5% 95.59% 94.03%

2. 任务质量排名

🥇 Codex:任务效果最好

任务质量:第一

Codex 在这次测试中的最终完成效果最好。

主要表现:

  • 对任务要求理解最准确
  • 执行过程更加完整
  • 最终成果完成度最高
  • 出现严重理解偏差的情况最少
  • 能更好地把任务真正做完,而不是单纯减少 Token

虽然 Codex 的总 Token 达到了:

1,164,738 Token

明显高于 Pi,但其中绝大部分来自缓存读取。

Codex 的未缓存输入实际上只有:

51,179 Token

甚至比 Pi 的 53,644 Token 还低。

缓存命中率达到:

95.59%

因此不能简单根据「总 Token」判断 Codex 实际成本很高。

结论:如果优先考虑最终成果质量,Codex 是这次测试里明显最好的选择。

🥈 DSH:任务质量中等

任务质量:第二

DSH 的整体理解能力位于 Codex 和 Pi 之间。

表现特点:

  • 没有出现特别严重的任务理解错误
  • 整体方向基本正确
  • 但最终成果不足 / 没有形成理想的最终成果
  • 完成质量明显不如 Codex
  • 同时执行时间最长

DSH 耗时:

7分42秒

总 Token:

1,200,761

也是三者中最高。

未缓存输入:

71,237 Token

同样是三者最高。

所以 DSH 这次测试比较明显的问题是:

花费了最多时间和最多 Token,但最终任务质量只有中等。

从「资源消耗 → 最终成果」的转换效率来看,这次表现不算理想。


🥉 Pi Desktop:速度最快、Token 最低,但质量最差

任务质量:第三

Pi 最大的优势非常明显:

  • Token 最少
  • 执行速度最快

整个任务只用了:

2分53秒

总 Token:

223,841

相比 DSH:

  • 总 Token 少约 81.4%
  • DSH 的总 Token 约为 Pi 的 5.36 倍
  • 用时少约 4分49秒
  • 耗时缩短约 62.6%
  • DSH 耗时约为 Pi 的 2.67 倍

即使只比较未缓存输入:

  • Pi:53,644
  • DSH:71,237

Pi 仍然少约:

24.7%

所以单纯看运行效率:

Pi 是三者里最快、最省 Token 的。

但是最大的代价就是:

任务质量也是三者里最差的。

说明 Pi 更倾向于快速完成任务、控制上下文和 Token 使用,但这种压缩会影响复杂任务的理解深度与最终成果质量。


3. 三者核心差异

项目 Pi Codex DSH
任务质量 ❌ 最差 ✅ 最好 ⚠️ 中等
完成速度 ✅ 最快 🟡 中等 ❌ 最慢
总 Token ✅ 最低 较高 ❌ 最高
未缓存输入 🟡 中等 ✅ 最低 ❌ 最高
缓存命中率 ❌ 最低 ✅ 最高 很高
最终成果 较差 ✅ 最好 不理想
严重理解错误 较明显 ✅ 最少 没有明显严重错误
综合任务完成能力 较弱 ✅ 最强 中等
原创

GPT在各个agent里的表现

本文链接: GPT在各个agent里的表现

本文采用 CC BY-NC-SA 4.0 许可协议,转载请注明出处。

评论交流

文章目录