作者认为 model-harness fit(模型与框架的适配度)是真实存在的:同一模型在不同 harness 上表现差异巨大。日常用 OpenCode 和 Hermes 驱动 DeepSeek V4 Flash,成本差异明显,于是用 DeepSeek V4 Flash(via OpenRouter)在 8 个流行 harness 上跑基准:25 个涉及多应用(Slack、Sheets、Gmail、PostHog 等)的真实自动化任务。
| Harness | Pass rate | Median time | Tool calls | Cost per success |
|---|---|---|---|---|
| Pi Agent | 66.7% | 132.2s | 443 | $0.028 |
| Prime Agent | 62.5%* | 242.1s | 502 | $0.131 |
| OMP | 56.7% | 272.4s | 390 | $0.103 |
| Claude Code | 53.3% | 122.7s | 358 | $0.195 |
| Codex | 53.3% | 245.0s | 448 | $0.081 |
| DeepAgents | 53.3% | 187.1s | 353 | $0.045 |
| Hermes Agent | 50.0% | 175.5s | 386 | $0.056+ |
| OpenCode | 46.7% | 129.7s | 419 | $0.073 |
通过率与工具调用:
Pi Agent 通过率最高 66.7%,OpenCode 最低 46.7%
更多工具调用并不带来更好结果:DeepAgents 353 次、Codex 448 次都通过 16 个任务;OMP 390 次通过 17 个;OpenCode 419 次只通过 14 个
Prime Agent 通过 24 个有效运行中的 15 个,工具调用最多(502 次)
成本与 token:
Claude Code 单次成功成本最高 $0.195,Pi 最低 $0.028
Claude Code 与 OMP 每个任务约用 742K tokens,但 Claude Code 贵近一倍:缓存命中仅 1.5%(Codex 70%、OMP 57%)
Prime Agent 每任务 1.4M tokens 最费;Hermes 最少约 192K
时间:
Claude Code 中位时间最短 122.7s;OpenCode 129.7s;Pi 132.2s;OMP 最长 272.4s 但通过任务比 Claude Code 多一个
Pi Agent 是 DeepSeek V4 Flash 的最佳 harness:准确率最高且最便宜
Claude Code 是"烧钱大户"
模型与框架的适配(缓存利用、工具调用效率)显著影响真实成本和效果
DeepSeek V4 Flash