DeepSeek V4 Flash · 社区来源 · 独立测量
Reddit 作者在 OpenRouter 上用 25 个自动化任务比较 8 个 harness:Pi Agent 66.7% 通过率,OpenCode 46.7%,成功成本约 $0.028 与 $0.073。
作者认为 model-harness fit(模型与框架的适配度)是真实存在的:同一模型在不同 harness 上表现差异巨大。日常用 OpenCode 和 Hermes 驱动 DeepSeek V4 Flash,成本差异明显,于是用 DeepSeek V4 Flash(via OpenRouter)在 8 个流行 harness 上跑基准:25 个涉及多应用(Slack、Sheets、Gmail、PostHog 等)的真实自动化任务。
| Harness | Pass rate | Median time | Tool calls | Cost per success |
|---|---|---|---|---|
| Pi Agent | 66.7% | 132.2s | 443 | $0.028 |
| Prime Agent | 62.5%* | 242.1s | 502 | $0.131 |
| OMP | 56.7% | 272.4s | 390 | $0.103 |
| Claude Code | 53.3% | 122.7s | 358 | $0.195 |
| Codex | 53.3% | 245.0s | 448 | $0.081 |
| DeepAgents | 53.3% | 187.1s | 353 | $0.045 |
| Hermes Agent | 50.0% | 175.5s | 386 | $0.056+ |
| OpenCode | 46.7% | 129.7s | 419 | $0.073 |
通过率与工具调用:
Pi Agent 通过率最高 66.7%,OpenCode 最低 46.7%
更多工具调用并不带来更好结果:DeepAgents 353 次、Codex 448 次都通过 16 个任务;OMP 390 次通过 17 个;OpenCode 419 次只通过 14 个
Prime Agent 通过 24 个有效运行中的 15 个,工具调用最多(502 次)
成本与 token:
Claude Code 单次成功成本最高 $0.195,Pi 最低 $0.028
Claude Code 与 OMP 每个任务约用 742K tokens,但 Claude Code 贵近一倍:缓存命中仅 1.5%(Codex 70%、OMP 57%)
Prime Agent 每任务 1.4M tokens 最费;Hermes 最少约 192K
时间:
Claude Code 中位时间最短 122.7s;OpenCode 129.7s;Pi 132.2s;OMP 最长 272.4s 但通过任务比 Claude Code 多一个
Pi Agent 是 DeepSeek V4 Flash 的最佳 harness:准确率最高且最便宜
Claude Code 是"烧钱大户"
模型与框架的适配(缓存利用、工具调用效率)显著影响真实成本和效果
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Reddit r/DeepSeek · u/LimpComedian1317 · 原文发布日期 Unknown · 本站编辑日期 2026-09-20
打开原始来源DeepSeek V4 Flash
下载 Tabbit 客户端后检查模型可用性