Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区DeepSeek V4 Flash

I ran DeepSeek V4 Flash on 8 agent harnesses(Reddit r/DeepSeek)

原始来源

Reddit r/DeepSeek

作者u/LimpComedian1317

Tabbit 整理2026-08-19

查看原文

背景

作者认为 model-harness fit(模型与框架的适配度)是真实存在的:同一模型在不同 harness 上表现差异巨大。日常用 OpenCode 和 Hermes 驱动 DeepSeek V4 Flash,成本差异明显,于是用 DeepSeek V4 Flash(via OpenRouter)在 8 个流行 harness 上跑基准:25 个涉及多应用(Slack、Sheets、Gmail、PostHog 等)的真实自动化任务。

结果表

HarnessPass rateMedian timeTool callsCost per success
Pi Agent66.7%132.2s443$0.028
Prime Agent62.5%*242.1s502$0.131
OMP56.7%272.4s390$0.103
Claude Code53.3%122.7s358$0.195
Codex53.3%245.0s448$0.081
DeepAgents53.3%187.1s353$0.045
Hermes Agent50.0%175.5s386$0.056+
OpenCode46.7%129.7s419$0.073

关键发现

通过率与工具调用:

  • Pi Agent 通过率最高 66.7%,OpenCode 最低 46.7%

  • 更多工具调用并不带来更好结果:DeepAgents 353 次、Codex 448 次都通过 16 个任务;OMP 390 次通过 17 个;OpenCode 419 次只通过 14 个

  • Prime Agent 通过 24 个有效运行中的 15 个,工具调用最多(502 次)

成本与 token:

  • Claude Code 单次成功成本最高 $0.195,Pi 最低 $0.028

  • Claude Code 与 OMP 每个任务约用 742K tokens,但 Claude Code 贵近一倍:缓存命中仅 1.5%(Codex 70%、OMP 57%)

  • Prime Agent 每任务 1.4M tokens 最费;Hermes 最少约 192K

时间:

  • Claude Code 中位时间最短 122.7s;OpenCode 129.7s;Pi 132.2s;OMP 最长 272.4s 但通过任务比 Claude Code 多一个

结论

  • Pi Agent 是 DeepSeek V4 Flash 的最佳 harness:准确率最高且最便宜

  • Claude Code 是"烧钱大户"

  • 模型与框架的适配(缓存利用、工具调用效率)显著影响真实成本和效果

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

DeepSeek V4 Flash

在 Tabbit 中使用并对比模型

DeepSeek V4 Flash

相关测评

官方DeepSeek API Docs2026-07-31

DeepSeek-V4-Flash:0731 更新基准与 Harness 条件

官方deepseek.ai(独立网站,与 DeepSeek 官方无关)

DeepSeek V4 Flash Review (2026) — Specs, Tests & Speed

媒体MindStudio2026-08-01

DeepSeek-V4-Flash:本地部署量化与 Agent 实测

媒体Lightning AI 博客2026-04-27

DeepSeek V4 Alters Everything We Knew About Price-Performance Math(Lightning AI)

DeepSeek V4 Flash

相关提示词

官方DeepSeek API Docs2026-07-31

DeepSeek-V4-Flash:0731 思考档位与工具调用配置

官方DeepSeek API Docs2026-07-31

DeepSeek-V4-Flash:Codex Responses API 接入工作流

媒体腾讯云开发者社区(cloud.tencent.com)2026-06-05

别让 AI 把你气哭:2026年 DeepSeek-V4 提示词终极指南

社区GitHub 仓库 victorchen96/deepseekv4rolepalyinstruct(官方英文版 README)

DeepSeek V4 - 20260424 Version Roleplay — Thinking Mode Switching Guide (English version)