Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Opus 4.8

Claude Opus 4.8:Vellum 跨模型基准对照与 Harness 边界

原始来源

Vellum

作者Nicolas Zeeb

原文日期2026-05-28

Tabbit 整理2026-08-19

查看原文

一句话结论

Vellum 对 Anthropic 系统卡的逐项整理显示 Opus 4.8 在多数公开对照中领先,但 Terminal-Bench 的 harness 差异和 Finance Agent v2 的反例说明选型必须按同一工具环境与垂直任务复测。

适用场景

  • 适合的任务:比较编码、终端 Agent、推理、电脑使用和专业知识工作方向的公开信号。

  • 不适合的任务:把文章中的二手整理当作自己的生产验收,或把一个 benchmark 直接外推到所有领域。

  • 适用的模型版本:Claude Opus 4.8,对照 Opus 4.7、GPT-5.5、Gemini 3.1 Pro,Finance Agent v2 还包含 Gemini 3.5 Flash。

  • 适用的客户端、Agent 或 API:文章讨论系统卡中的 Terminus-2/Codex CLI 等 harness;实际 API/客户端需按自己的工具栈重跑。

  • 推荐的推理档位和参数:文章主要转述官方默认 effort,完整运行参数、随机种子和输入未公开;不要据此固定参数。

测试环境

  • 数据/方法:Vellum 对 Anthropic Claude Opus 4.8 System Card Table 8.1.A 的公开结果逐项整理,并解释不同 harness 的影响。

  • 对照模型:Opus 4.7、GPT-5.5、Gemini 3.1 Pro;Finance Agent v2 另含 Gemini 3.5 Flash。

  • 复现程度:来源给出 benchmark 名称、分数和部分 harness 说明,但没有发布原始输入、完整配置或独立运行日志,因此这里的“可复现”仅限按公开表格和 benchmark 名称重新核验,不能称为 Vellum 独立重跑。

输入/配置

  • SWE-Bench Pro:多文件、活跃仓库问题;文章指出其比普通 SWE-bench 更难且更少受记忆泄漏影响。

  • Terminal-Bench 2.1:同一公共 Terminus-2 harness 下对照;GPT-5.5 另有 Codex CLI headline,不能直接和 Terminus-2 数字横比。

  • OSWorld-Verified:真实 Ubuntu VM 中的文档编辑、网页浏览和文件管理任务。

  • HLE、GDPval-AA、Finance Agent v2:文章报告公开系统卡中的分数与任务类型,但未提供逐题输入和运行日志。

结果数据

基准Opus 4.8主要对照与说明
SWE-Bench Pro pass rate69.2%Opus 4.7 64.3%,GPT-5.5 58.6%,Gemini 3.1 Pro 54.2%
SWE-bench Verified88.6%Opus 4.7 87.6%,Gemini 3.1 Pro 80.6%
Terminal-Bench 2.1 / Terminus-274.6%GPT-5.5 Terminus-2 78.2%,Gemini 3.1 Pro 70.3%,Opus 4.7 66.1%;GPT-5.5 Codex CLI headline 为 83.4%
HLE(无工具)49.8%Opus 4.7 46.9%,Gemini 3.1 Pro 44.4%,GPT-5.5 41.4%
HLE(有工具)57.9%Opus 4.7 54.7%,GPT-5.5 52.2%,Gemini 3.1 Pro 51.4%
OSWorld-Verified pass@183.4%Opus 4.7 82.8%,GPT-5.5 78.7%,Gemini 3.1 Pro 76.2%
GDPval-AA1,890GPT-5.5 1,769,Opus 4.7 1,753,Gemini 3.1 Pro 1,314
Finance Agent v253.9%Gemini 3.5 Flash 57.9%,GPT-5.5 51.8%,Opus 4.7 51.5%,Gemini 3.1 Pro 43.0%

结论

公开对照中,Opus 4.8 在 SWE-Bench Pro、HLE、OSWorld-Verified 和 GDPval-AA 等任务领先;但 Terminal-Bench 的 GPT-5.5 结果随 harness 从 83.4%(Codex CLI)变为 78.2%(Terminus-2),Finance Agent v2 则由更小更快的 Gemini 3.5 Flash 领先。最稳妥的结论是:Opus 4.8 适合复杂编码与知识工作,但垂直领域和工具环境仍需单独评测。

局限

  • Vellum 的数字主要来自 Anthropic 系统卡,不是 Vellum 重新运行的原始实验;文章没有完整输入、配置、随机种子或原始日志。

  • 系统卡分数存在 harness、工具、token 上限和版本修订影响;OSWorld 的 Opus 4.7 数字还注明了 zoom 工具修复和 max token 上限变化。

  • HLE、GDPval-AA、Finance Agent v2 的任务分布、评分细则和成本不在文章全文中公开;不能据此估算真实 ROI。

  • 文章的“多数领先”不意味着每个领域都领先,尤其不能忽略 Finance Agent v2 的反例。

复现步骤

  1. 先固定同一模型版本、同一工具 harness、容器/VM、token 上限和评分脚本。

  2. 优先复跑 SWE-Bench Pro、Terminal-Bench 2.1 和 OSWorld-Verified,并同时记录 pass rate、工具步数、token、耗时和失败类型。

  3. 对 GPT-5.5 等模型分别在 Codex CLI 与 Terminus-2 上运行,禁止把不同 harness 的数字放在同一列直接比较。

  4. 为目标业务另建 Finance Agent 或知识工作子集,报告置信区间和成本,不要把公开分数当成生产保证。

来源摘录或观察(仅做合规短引)

Vellum 最有价值的观察不是“Opus 4.8 赢了几项”,而是 Terminal-Bench 的“harness matters as much as the model”。这也是复核该对照时必须保留的适用边界。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Opus 4.8

在 Tabbit 中使用并对比模型

Claude Opus 4.8

相关测评

媒体Anthropic Newsroom2026-05-28

Claude Opus 4.8:官方发布能力、Agent 工作流与诚实性边界

Claude Opus 4.8

相关提示词

媒体Anthropic Claude Platform Docs

Claude Opus 4.8:努力档位、工具调用与代码审查提示模式

社区Reddit / r/PromptEngineering2026-05-28

Claude Opus 4.8:Max 努力档位的高风险任务提示