Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Claude Opus 4.8 · 媒体来源 · 独立测量

Claude Opus 4.8:Vellum 跨模型基准对照与 Harness 边界

Vellum 以列出的基准任务和模型选型比较 Claude Opus 4.8;不同 harness 混在一起,不能合并成单一跨任务排名。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

条件
模型/版本:claude-opus-4-8;按 Vellum 表格快照解释。
条件
Harness/任务:跨模型表格混合任务、参数与客户端;原始轨迹未完整公开。
条件
样本/日期:按文章快照解释;本轮重开 2026-09-20。

关键数据与适用场景

一句话结论

Vellum 对 Anthropic 系统卡的逐项整理显示 Opus 4.8 在多数公开对照中领先,但 Terminal-Bench 的 harness 差异和 Finance Agent v2 的反例说明选型必须按同一工具环境与垂直任务复测。

适用场景

  • 适合的任务:比较编码、终端 Agent、推理、电脑使用和专业知识工作方向的公开信号。

  • 不适合的任务:把文章中的二手整理当作自己的生产验收,或把一个 benchmark 直接外推到所有领域。

  • 适用的模型版本:Claude Opus 4.8,对照 Opus 4.7、GPT-5.5、Gemini 3.1 Pro,Finance Agent v2 还包含 Gemini 3.5 Flash。

  • 适用的客户端、Agent 或 API:文章讨论系统卡中的 Terminus-2/Codex CLI 等 harness;实际 API/客户端需按自己的工具栈重跑。

  • 推荐的推理档位和参数:文章主要转述官方默认 effort,完整运行参数、随机种子和输入未公开;不要据此固定参数。

测试环境

  • 数据/方法:Vellum 对 Anthropic Claude Opus 4.8 System Card Table 8.1.A 的公开结果逐项整理,并解释不同 harness 的影响。

  • 对照模型:Opus 4.7、GPT-5.5、Gemini 3.1 Pro;Finance Agent v2 另含 Gemini 3.5 Flash。

  • 复现程度:来源给出 benchmark 名称、分数和部分 harness 说明,但没有发布原始输入、完整配置或独立运行日志,因此这里的“可复现”仅限按公开表格和 benchmark 名称重新核验,不能称为 Vellum 独立重跑。

输入/配置

  • SWE-Bench Pro:多文件、活跃仓库问题;文章指出其比普通 SWE-bench 更难且更少受记忆泄漏影响。

  • Terminal-Bench 2.1:同一公共 Terminus-2 harness 下对照;GPT-5.5 另有 Codex CLI headline,不能直接和 Terminus-2 数字横比。

  • OSWorld-Verified:真实 Ubuntu VM 中的文档编辑、网页浏览和文件管理任务。

  • HLE、GDPval-AA、Finance Agent v2:文章报告公开系统卡中的分数与任务类型,但未提供逐题输入和运行日志。

结果数据

基准Opus 4.8主要对照与说明
SWE-Bench Pro pass rate69.2%Opus 4.7 64.3%,GPT-5.5 58.6%,Gemini 3.1 Pro 54.2%
SWE-bench Verified88.6%Opus 4.7 87.6%,Gemini 3.1 Pro 80.6%
Terminal-Bench 2.1 / Terminus-274.6%GPT-5.5 Terminus-2 78.2%,Gemini 3.1 Pro 70.3%,Opus 4.7 66.1%;GPT-5.5 Codex CLI headline 为 83.4%
HLE(无工具)49.8%Opus 4.7 46.9%,Gemini 3.1 Pro 44.4%,GPT-5.5 41.4%
HLE(有工具)57.9%Opus 4.7 54.7%,GPT-5.5 52.2%,Gemini 3.1 Pro 51.4%
OSWorld-Verified pass@183.4%Opus 4.7 82.8%,GPT-5.5 78.7%,Gemini 3.1 Pro 76.2%
GDPval-AA1,890GPT-5.5 1,769,Opus 4.7 1,753,Gemini 3.1 Pro 1,314
Finance Agent v253.9%Gemini 3.5 Flash 57.9%,GPT-5.5 51.8%,Opus 4.7 51.5%,Gemini 3.1 Pro 43.0%

结论

公开对照中,Opus 4.8 在 SWE-Bench Pro、HLE、OSWorld-Verified 和 GDPval-AA 等任务领先;但 Terminal-Bench 的 GPT-5.5 结果随 harness 从 83.4%(Codex CLI)变为 78.2%(Terminus-2),Finance Agent v2 则由更小更快的 Gemini 3.5 Flash 领先。最稳妥的结论是:Opus 4.8 适合复杂编码与知识工作,但垂直领域和工具环境仍需单独评测。

局限

  • Vellum 的数字主要来自 Anthropic 系统卡,不是 Vellum 重新运行的原始实验;文章没有完整输入、配置、随机种子或原始日志。

  • 系统卡分数存在 harness、工具、token 上限和版本修订影响;OSWorld 的 Opus 4.7 数字还注明了 zoom 工具修复和 max token 上限变化。

  • HLE、GDPval-AA、Finance Agent v2 的任务分布、评分细则和成本不在文章全文中公开;不能据此估算真实 ROI。

  • 文章的“多数领先”不意味着每个领域都领先,尤其不能忽略 Finance Agent v2 的反例。

复现步骤

  1. 先固定同一模型版本、同一工具 harness、容器/VM、token 上限和评分脚本。

  2. 优先复跑 SWE-Bench Pro、Terminal-Bench 2.1 和 OSWorld-Verified,并同时记录 pass rate、工具步数、token、耗时和失败类型。

  3. 对 GPT-5.5 等模型分别在 Codex CLI 与 Terminus-2 上运行,禁止把不同 harness 的数字放在同一列直接比较。

  4. 为目标业务另建 Finance Agent 或知识工作子集,报告置信区间和成本,不要把公开分数当成生产保证。

来源摘录或观察(仅做合规短引)

Vellum 最有价值的观察不是“Opus 4.8 赢了几项”,而是 Terminal-Bench 的“harness matters as much as the model”。这也是复核该对照时必须保留的适用边界。

能支持的判断

  • 支持在 Vellum 公开表格和任务分类内做选型讨论。

不能支持的判断

  • 不支持跨 harness 排名或把单次表格当作稳定当前榜单。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Vellum · Nicolas Zeeb · 原文发布日期 2026-05-28 · 本站编辑日期 2026-09-20

打开原始来源

Claude Opus 4.8

在 Tabbit 中比较 Claude Opus 4.8

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Claude Opus 4.8 是什么:变化、获取方式与 Legacy 状态

用官方与独立来源说明 Claude Opus 4.8 的 effort、上下文、价格、提供商、4.7 变化、安全边界与当前生命周期。

相关评测

Claude Opus 4.8:官方发布能力、Agent 工作流与诚实性边界Anthropic 的 Opus 4.8 发布页强调 Agent 判断、effort 控制与动态工作流改进;测试者引述和厂商评测不能证明独立生产成功率。Claude Opus 4.8:努力档位、工具调用与代码审查提示模式按“Claude Opus 4.8:努力档位、工具调用与代码审查提示模式”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Opus 4.8:Max 努力档位的高风险任务提示按“Claude Opus 4.8:Max 努力档位的高风险任务提示”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。