Vellum 对 Anthropic 系统卡的逐项整理显示 Opus 4.8 在多数公开对照中领先,但 Terminal-Bench 的 harness 差异和 Finance Agent v2 的反例说明选型必须按同一工具环境与垂直任务复测。
适合的任务:比较编码、终端 Agent、推理、电脑使用和专业知识工作方向的公开信号。
不适合的任务:把文章中的二手整理当作自己的生产验收,或把一个 benchmark 直接外推到所有领域。
适用的模型版本:Claude Opus 4.8,对照 Opus 4.7、GPT-5.5、Gemini 3.1 Pro,Finance Agent v2 还包含 Gemini 3.5 Flash。
适用的客户端、Agent 或 API:文章讨论系统卡中的 Terminus-2/Codex CLI 等 harness;实际 API/客户端需按自己的工具栈重跑。
推荐的推理档位和参数:文章主要转述官方默认 effort,完整运行参数、随机种子和输入未公开;不要据此固定参数。
数据/方法:Vellum 对 Anthropic Claude Opus 4.8 System Card Table 8.1.A 的公开结果逐项整理,并解释不同 harness 的影响。
对照模型:Opus 4.7、GPT-5.5、Gemini 3.1 Pro;Finance Agent v2 另含 Gemini 3.5 Flash。
复现程度:来源给出 benchmark 名称、分数和部分 harness 说明,但没有发布原始输入、完整配置或独立运行日志,因此这里的“可复现”仅限按公开表格和 benchmark 名称重新核验,不能称为 Vellum 独立重跑。
SWE-Bench Pro:多文件、活跃仓库问题;文章指出其比普通 SWE-bench 更难且更少受记忆泄漏影响。
Terminal-Bench 2.1:同一公共 Terminus-2 harness 下对照;GPT-5.5 另有 Codex CLI headline,不能直接和 Terminus-2 数字横比。
OSWorld-Verified:真实 Ubuntu VM 中的文档编辑、网页浏览和文件管理任务。
HLE、GDPval-AA、Finance Agent v2:文章报告公开系统卡中的分数与任务类型,但未提供逐题输入和运行日志。
| 基准 | Opus 4.8 | 主要对照与说明 |
|---|---|---|
| SWE-Bench Pro pass rate | 69.2% | Opus 4.7 64.3%,GPT-5.5 58.6%,Gemini 3.1 Pro 54.2% |
| SWE-bench Verified | 88.6% | Opus 4.7 87.6%,Gemini 3.1 Pro 80.6% |
| Terminal-Bench 2.1 / Terminus-2 | 74.6% | GPT-5.5 Terminus-2 78.2%,Gemini 3.1 Pro 70.3%,Opus 4.7 66.1%;GPT-5.5 Codex CLI headline 为 83.4% |
| HLE(无工具) | 49.8% | Opus 4.7 46.9%,Gemini 3.1 Pro 44.4%,GPT-5.5 41.4% |
| HLE(有工具) | 57.9% | Opus 4.7 54.7%,GPT-5.5 52.2%,Gemini 3.1 Pro 51.4% |
| OSWorld-Verified pass@1 | 83.4% | Opus 4.7 82.8%,GPT-5.5 78.7%,Gemini 3.1 Pro 76.2% |
| GDPval-AA | 1,890 | GPT-5.5 1,769,Opus 4.7 1,753,Gemini 3.1 Pro 1,314 |
| Finance Agent v2 | 53.9% | Gemini 3.5 Flash 57.9%,GPT-5.5 51.8%,Opus 4.7 51.5%,Gemini 3.1 Pro 43.0% |
公开对照中,Opus 4.8 在 SWE-Bench Pro、HLE、OSWorld-Verified 和 GDPval-AA 等任务领先;但 Terminal-Bench 的 GPT-5.5 结果随 harness 从 83.4%(Codex CLI)变为 78.2%(Terminus-2),Finance Agent v2 则由更小更快的 Gemini 3.5 Flash 领先。最稳妥的结论是:Opus 4.8 适合复杂编码与知识工作,但垂直领域和工具环境仍需单独评测。
Vellum 的数字主要来自 Anthropic 系统卡,不是 Vellum 重新运行的原始实验;文章没有完整输入、配置、随机种子或原始日志。
系统卡分数存在 harness、工具、token 上限和版本修订影响;OSWorld 的 Opus 4.7 数字还注明了 zoom 工具修复和 max token 上限变化。
HLE、GDPval-AA、Finance Agent v2 的任务分布、评分细则和成本不在文章全文中公开;不能据此估算真实 ROI。
文章的“多数领先”不意味着每个领域都领先,尤其不能忽略 Finance Agent v2 的反例。
先固定同一模型版本、同一工具 harness、容器/VM、token 上限和评分脚本。
优先复跑 SWE-Bench Pro、Terminal-Bench 2.1 和 OSWorld-Verified,并同时记录 pass rate、工具步数、token、耗时和失败类型。
对 GPT-5.5 等模型分别在 Codex CLI 与 Terminus-2 上运行,禁止把不同 harness 的数字放在同一列直接比较。
为目标业务另建 Finance Agent 或知识工作子集,报告置信区间和成本,不要把公开分数当成生产保证。
Vellum 最有价值的观察不是“Opus 4.8 赢了几项”,而是 Terminal-Bench 的“harness matters as much as the model”。这也是复核该对照时必须保留的适用边界。
Claude Opus 4.8