Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Sonnet 5

Vellum 基准横评:Claude Sonnet 5 六大基准得分、Tokenizer 变化与成本分析

原始来源

Vellum 官方博客

作者Vellum Team

原文日期2026-06-30

Tabbit 整理2026-08-20

查看原文

一句话结论

Vellum 深度拆解 Anthropic 官方及第三方数据表明:Sonnet 5 在终端控制(80.4%)和知识工作(1,618 分)上甚至超越旗舰 Opus 4.8,但在高 effort 和新 Tokenizer 下单位任务 Token 膨胀明显,选型需结合实际任务成本。

测试环境

  • 涵盖基准:SWE-Bench Pro(编码)、Terminal-Bench 2.1(终端交互)、Humanity's Last Exam / HLE(极限推理)、OSWorld-Verified(电脑操作)、GDPval-AA v2(专业知识工作)、BrowseComp(Agentic 搜索)。

  • 对照模型:Claude Sonnet 5 vs Claude Sonnet 4.6 vs Claude Opus 4.8。

  • 发布语境:分析 Anthropic 正式发布的数据与系统卡(System Card)技术细节。

输入/配置

  • 官方 System Card 披露的标准化评估协议(包含工具调用与无工具版本)。

  • 考虑自适应思考不同 effort 档位(low, medium, high, xhigh)下的成本-性能曲线。

结果数据

评测基准Claude Sonnet 4.6Claude Sonnet 5Claude Opus 4.8结果特征与解读
Terminal-Bench 2.167.0%80.4%74.6%超越 Opus 4.8 (高 5.8%),较 4.6 跃升 13.4%
GDPval-AA v2 (知识工作)-1,6181,615知识工作与分析产出基本与 Opus 4.8 持平甚至略高
Humanity's Last Exam (带工具)46.8% (修正基线)57.4%57.9%逼近 Opus 4.8,较 Sonnet 4.6 提升 10.6%
OSWorld-Verified (电脑操作)78.5% (修正基线)81.2%83.4%紧咬 Opus 4.8,提供更具性价比的图形界面自动化
SWE-Bench Pro (代码工程)基准+5.0%+11.0%介于 4.6 与 4.8 之间,差距缩小
Firefox 147 Exploit (安全漏洞)0.0% (部分控制较低)0.0% (13.2% 部分控制)具备更高利用率官方确认未专门训练网络安全利用,危险能力受控

结论

Sonnet 5 彻底打破了“中档模型全面落后于旗舰”的固有格局,在终端操作、工具调用与日常知识工作任务中成为更具性价比的首选。但在选型决策时不能只看单 Token 标价,因为更新后的 Tokenizer 会产生 1.0–1.35x 的 Token 膨胀,且在 xhigh effort 下思考 Token 消耗激增,因此最甜点的使用区间是 low/medium effort。

局限

  • HLE 与 OSWorld-Verified 评测中 Anthropic 修正了 Sonnet 4.6 的历史基线,历史对比需注意口径一致性。

  • Token 膨胀效应使得长文本输入时的实际美元成本高于旧版 Sonnet 4.6。

复现步骤

  1. 在统一评测脚手架上配置统一的超时、最大 Token 与工具权限。

  2. 分别使用 claude-sonnet-5、claude-sonnet-4-6、claude-opus-4-8 执行 Terminal-Bench 任务集。

  3. 统计每个任务的真实输入字符数、对应 Token 数、思考 Token 占比及执行成功率。

原始证据与数据

  • 核心跑分:Terminal-Bench 2.1 达到 80.4%,GDPval-AA v2 达到 1,618 分。

  • Tokenizer 机制:Sonnet 5 采用更新后的 Tokenizer,同一段文本在 Sonnet 5 中被切分为 1.0 至 1.35 倍的 Token。

  • 成本边界:在 low 和 medium effort 下,Sonnet 5 在同等准确率下每任务成本明显低于 Opus 4.8;在 xhigh effort 下由于思考 Token 大量燃烧,每任务成本可能逼近甚至超过 Opus 4.8。

来源摘录或观察(仅做合规短引)

  • 来源分析:“Sonnet 5 doesn't close the gap to Opus 4.8 on terminal work. It moves past it... the first benchmark where the mid-tier model beats the flagship on the same harness.”

  • 来源成本总结:“Sonnet 5 uses an updated tokenizer that maps the same input to 1.0–1.35x more tokens... Best value at low/medium effort; at xhigh it can cost more than Opus 4.8 for similar quality.”

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 5

在 Tabbit 中使用并对比模型

Claude Sonnet 5

相关测评

媒体Anthropic 官方博客2026-06-30

Claude Sonnet 5 官方发布:Agent 能力、成本档位与安全边界

社区Reddit,r/ClaudeAI2026-06-30

Reddit 社区:Claude Sonnet 5 发布后任务体验与成本争议

媒体Endor Labs2026-07-02

Endor Labs 独立评测:Claude Sonnet 5 搭配 Claude Code 的功能正确性与安全修复表现

媒体CodeRabbit 官方博客2026-06-30

CodeRabbit 生产实测:Claude Sonnet 5 代码编写与 PR 审查质量深度对比

Claude Sonnet 5

相关提示词

媒体Anthropic Claude Platform Docs2026-06-30

Claude Sonnet 5 官方提示方法:努力档位、工具调用与代码审查

媒体PromptsRush2026-07-15

PromptsRush:Claude Sonnet 5 生产级 Agent 任务分解与系统提示词模板

媒体Cursor Docs2026-07-01

Cursor 官方文档:Claude Sonnet 5 模型集成、用量池与 Agent 工具配置

社区Reddit,r/claude2026-07-30

Reddit 社区:Claude Sonnet 5 响应截断与思考 Token 参数配置排查指南