Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Sonnet 4.6

BenchLM 对 Claude Sonnet 4.6 的公开证据账本

原始来源

BenchLM

作者BenchLM

原文日期2026-08-17

Tabbit 整理2026-08-19

查看原文

一句话结论

BenchLM 的可展示来源账本给 Sonnet 4.6 记录 22 行 benchmark:SWE-bench Verified 79.6%、OSWorld-Verified 72.1%、Terminal-Bench 59.1%、GPQA 89.9%,同时显示不同类别强弱差异,适合做复核入口而非单一总分。

测试环境

  • 数据时间:2026-08-17;页面称有 22 条可展示来源的 benchmark row。

  • 聚合:页面把 Coding、Agentic、Knowledge、Math、Multimodal 等类别分别加权;总分 64.53/100,排名 #39/218,但该总分是 BenchLM 自定义聚合。

  • 证据标记:表格区分 Provider exact、Benchmark exact、Secondary exact,并保留来源链接。

  • 可核验来源:SWE-bench/OSWorld/Terminal 等行链接至 benchmark 或 Anthropic system card。

输入/配置

该页面是多来源结果账本,不是一次由 BenchLM 从零执行的单一 harness;条目混合提供商报告和 benchmark leaderboard。使用时应点击逐行来源,固定同一 benchmark、模型 snapshot 和配置后再比较。

结果数据

页面记录的代表性行:

类别/基准Sonnet 4.6 得分页面证据
SWE-bench Verified79.6%Provider exact,链接 Anthropic system card
SWE-Rebench60.7%Benchmark exact,SWE-Rebench leaderboard
OSWorld-Verified72.1%Benchmark exact,OSWorld leaderboard
Terminal-Bench 2.059.1%Provider exact,Anthropic system card
Claw-Eval67.8%Benchmark exact
Humanity’s Last Exam49%Provider exact,Anthropic system card
GPQA89.9%Provider exact,Anthropic system card
SuperGPQA95%Secondary exact
CharXiv Reasoning77.4%Provider exact,Anthropic system card

结论

可展示证据支持 Sonnet 4.6 在软件工程、电脑 Agent 和知识问答上具备较强性价比,但自定义总分不应掩盖 Terminal-Bench、Math 等任务上的明显差异。复核时优先按原始 benchmark 逐项比较。

局限

  • BenchLM 的 64.53/100 和 #39/218 是自定义权重/目录结果,不是通用能力真值。

  • 条目同时包含提供商报告、第三方 leaderboard 和二手来源,证据等级不相同。

  • 页面当前目录包含未来模型与动态榜单,结果会变化;需记录采集日期和链接状态。

  • 某些行的模型版本、effort、工具和评测重复次数不完整,不能无条件宣称“可完全复现”。

复现步骤

  1. 从页面逐项打开来源,优先选择 benchmark 官方 leaderboard 或 Anthropic system card。

  2. 固定 Sonnet 4.6 snapshot、effort、工具 scaffold、任务 split 和超时。

  3. 复跑 SWE/OSWorld/Terminal/GPQA 等至少四类任务,保存轨迹、错误和成本。

  4. 报告原始分数与自定义聚合分开,不使用 BenchLM 总分替代任务级结论。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 4.6

在 Tabbit 中使用并对比模型

Claude Sonnet 4.6

相关测评

媒体Anthropic News / Introducing Sonnet 4.62026-02-17

Claude Sonnet 4.6 官方发布:编码、电脑使用与 Agent 基准

媒体IDP Leaderboard2026-03

IDP Leaderboard:Sonnet 4.6 在真实文档理解上与 Opus 4.6 持平

媒体Artificial Analysis

Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37

媒体Sansa Bench(trysansa.com)

Sansa Bench:Sonnet 4.6 高推理总体 0.733,当前排第 4

Claude Sonnet 4.6

相关提示词

媒体Claude Platform Docs / Prompting best practices

Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示

媒体Claude Platform Docs / Effort 与 Prompting best practices

Claude Sonnet 4.6 的 effort 与工具触发配置

媒体Anthropic Platform Docs / Computer Use API Reference2026-02-17

Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流

媒体Anthropic Platform Docs / Context Management & Compaction2026-02-17

Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置