BenchLM 的可展示来源账本给 Sonnet 4.6 记录 22 行 benchmark:SWE-bench Verified 79.6%、OSWorld-Verified 72.1%、Terminal-Bench 59.1%、GPQA 89.9%,同时显示不同类别强弱差异,适合做复核入口而非单一总分。
数据时间:2026-08-17;页面称有 22 条可展示来源的 benchmark row。
聚合:页面把 Coding、Agentic、Knowledge、Math、Multimodal 等类别分别加权;总分 64.53/100,排名 #39/218,但该总分是 BenchLM 自定义聚合。
证据标记:表格区分 Provider exact、Benchmark exact、Secondary exact,并保留来源链接。
可核验来源:SWE-bench/OSWorld/Terminal 等行链接至 benchmark 或 Anthropic system card。
该页面是多来源结果账本,不是一次由 BenchLM 从零执行的单一 harness;条目混合提供商报告和 benchmark leaderboard。使用时应点击逐行来源,固定同一 benchmark、模型 snapshot 和配置后再比较。
页面记录的代表性行:
| 类别/基准 | Sonnet 4.6 得分 | 页面证据 |
|---|---|---|
| SWE-bench Verified | 79.6% | Provider exact,链接 Anthropic system card |
| SWE-Rebench | 60.7% | Benchmark exact,SWE-Rebench leaderboard |
| OSWorld-Verified | 72.1% | Benchmark exact,OSWorld leaderboard |
| Terminal-Bench 2.0 | 59.1% | Provider exact,Anthropic system card |
| Claw-Eval | 67.8% | Benchmark exact |
| Humanity’s Last Exam | 49% | Provider exact,Anthropic system card |
| GPQA | 89.9% | Provider exact,Anthropic system card |
| SuperGPQA | 95% | Secondary exact |
| CharXiv Reasoning | 77.4% | Provider exact,Anthropic system card |
可展示证据支持 Sonnet 4.6 在软件工程、电脑 Agent 和知识问答上具备较强性价比,但自定义总分不应掩盖 Terminal-Bench、Math 等任务上的明显差异。复核时优先按原始 benchmark 逐项比较。
BenchLM 的 64.53/100 和 #39/218 是自定义权重/目录结果,不是通用能力真值。
条目同时包含提供商报告、第三方 leaderboard 和二手来源,证据等级不相同。
页面当前目录包含未来模型与动态榜单,结果会变化;需记录采集日期和链接状态。
某些行的模型版本、effort、工具和评测重复次数不完整,不能无条件宣称“可完全复现”。
从页面逐项打开来源,优先选择 benchmark 官方 leaderboard 或 Anthropic system card。
固定 Sonnet 4.6 snapshot、effort、工具 scaffold、任务 split 和超时。
复跑 SWE/OSWorld/Terminal/GPQA 等至少四类任务,保存轨迹、错误和成本。
报告原始分数与自定义聚合分开,不使用 BenchLM 总分替代任务级结论。
Claude Sonnet 4.6