Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Claude Sonnet 4.6 · 媒体来源 · 独立测量

BenchLM 对 Claude Sonnet 4.6 的公开证据账本

BenchLM 的可展示来源账本给 Sonnet 4.6 记录 22 行 benchmark:SWE-bench Verified 79.6%、OSWorld-Verified 72.1%、Terminal-Bench 59.1%、GPQA 89.9%,同时显示不同类别强弱差异,适合做复核入口而非单一总分。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

模型/版本
Claude-Sonnet-4.6;来源日期:2026-08-17。
harness/任务
数据时间:2026-08-17;页面称有 22 条可展示来源的 benchmark row。;聚合:页面把 Coding、Agentic、Knowledge、Math、Multimodal 等类别分别加权;总分 64.53/100,排名 39/218,但该总分是 BenchLM 自定义聚合。
样本/缺口
局限记录:页面当前目录包含未来模型与动态榜单,结果会变化;需记录采集日期和链接状态。;某些行的模型版本、effort、工具和评测重复次数不完整,不能无条件宣称“可完全复现”。

关键数据与适用场景

一句话结论

BenchLM 的可展示来源账本给 Sonnet 4.6 记录 22 行 benchmark:SWE-bench Verified 79.6%、OSWorld-Verified 72.1%、Terminal-Bench 59.1%、GPQA 89.9%,同时显示不同类别强弱差异,适合做复核入口而非单一总分。

测试环境

  • 数据时间:2026-08-17;页面称有 22 条可展示来源的 benchmark row。

  • 聚合:页面把 Coding、Agentic、Knowledge、Math、Multimodal 等类别分别加权;总分 64.53/100,排名 #39/218,但该总分是 BenchLM 自定义聚合。

  • 证据标记:表格区分 Provider exact、Benchmark exact、Secondary exact,并保留来源链接。

  • 可核验来源:SWE-bench/OSWorld/Terminal 等行链接至 benchmark 或 Anthropic system card。

输入/配置

该页面是多来源结果账本,不是一次由 BenchLM 从零执行的单一 harness;条目混合提供商报告和 benchmark leaderboard。使用时应点击逐行来源,固定同一 benchmark、模型 snapshot 和配置后再比较。

结果数据

页面记录的代表性行:

类别/基准Sonnet 4.6 得分页面证据
SWE-bench Verified79.6%Provider exact,链接 Anthropic system card
SWE-Rebench60.7%Benchmark exact,SWE-Rebench leaderboard
OSWorld-Verified72.1%Benchmark exact,OSWorld leaderboard
Terminal-Bench 2.059.1%Provider exact,Anthropic system card
Claw-Eval67.8%Benchmark exact
Humanity’s Last Exam49%Provider exact,Anthropic system card
GPQA89.9%Provider exact,Anthropic system card
SuperGPQA95%Secondary exact
CharXiv Reasoning77.4%Provider exact,Anthropic system card

结论

可展示证据支持 Sonnet 4.6 在软件工程、电脑 Agent 和知识问答上具备较强性价比,但自定义总分不应掩盖 Terminal-Bench、Math 等任务上的明显差异。复核时优先按原始 benchmark 逐项比较。

局限

  • BenchLM 的 64.53/100 和 #39/218 是自定义权重/目录结果,不是通用能力真值。

  • 条目同时包含提供商报告、第三方 leaderboard 和二手来源,证据等级不相同。

  • 页面当前目录包含未来模型与动态榜单,结果会变化;需记录采集日期和链接状态。

  • 某些行的模型版本、effort、工具和评测重复次数不完整,不能无条件宣称“可完全复现”。

复现步骤

  1. 从页面逐项打开来源,优先选择 benchmark 官方 leaderboard 或 Anthropic system card。

  2. 固定 Sonnet 4.6 snapshot、effort、工具 scaffold、任务 split 和超时。

  3. 复跑 SWE/OSWorld/Terminal/GPQA 等至少四类任务,保存轨迹、错误和成本。

  4. 报告原始分数与自定义聚合分开,不使用 BenchLM 总分替代任务级结论。

能支持的判断

  • 可展示证据支持 Sonnet 4.6 在软件工程、电脑 Agent 和知识问答上具备较强性价比,但自定义总分不应掩盖 Terminal-Bench、Math 等任务上的明显差异。复核时优先按原始 benchmark 逐项比较。

不能支持的判断

  • 页面当前目录包含未来模型与动态榜单,结果会变化;需记录采集日期和链接状态。
  • 某些行的模型版本、effort、工具和评测重复次数不完整,不能无条件宣称“可完全复现”。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

BenchLM · BenchLM · 原文发布日期 2026-08-17 · 本站编辑日期 2026-09-20

打开原始来源

Claude Sonnet 4.6

在 Tabbit 中比较 Claude Sonnet 4.6

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Claude Sonnet 4.6 是什么:价格、获取方式与 Sonnet 5 迁移问题

用来源说明 Claude Sonnet 4.6 的 1M 上下文、$3/$15 API 价格、Active legacy 状态、访问入口和迁移取舍。

相关评测

Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。Reddit:Sonnet 4.6 medium effort 能做日常工作,复杂项目仍要 Opus 规划发帖人认为 Claude Code 里 Sonnet 4.6 medium effort 已能完成大量日常和高强度任务;评论共识则是:简单执行可以留在 Sonnet,复杂推理、规划和高压编码仍要用 Opus 先做架构,再交给 Sonnet 落地。Reddit MLOps 对 Claude Sonnet 4.6 与 Opus 4.6 的任务分层观察社区将 Sonnet 4.6 的强项归为办公、金融、电脑使用和常规编码,将 Opus 4.6 的优势归为深层推理、终端编码和 agentic search;但帖子也明确提醒这些是 Anthropic 自报 scaffold 的静态 benchmark。Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示按“Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流按“Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置按“Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流按“Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。