Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Claude Sonnet 4.6 · 媒体来源 · 独立测量

Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37

Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

模型/版本
Claude-Sonnet-4.6;来源日期:2026-08-20。
harness/任务
展示配置:Claude Sonnet 4.6,Non-reasoning,Effort high。;指数版本:Artificial Analysis Intelligence Index v4.1.1,含 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。
样本/缺口
局限记录:Cost per task 与 verbosity 为 N/A,不能从本页推断单位任务美元。;Intelligence Index 是 9 项合成,不能还原成 SWE 或 OSWorld。

关键数据与适用场景

一句话结论

Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。

测试环境

  • 展示配置:Claude Sonnet 4.6,Non-reasoning,Effort high。

  • 指数版本:Artificial Analysis Intelligence Index v4.1.1,含 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。

  • 比较池:页面写明非推理模型只与其他非推理模型比;定价带与同类 >$1/1M blended 的专有模型比较。

  • 维护状态:This model is deprecated. 只继续默认 10k 输入 token 负载的性能基准,其他负载结果为历史值。建议考虑 Claude Sonnet 5 (Non-reasoning)。

输入/配置

页面展示的是非推理 + high effort 变体,不是 reasoning 变体。输入模态 text+image,输出 text,上下文 1M。具体逐项评测的 prompt 与 harness 见 AA 的 Intelligence Index methodology,不在该模型页全文展开。

结果数据

采集时模型摘要:

指标页面值
Intelligence Index37(该类 #5 / 63;同类中位数 23)
速度46.1 output tok/s(该类 #36 / 63;页面称 notably slow)
输入价$3.00 / 百万 token
输出价$15.00 / 百万 token
Cache discount90%
Cost per Intelligence Index taskN/A
VerbosityN/A
上下文1M tokens

同页 Intelligence 对照条(节选,越高越好):Claude Opus 5 (max) 63、Claude Fable 5 62、GPT-5.6 Sol (max) 61、…、Claude Sonnet 4.6 (Non-reasoning) 37。速度对照里 Sonnet 4.6 为 46 tok/s,低于多数列出的对照模型。

页面文案:在智能上属于领先非推理模型之一,但相对同价位非推理模型偏贵;支持 text/image 输入。

结论

用 AA 的口径,Sonnet 4.6 非推理高 effort 仍明显强于该类中位数,但已经不是 2026-08 的智能前沿,速度也偏慢。适合作为“已知单价、1M 窗口、非推理”的生产对照,不适合再当最新 Sonnet 的代理。需要 reasoning 变体分数时,必须打开 AA 的 reasoning 页面,不能用本页 37 分代替。

局限

  • 页面明确 deprecated,部分工作负载不再更新。

  • 本页是 Non-reasoning High Effort,与官方默认 effort、以及开启 thinking 的结果都不可混用。

  • Cost per task 与 verbosity 为 N/A,不能从本页推断单位任务美元。

  • Intelligence Index 是 9 项合成,不能还原成 SWE 或 OSWorld。

复现步骤

  1. 固定 AA 的 v4.1.1 方法,明确要跑 non-reasoning 还是 reasoning。

  2. 设置 claude-sonnet-4-6 且 effort=high,关闭 reasoning。

  3. 分别记录 Index 分项、tok/s、延迟和 $3/$15 实际账单。

  4. 与 Sonnet 5 非推理对照时使用 AA 当前仍更新的页面,而不是本 deprecated 页的历史负载。

能支持的判断

  • 用 AA 的口径,Sonnet 4.6 非推理高 effort 仍明显强于该类中位数,但已经不是 2026-08 的智能前沿,速度也偏慢。适合作为“已知单价、1M 窗口、非推理”的生产对照,不适合再当最新 Sonnet 的代理。需要 reasoning 变体分数时,必须打开 AA 的 reasoning 页面,不能用本页 37 分代替。

不能支持的判断

  • Cost per task 与 verbosity 为 N/A,不能从本页推断单位任务美元。
  • Intelligence Index 是 9 项合成,不能还原成 SWE 或 OSWorld。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Artificial Analysis · Artificial Analysis · 原文发布日期 Unknown · 本站编辑日期 2026-09-20

打开原始来源

Claude Sonnet 4.6

在 Tabbit 中比较 Claude Sonnet 4.6

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Claude Sonnet 4.6 是什么:价格、获取方式与 Sonnet 5 迁移问题

用来源说明 Claude Sonnet 4.6 的 1M 上下文、$3/$15 API 价格、Active legacy 状态、访问入口和迁移取舍。

相关评测

OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。Reddit:Sonnet 4.6 medium effort 能做日常工作,复杂项目仍要 Opus 规划发帖人认为 Claude Code 里 Sonnet 4.6 medium effort 已能完成大量日常和高强度任务;评论共识则是:简单执行可以留在 Sonnet,复杂推理、规划和高压编码仍要用 Opus 先做架构,再交给 Sonnet 落地。BenchLM 对 Claude Sonnet 4.6 的公开证据账本BenchLM 的可展示来源账本给 Sonnet 4.6 记录 22 行 benchmark:SWE-bench Verified 79.6%、OSWorld-Verified 72.1%、Terminal-Bench 59.1%、GPQA 89.9%,同时显示不同类别强弱差异,适合做复核入口而非单一总分。Reddit MLOps 对 Claude Sonnet 4.6 与 Opus 4.6 的任务分层观察社区将 Sonnet 4.6 的强项归为办公、金融、电脑使用和常规编码,将 Opus 4.6 的优势归为深层推理、终端编码和 agentic search;但帖子也明确提醒这些是 Anthropic 自报 scaffold 的静态 benchmark。Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示按“Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流按“Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置按“Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流按“Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。