Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Sonnet 4.6

Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37

原始来源

Artificial Analysis

作者Artificial Analysis

Tabbit 整理2026-08-20

查看原文

一句话结论

Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。

测试环境

  • 展示配置:Claude Sonnet 4.6,Non-reasoning,Effort high。

  • 指数版本:Artificial Analysis Intelligence Index v4.1.1,含 GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR。

  • 比较池:页面写明非推理模型只与其他非推理模型比;定价带与同类 >$1/1M blended 的专有模型比较。

  • 维护状态:This model is deprecated. 只继续默认 10k 输入 token 负载的性能基准,其他负载结果为历史值。建议考虑 Claude Sonnet 5 (Non-reasoning)。

输入/配置

页面展示的是非推理 + high effort 变体,不是 reasoning 变体。输入模态 text+image,输出 text,上下文 1M。具体逐项评测的 prompt 与 harness 见 AA 的 Intelligence Index methodology,不在该模型页全文展开。

结果数据

采集时模型摘要:

指标页面值
Intelligence Index37(该类 #5 / 63;同类中位数 23)
速度46.1 output tok/s(该类 #36 / 63;页面称 notably slow)
输入价$3.00 / 百万 token
输出价$15.00 / 百万 token
Cache discount90%
Cost per Intelligence Index taskN/A
VerbosityN/A
上下文1M tokens

同页 Intelligence 对照条(节选,越高越好):Claude Opus 5 (max) 63、Claude Fable 5 62、GPT-5.6 Sol (max) 61、…、Claude Sonnet 4.6 (Non-reasoning) 37。速度对照里 Sonnet 4.6 为 46 tok/s,低于多数列出的对照模型。

页面文案:在智能上属于领先非推理模型之一,但相对同价位非推理模型偏贵;支持 text/image 输入。

结论

用 AA 的口径,Sonnet 4.6 非推理高 effort 仍明显强于该类中位数,但已经不是 2026-08 的智能前沿,速度也偏慢。适合作为“已知单价、1M 窗口、非推理”的生产对照,不适合再当最新 Sonnet 的代理。需要 reasoning 变体分数时,必须打开 AA 的 reasoning 页面,不能用本页 37 分代替。

局限

  • 页面明确 deprecated,部分工作负载不再更新。

  • 本页是 Non-reasoning High Effort,与官方默认 effort、以及开启 thinking 的结果都不可混用。

  • Cost per task 与 verbosity 为 N/A,不能从本页推断单位任务美元。

  • Intelligence Index 是 9 项合成,不能还原成 SWE 或 OSWorld。

复现步骤

  1. 固定 AA 的 v4.1.1 方法,明确要跑 non-reasoning 还是 reasoning。

  2. 设置 claude-sonnet-4-6 且 effort=high,关闭 reasoning。

  3. 分别记录 Index 分项、tok/s、延迟和 $3/$15 实际账单。

  4. 与 Sonnet 5 非推理对照时使用 AA 当前仍更新的页面,而不是本 deprecated 页的历史负载。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 4.6

在 Tabbit 中使用并对比模型

Claude Sonnet 4.6

相关测评

媒体Anthropic News / Introducing Sonnet 4.62026-02-17

Claude Sonnet 4.6 官方发布:编码、电脑使用与 Agent 基准

媒体BenchLM2026-08-17

BenchLM 对 Claude Sonnet 4.6 的公开证据账本

媒体IDP Leaderboard2026-03

IDP Leaderboard:Sonnet 4.6 在真实文档理解上与 Opus 4.6 持平

媒体Sansa Bench(trysansa.com)

Sansa Bench:Sonnet 4.6 高推理总体 0.733,当前排第 4

Claude Sonnet 4.6

相关提示词

媒体Claude Platform Docs / Prompting best practices

Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示

媒体Claude Platform Docs / Effort 与 Prompting best practices

Claude Sonnet 4.6 的 effort 与工具触发配置

媒体Anthropic Platform Docs / Computer Use API Reference2026-02-17

Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流

媒体Anthropic Platform Docs / Context Management & Compaction2026-02-17

Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置