Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Sonnet 4.6

Sansa Bench:Sonnet 4.6 高推理总体 0.733,当前排第 4

原始来源

Sansa Bench(trysansa.com)

作者Sansa AI;Reddit 历史快照来自 ExactMacaroon6673

Tabbit 整理2026-08-20

查看原文

一句话结论

Sansa Bench 当前总榜把 Claude-Sonnet-4.6 Reasoning High 记为 0.733,并列/紧随 Gemini-3.1-Pro-Preview Reasoning Low,低于 Opus 5 / 4.8 高推理;它适合看“开推理后的综合能力”,不适合直接引用 6 个月前 Reddit 帖里的旧分数。

测试环境

  • 规模:页面写 103 models tested,Updated Aug 19, 2026。

  • 总体分:各 capability 等权平均;评分含 exact match、numeric match、code execution、LLM judges。

  • 当前 Top 5(Overall):

    1. Claude-Opus-5 Reasoning High 0.798

    2. Claude-Opus-4.8 Reasoning High 0.785

    3. Gemini-3.1-Pro-Preview Reasoning High 0.747

    4. Claude-Sonnet-4.6 Reasoning High 0.733

    5. Gemini-3.1-Pro-Preview Reasoning Low 0.733

  • 方法入口:Inspiration & Acknowledgments、Compare Models、Model Analysis。

输入/配置

总榜展示的是 Reasoning High 变体。首页未在首屏列出 Sonnet 4.6 Reasoning None 的当前分。私有题库会轮换,模型不易刷题;这也意味着不同日期的 Overall 不能当同一测验。

结果数据

当前页面可直接引用:

  • Claude Sonnet 4.6 Reasoning High:Overall 0.733。

历史快照(不得与上表混用):2026-02 左右 r/LLMDevs 帖称其私有基准(后链到同一 Sansa 方法页)当时为:

  • Sonnet 4.6 reasoning off:0.648,高于 GPT-5.2 low reasoning 0.604

  • Sonnet 4.6 high reasoning:0.719,与当时 Gemini 3 Pro Preview 并列榜首,高于 GPT-5.2 high 0.649

  • hallucination resistance 0.921;social calibration 0.905;error detection 0.848

  • 硬科学弱于 Gemini 3 Pro(philosophy 0.767 vs 0.900,chemistry 0.710 vs 0.839,economics 0.750 vs 0.812)

  • sycophancy resistance 0.716,低于 Sonnet 4.5 high 的 0.755

该 Reddit 帖有人质疑“写得很像 AI”且实际幻觉多;作者另附 https://trysansa.com/benchmark 与 https://docs.sansaml.com/。引用历史分项时必须标注帖子日期,且当前总榜已不再显示 0.719。

结论

开高推理时,Sonnet 4.6 仍能进入 Sansa 总榜前五,但已被更新的 Opus 拉开。适合作为“要可靠性、可接受高推理成本”的候选。若关闭 reasoning,不要使用当前首页的 0.733,应单独打开该模型的 None/Low 行或自己跑同一方法。

局限

  • 题库轮换,跨月分数不可直接减。

  • 首页 Top 5 只保证 Reasoning High 的 Overall;分项能力要以 Model Analysis 为准,本次采集未把每个 capability 表格整页展开。

  • Reddit 旧帖的 0.921 幻觉抗性等分项,在 2026-08-20 的总榜首屏未复现,不能当作当前官方数字。

  • LLM judge 会引入评判模型偏差。

复现步骤

  1. 打开 https://trysansa.com/benchmark,记录页面 Updated 日期和模型行的 Reasoning 档位。

  2. 如需分项,进入该模型的 Model Analysis,导出 hallucination、sycophancy、science 等 capability。

  3. 固定 claude-sonnet-4-6 的 reasoning off/high,不要和 Opus 5 的 High 混在一张“Sonnet 能力”表。

  4. 若对照 Reddit 旧帖,单独建“2026-02 快照”列,禁止覆盖当前 0.733。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 4.6

在 Tabbit 中使用并对比模型

Claude Sonnet 4.6

相关测评

媒体Anthropic News / Introducing Sonnet 4.62026-02-17

Claude Sonnet 4.6 官方发布:编码、电脑使用与 Agent 基准

媒体BenchLM2026-08-17

BenchLM 对 Claude Sonnet 4.6 的公开证据账本

媒体IDP Leaderboard2026-03

IDP Leaderboard:Sonnet 4.6 在真实文档理解上与 Opus 4.6 持平

媒体Artificial Analysis

Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37

Claude Sonnet 4.6

相关提示词

媒体Claude Platform Docs / Prompting best practices

Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示

媒体Claude Platform Docs / Effort 与 Prompting best practices

Claude Sonnet 4.6 的 effort 与工具触发配置

媒体Anthropic Platform Docs / Computer Use API Reference2026-02-17

Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流

媒体Anthropic Platform Docs / Context Management & Compaction2026-02-17

Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置