Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Claude Sonnet 4.6 · 社区来源 · 编辑分析

Sansa Bench:Sonnet 4.6 高推理总体 0.733,当前排第 4

Sansa Bench 当前总榜把 Claude-Sonnet-4.6 Reasoning High 记为 0.733,并列/紧随 Gemini-3.1-Pro-Preview Reasoning Low,低于 Opus 5 / 4.8 高推理;它适合看“开推理后的综合能力”,不适合直接引用 6 个月前 Reddit 帖里的旧分数。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源编辑分析编辑日期 2026-09-20

测试条件速查

模型/版本
Claude-Sonnet-4.6;来源日期:2026-08-20。
harness/任务
规模:页面写 103 models tested,Updated Aug 19, 2026。;总体分:各 capability 等权平均;评分含 exact match、numeric match、code execution、LLM judges。
样本/缺口
局限记录:Reddit 旧帖的 0.921 幻觉抗性等分项,在 2026-08-20 的总榜首屏未复现,不能当作当前官方数字。;LLM judge 会引入评判模型偏差。

关键数据与适用场景

一句话结论

Sansa Bench 当前总榜把 Claude-Sonnet-4.6 Reasoning High 记为 0.733,并列/紧随 Gemini-3.1-Pro-Preview Reasoning Low,低于 Opus 5 / 4.8 高推理;它适合看“开推理后的综合能力”,不适合直接引用 6 个月前 Reddit 帖里的旧分数。

测试环境

  • 规模:页面写 103 models tested,Updated Aug 19, 2026。

  • 总体分:各 capability 等权平均;评分含 exact match、numeric match、code execution、LLM judges。

  • 当前 Top 5(Overall):

    1. Claude-Opus-5 Reasoning High 0.798

    2. Claude-Opus-4.8 Reasoning High 0.785

    3. Gemini-3.1-Pro-Preview Reasoning High 0.747

    4. Claude-Sonnet-4.6 Reasoning High 0.733

    5. Gemini-3.1-Pro-Preview Reasoning Low 0.733

  • 方法入口:Inspiration & Acknowledgments、Compare Models、Model Analysis。

输入/配置

总榜展示的是 Reasoning High 变体。首页未在首屏列出 Sonnet 4.6 Reasoning None 的当前分。私有题库会轮换,模型不易刷题;这也意味着不同日期的 Overall 不能当同一测验。

结果数据

当前页面可直接引用:

  • Claude Sonnet 4.6 Reasoning High:Overall 0.733。

历史快照(不得与上表混用):2026-02 左右 r/LLMDevs 帖称其私有基准(后链到同一 Sansa 方法页)当时为:

  • Sonnet 4.6 reasoning off:0.648,高于 GPT-5.2 low reasoning 0.604

  • Sonnet 4.6 high reasoning:0.719,与当时 Gemini 3 Pro Preview 并列榜首,高于 GPT-5.2 high 0.649

  • hallucination resistance 0.921;social calibration 0.905;error detection 0.848

  • 硬科学弱于 Gemini 3 Pro(philosophy 0.767 vs 0.900,chemistry 0.710 vs 0.839,economics 0.750 vs 0.812)

  • sycophancy resistance 0.716,低于 Sonnet 4.5 high 的 0.755

该 Reddit 帖有人质疑“写得很像 AI”且实际幻觉多;作者另附 https://trysansa.com/benchmark 与 https://docs.sansaml.com/。引用历史分项时必须标注帖子日期,且当前总榜已不再显示 0.719。

结论

开高推理时,Sonnet 4.6 仍能进入 Sansa 总榜前五,但已被更新的 Opus 拉开。适合作为“要可靠性、可接受高推理成本”的候选。若关闭 reasoning,不要使用当前首页的 0.733,应单独打开该模型的 None/Low 行或自己跑同一方法。

局限

  • 题库轮换,跨月分数不可直接减。

  • 首页 Top 5 只保证 Reasoning High 的 Overall;分项能力要以 Model Analysis 为准,本次采集未把每个 capability 表格整页展开。

  • Reddit 旧帖的 0.921 幻觉抗性等分项,在 2026-08-20 的总榜首屏未复现,不能当作当前官方数字。

  • LLM judge 会引入评判模型偏差。

复现步骤

  1. 打开 https://trysansa.com/benchmark,记录页面 Updated 日期和模型行的 Reasoning 档位。

  2. 如需分项,进入该模型的 Model Analysis,导出 hallucination、sycophancy、science 等 capability。

  3. 固定 claude-sonnet-4-6 的 reasoning off/high,不要和 Opus 5 的 High 混在一张“Sonnet 能力”表。

  4. 若对照 Reddit 旧帖,单独建“2026-02 快照”列,禁止覆盖当前 0.733。

能支持的判断

  • 开高推理时,Sonnet 4.6 仍能进入 Sansa 总榜前五,但已被更新的 Opus 拉开。适合作为“要可靠性、可接受高推理成本”的候选。若关闭 reasoning,不要使用当前首页的 0.733,应单独打开该模型的 None/Low 行或自己跑同一方法。

不能支持的判断

  • Reddit 旧帖的 0.921 幻觉抗性等分项,在 2026-08-20 的总榜首屏未复现,不能当作当前官方数字。
  • LLM judge 会引入评判模型偏差。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Sansa Bench(trysansa.com) · Sansa AI;Reddit 历史快照来自 ExactMacaroon6673 · 原文发布日期 Unknown · 本站编辑日期 2026-09-20

打开原始来源

Claude Sonnet 4.6

在 Tabbit 中比较 Claude Sonnet 4.6

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Claude Sonnet 4.6 是什么:价格、获取方式与 Sonnet 5 迁移问题

用来源说明 Claude Sonnet 4.6 的 1M 上下文、$3/$15 API 价格、Active legacy 状态、访问入口和迁移取舍。

相关评测

OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。Reddit:Sonnet 4.6 medium effort 能做日常工作,复杂项目仍要 Opus 规划发帖人认为 Claude Code 里 Sonnet 4.6 medium effort 已能完成大量日常和高强度任务;评论共识则是:简单执行可以留在 Sonnet,复杂推理、规划和高压编码仍要用 Opus 先做架构,再交给 Sonnet 落地。Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。Reddit MLOps 对 Claude Sonnet 4.6 与 Opus 4.6 的任务分层观察社区将 Sonnet 4.6 的强项归为办公、金融、电脑使用和常规编码,将 Opus 4.6 的优势归为深层推理、终端编码和 agentic search;但帖子也明确提醒这些是 Anthropic 自报 scaffold 的静态 benchmark。Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流按“Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示按“Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流按“Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置按“Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。