Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Claude Sonnet 4.6 · 社区来源 · 个人体验

Reddit MLOps 对 Claude Sonnet 4.6 与 Opus 4.6 的任务分层观察

社区将 Sonnet 4.6 的强项归为办公、金融、电脑使用和常规编码,将 Opus 4.6 的优势归为深层推理、终端编码和 agentic search;但帖子也明确提醒这些是 Anthropic 自报 scaffold 的静态 benchmark。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源个人体验编辑日期 2026-09-20

测试条件速查

模型/版本
Claude-Sonnet-4.6;来源日期:2026-02-17。
harness/任务
环境:Reddit 用户整理 Anthropic 公告、VentureBeat、TechCrunch、OfficeChai 等资料。;输入/配置:帖子列出 Sonnet 4.6/Opus 4.6 的多项发布数字,未提供独立运行输入、重复次数或完整工具轨迹。
样本/缺口
局限记录:帖子中的个别数字与不同页面/版本可能有差异,不能当作实时排行榜。;没有统一 scaffold、样本、重复次数和成本统计;不能推导绝对成功率。

关键数据与适用场景

一句话结论

社区将 Sonnet 4.6 的强项归为办公、金融、电脑使用和常规编码,将 Opus 4.6 的优势归为深层推理、终端编码和 agentic search;但帖子也明确提醒这些是 Anthropic 自报 scaffold 的静态 benchmark。

测试环境

  • 环境:Reddit 用户整理 Anthropic 公告、VentureBeat、TechCrunch、OfficeChai 等资料。

  • 输入/配置:帖子列出 Sonnet 4.6/Opus 4.6 的多项发布数字,未提供独立运行输入、重复次数或完整工具轨迹。

  • 结果形式:二次整理和观点,非受控实验。

输入/配置

帖子没有公开完整可复制 prompt;可复用的是路由假设:生产办公/财务/电脑使用先试 Sonnet,深层搜索/新颖推理/终端编码再路由 Opus,最终用同一任务集验证。

结果数据

帖子引用的 Anthropic 数字包括:SWE-bench Verified Sonnet 79.6% vs Opus 80.8%;OSWorld-Verified 72.5% vs 72.7%;GDPval-AA Elo 1633 vs 1606;Finance Agent v1.1 63.3% vs 60.1%;GPQA 89.9% vs 91.3%;Terminal-Bench 59.1% vs 65.4%;BrowseComp 74.7% vs 84.0%;ARC-AGI-2 58.3% vs 68.8%。

帖子还提到 Sonnet 4.6 价格 $3/$15,Opus 4.6 $5/$25,并指出 1M context 为 beta;这些价格和版本应以官方当前页面复核。

结论

这份社区整理可用来形成“按任务路由、按 eval 复核”的候选策略:Sonnet 4.6 作为规模化默认,Opus 4.6 处理高难、长链路或错误代价高的分支。

局限

  • 数据主要转述官方/媒体,作者明确写出缺少 Aider、Chatbot Arena 等独立结果。

  • 帖子中的个别数字与不同页面/版本可能有差异,不能当作实时排行榜。

  • 没有统一 scaffold、样本、重复次数和成本统计;不能推导绝对成功率。

复现步骤

  1. 取真实生产任务按办公、金融、电脑使用、代码、搜索、深层推理分层。

  2. 固定同一模型版本、工具、effort、超时和最大 token,进行盲测。

  3. 记录成功率、错误严重度、调用数、延迟、成本和人工偏好;单独统计 Sonnet→Opus 路由收益。

  4. 对每次官方/社区新 benchmark 记录来源、发布日期和 harness,不把静态分数直接迁移到生产。

能支持的判断

  • 这份社区整理可用来形成“按任务路由、按 eval 复核”的候选策略:Sonnet 4.6 作为规模化默认,Opus 4.6 处理高难、长链路或错误代价高的分支。

不能支持的判断

  • 帖子中的个别数字与不同页面/版本可能有差异,不能当作实时排行榜。
  • 没有统一 scaffold、样本、重复次数和成本统计;不能推导绝对成功率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Reddit / r/mlops · snakemas 与社区评论者 · 原文发布日期 2026-02-17 · 本站编辑日期 2026-09-20

打开原始来源

Claude Sonnet 4.6

在 Tabbit 中比较 Claude Sonnet 4.6

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Claude Sonnet 4.6 是什么:价格、获取方式与 Sonnet 5 迁移问题

用来源说明 Claude Sonnet 4.6 的 1M 上下文、$3/$15 API 价格、Active legacy 状态、访问入口和迁移取舍。

相关评测

OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。Reddit:Sonnet 4.6 medium effort 能做日常工作,复杂项目仍要 Opus 规划发帖人认为 Claude Code 里 Sonnet 4.6 medium effort 已能完成大量日常和高强度任务;评论共识则是:简单执行可以留在 Sonnet,复杂推理、规划和高压编码仍要用 Opus 先做架构,再交给 Sonnet 落地。Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。IDP Leaderboard:Sonnet 4.6 在真实文档理解上与 Opus 4.6 持平在开放文档 AI 排行榜上,Claude Sonnet 4.6 总分 80.7,略高于 Opus 4.6 的 80.4,适合把 OCR、表格、版式和关键信息抽取从 Opus 下放到 Sonnet;归档扫描件仍要防内容审核误拦。Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流按“Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示按“Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流按“Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置按“Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。