Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Claude Sonnet 4.6 · 社区来源 · 编辑分析

CursorBench:Sonnet 4.6 得 49%,作为 Sonnet 5 上线对照基线

Cursor 官方在 CursorBench 上把新上线的 Claude Sonnet 5 写成 57%,把 Claude Sonnet 4.6 写成 49%;这说明 4.6 仍是 Cursor 内部编码代理评测的对照基线,但公开帖没有给出题目、配置和逐题轨迹。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源编辑分析编辑日期 2026-09-20

测试条件速查

模型/版本
Claude-Sonnet-4.6;来源日期:2026-07-01。
harness/任务
任务:CursorBench(Cursor 自有编码/代理评测,帖文未展开定义)。;对照模型:Claude Sonnet 5 vs Claude Sonnet 4.6。
样本/缺口
局限记录:厂商在发布新产品时给出的对照,存在选择基准的偏差。;未说明 4.6 / 5 是否使用相同 effort、上下文窗口和工具集。

关键数据与适用场景

一句话结论

Cursor 官方在 CursorBench 上把新上线的 Claude Sonnet 5 写成 57%,把 Claude Sonnet 4.6 写成 49%;这说明 4.6 仍是 Cursor 内部编码代理评测的对照基线,但公开帖没有给出题目、配置和逐题轨迹。

测试环境

  • 任务:CursorBench(Cursor 自有编码/代理评测,帖文未展开定义)。

  • 对照模型:Claude Sonnet 5 vs Claude Sonnet 4.6。

  • 发布语境:宣布 Claude Sonnet 5 已在 Cursor 中可用。

  • 可见指标:57% vs 49%。

输入/配置

X 帖未公开 prompt、agent harness、effort、工具权限、重复次数或是否启用 thinking。不能把这两个百分数当成 SWE-bench 或其他公开榜的对应分数。

结果数据

  • Claude Sonnet 5:CursorBench 57%。

  • Claude Sonnet 4.6:CursorBench 49%。

  • 作者表述为 “significant” 提升。

  • 帖文互动量可见:约 115.9 万浏览、205 转帖、349 回复、4179 赞(采集时页面数字)。

结论

在 Cursor 自己的代理评测里,Sonnet 4.6 明显低于后续的 Sonnet 5。若你的工作流绑在 Cursor,4.6 更适合作为“已验证、更便宜的对照”,而不是该客户端上的最新最强 Sonnet。若工作流不在 Cursor,这条结果只能说明相对差距,不能单独决定是否继续用 4.6。

局限

  • 只有两个总分,没有分项、方差、失败类型。

  • CursorBench 未在该帖公开题目集,无法独立复现。

  • 厂商在发布新产品时给出的对照,存在选择基准的偏差。

  • 未说明 4.6 / 5 是否使用相同 effort、上下文窗口和工具集。

复现步骤

  1. 在 Cursor 中分别固定 Claude Sonnet 4.6 与 Sonnet 5,关闭其他模型自动升级。

  2. 准备同一组真实 PR/issue,保存完整 agent 轨迹、diff 和测试结果。

  3. 按“一次通过、测试绿、人工返工”打分,而不是只抄 49/57。

  4. 报告 Cursor 版本、模式(Ask/Agent)、effort 和是否开启 1M 上下文。

能支持的判断

  • 在 Cursor 自己的代理评测里,Sonnet 4.6 明显低于后续的 Sonnet 5。若你的工作流绑在 Cursor,4.6 更适合作为“已验证、更便宜的对照”,而不是该客户端上的最新最强 Sonnet。若工作流不在 Cursor,这条结果只能说明相对差距,不能单独决定是否继续用 4.6。

不能支持的判断

  • 厂商在发布新产品时给出的对照,存在选择基准的偏差。
  • 未说明 4.6 / 5 是否使用相同 effort、上下文窗口和工具集。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

X · Cursor(@cursorai) · 原文发布日期 2026-07-01 · 本站编辑日期 2026-09-20

打开原始来源

Claude Sonnet 4.6

在 Tabbit 中比较 Claude Sonnet 4.6

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Claude Sonnet 4.6 是什么:价格、获取方式与 Sonnet 5 迁移问题

用来源说明 Claude Sonnet 4.6 的 1M 上下文、$3/$15 API 价格、Active legacy 状态、访问入口和迁移取舍。

相关评测

OSWorld-Verified 独立评测:Claude Sonnet 4.6 计算机操作与 GUI 任务深度分析在标准 Ubuntu 桌面评测套件 OSWorld-Verified 中,Claude Sonnet 4.6 取得了 72.5% 的任务成功率,逼近旗舰 Opus 4.6(72.7%),但在高频复杂动态弹窗及多层级右键菜单场景下仍存在一定的视觉定位抖动。Reddit:Sonnet 4.6 medium effort 能做日常工作,复杂项目仍要 Opus 规划发帖人认为 Claude Code 里 Sonnet 4.6 medium effort 已能完成大量日常和高强度任务;评论共识则是:简单执行可以留在 Sonnet,复杂推理、规划和高压编码仍要用 Opus 先做架构,再交给 Sonnet 落地。Artificial Analysis:Sonnet 4.6 非推理 Intelligence Index 37Artificial Analysis 把 Claude Sonnet 4.6(Non-reasoning, High Effort)放在同类非推理模型里 Intelligence Index 37、约 46 tok/s、输入 $3 / 输出 $15 / 百万 token,并标明 1M 上下文;页面同时提示该模型已 deprecated,智能分数不再代表最新 Sonnet。Reddit MLOps 对 Claude Sonnet 4.6 与 Opus 4.6 的任务分层观察社区将 Sonnet 4.6 的强项归为办公、金融、电脑使用和常规编码,将 Opus 4.6 的优势归为深层推理、终端编码和 agentic search;但帖子也明确提醒这些是 Anthropic 自报 scaffold 的静态 benchmark。Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流按“Claude Code 下 Sonnet 4.6 的多智能体协作与工程开发工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示按“Claude Sonnet 4.6 的清晰指令、XML 上下文与自检提示”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流按“Claude Sonnet 4.6 的 Computer Use 工具定义与自动化闭环工作流”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置按“Claude Sonnet 4.6 的 1M 长上下文与 Context Compaction 架构配置”的任务特定指南执行;前置条件、步骤、验收、修正和来源边界均已写明。