Cursor 官方在 CursorBench 上把新上线的 Claude Sonnet 5 写成 57%,把 Claude Sonnet 4.6 写成 49%;这说明 4.6 仍是 Cursor 内部编码代理评测的对照基线,但公开帖没有给出题目、配置和逐题轨迹。
任务:CursorBench(Cursor 自有编码/代理评测,帖文未展开定义)。
对照模型:Claude Sonnet 5 vs Claude Sonnet 4.6。
发布语境:宣布 Claude Sonnet 5 已在 Cursor 中可用。
可见指标:57% vs 49%。
X 帖未公开 prompt、agent harness、effort、工具权限、重复次数或是否启用 thinking。不能把这两个百分数当成 SWE-bench 或其他公开榜的对应分数。
Claude Sonnet 5:CursorBench 57%。
Claude Sonnet 4.6:CursorBench 49%。
作者表述为 “significant” 提升。
帖文互动量可见:约 115.9 万浏览、205 转帖、349 回复、4179 赞(采集时页面数字)。
在 Cursor 自己的代理评测里,Sonnet 4.6 明显低于后续的 Sonnet 5。若你的工作流绑在 Cursor,4.6 更适合作为“已验证、更便宜的对照”,而不是该客户端上的最新最强 Sonnet。若工作流不在 Cursor,这条结果只能说明相对差距,不能单独决定是否继续用 4.6。
只有两个总分,没有分项、方差、失败类型。
CursorBench 未在该帖公开题目集,无法独立复现。
厂商在发布新产品时给出的对照,存在选择基准的偏差。
未说明 4.6 / 5 是否使用相同 effort、上下文窗口和工具集。
在 Cursor 中分别固定 Claude Sonnet 4.6 与 Sonnet 5,关闭其他模型自动升级。
准备同一组真实 PR/issue,保存完整 agent 轨迹、diff 和测试结果。
按“一次通过、测试绿、人工返工”打分,而不是只抄 49/57。
报告 Cursor 版本、模式(Ask/Agent)、effort 和是否开启 1M 上下文。
Claude Sonnet 4.6