Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
媒体Claude Sonnet 5.5

Bito:Claude Sonnet 5.5 与 Sonnet 5 的四次 Agent 编码任务对比

原始来源

Bito 官方博客

作者Bito team;文中署名 Anand Das

原文日期2026-09-29

Tabbit 整理2026-09-29

查看原文

一句话结论

Bito 在自有服务的 Agent 编码任务上让每个任务、每个模型重复运行四次,并用 50 分制和 Opus 5.5 评分;在各自 Claude Code 默认设置下,Sonnet 5.5 平均得分 38.5 对 Sonnet 5 的 33.3,单次 session 成本约低 71%,耗时约为三分之一,但默认 effort 不同且任务、提示词和评分实现未完整公开。

适用场景

  • 适合判断的任务:Claude Code 在真实服务代码上的长 session、多轮排查、测试优先修复、设计评审、模糊 bug 报告和快速修复。

  • 不适合外推的任务:非 Bito 服务、其他代码库、其他 Agent harness、固定相同 effort 的公平模型比较,以及仅凭 Opus 5.5 judge 分数推断真实开发者接受度。

  • 适用的模型版本:Claude Sonnet 5 与 Claude Sonnet 5.5;页面另提到 Sonnet 5 在 2026-09-26 不同时间段出现行为变化,但 API 始终报告为 Sonnet 5。

  • 测试环境或客户端:Claude Code;测试使用 Bito 自有服务中的 Agent coding tasks,固定 prompts,每项任务每个模型运行 4 次。页面未公开完整任务代码、prompt、answer key 或 Claude Code 项目配置。

  • 推荐的推理档位和参数:沿用 Claude Code 默认设置:Sonnet 5 为 high effort,Sonnet 5.5 为 medium effort。Bito 建议团队直接使用 Sonnet 5.5 默认值,但该建议与本文测评条件绑定。

测评方法

Bito 将模型放入其用于其他模型比较的真实编码工作基准。任务包含短任务和长多轮 session:长任务会从定位相关代码、分析故障、规划并实现修复,到审计修复结果。页面列出的任务包括:

  • 长 session:Slack bot 的 rate limiting;

  • 长 session:跨两个服务追踪 trace ID;

  • 模糊 bug 报告;

  • test-first fix;

  • 带作者反驳的 design review;

  • quick fix。

每个模型获得相同的固定 prompts;每个任务每个模型运行四次。整个比较消耗了数亿 token。每次运行按 50 分制 answer key 评分,answer key 列出正确答案需要的事实、早期错误答案曾出现的错误说法,以及计划或实现必须完成的内容;每条 key 都与代码核对。评分器是 Claude Opus 5.5,同时读取答案、代码和 answer key。

Bito 使用 Claude Code 默认设置,以模拟多数用户:Sonnet 5 为 high effort,Sonnet 5.5 为 medium effort。页面说明 Claude Code 在 Sonnet 5.5 测试期间从 2.1.283 更新到 2.1.284;更新改变了默认 effort(由 high 变为 medium)并切换到 Opus 使用的较短 system prompt。Bito 丢弃跨版本的运行,并在关闭自动更新后用新版本重跑全部内容。

关键结果

全部任务汇总

模型与设置得分(满分 50)每次 session 成本每次 session 时间
Sonnet 5,默认(high effort)33.3$2.6510.7 分钟
Sonnet 5.5,默认(medium effort)38.5$0.783.8 分钟

Bito 报告 Sonnet 5.5 在其测量的每个任务上都胜过 Sonnet 5,session 成本约低 71%,耗时约为三分之一。页面没有公开每个任务四次运行的完整原始分数和方差,只给出总分和任务级汇总。

页面列出的任务级平均分

任务Sonnet 5Sonnet 5.5
长 session:Slack bot rate limiting32.836.5
长 session:两个服务间的 trace ID32.640.1
模糊 bug 报告35.238.0
Test-first fix40.842.0
Design review with pushback27.435.9
Quick fix31.138.4

Design review with pushback

这是页面描述的最大提升场景:Agent 审查一个 pull request 后,作者回复“实际不会有影响”。正确做法是回到代码核对,因为代码显示两个 workflow 确实会冲突。

  • Sonnet 5 在四次运行中的两次接受了作者说法,没有重新检查代码。

  • Sonnet 5.5 每次都提出反驳,并引用显示冲突的具体代码行。

  • 该 turn 的分数范围为 Sonnet 5.5 38–41,Sonnet 5 20–35。

页面将 test-first fix 视为提升最小的任务,因为它更机械,Sonnet 5 原本已经表现较好。

Thinking token 与请求数量

在长 session 中,Bito 记录到:

指标Sonnet 5Sonnet 5.5
平均 thinking tokens / session约 92,000约 25,000
平均 model requests / session9641
单次 request 耗时约 10 秒约 10 秒

Bito 的解释是,Sonnet 5.5 每次请求耗时相近,但请求更少,因此 session 更快;这是该评测中观察到的工作量差异,不是所有 API 工作负载的延迟保证。

Token 价格与 session 成本

Bito 根据 Claude Code 的账单观察两种模型的 token 价格接近:两者 cache read 均约为每百万 token $0.20;Sonnet 5.5 的 output 略便宜,cache write 略贵。页面将主要成本差异归因于工作量,而非 token 单价。

Sonnet 5.5 在长 session 中平均约 25,000 thinking tokens 和 41 次请求,Sonnet 5 约 92,000 thinking tokens 和 96 次请求;因此 Bito 的测量中 Sonnet 5.5 的 session 成本是 $0.78,Sonnet 5 是 $2.65。成本数字是 Bito 的 Claude Code session 快照,页面没有披露完整输入、输出、cache 命中、重试和价格时间点。

低 effort 的补充结果

Bito 还测试了 Sonnet 5.5 的 low effort:相较默认 medium,成本只节省 9%,得分下降接近 1 分。作者据此认为 Sonnet 5.5 已经在 medium 下较精简,继续降低 effort 的节省有限。页面未给出该补充运行的完整得分、重复次数和成本表。

原始数据

评分与运行条件

项目Bito 页面披露内容
任务来源Bito 自有服务上的真实 Agent coding tasks
提示词所有模型使用相同固定 prompts;原文未公开全文
重复次数每项任务每个模型 4 次
评分满分50 分
评分器Claude Opus 5.5,读取答案、代码和 answer key
Sonnet 5 默认 efforthigh
Sonnet 5.5 默认 effortmedium
Claude Code 版本2.1.283 → 2.1.284;跨更新运行被丢弃,新版本关闭自动更新后重跑
资源规模Bito 称该比较消耗数亿 token

结果变化与运行波动

Bito 报告模型成绩的 run-to-run 噪声约为 1–2 分,并认为本次 5.2 分的总分差异明显高于该噪声。作者还观察到 2026-09-26 上午的 Sonnet 5 行为与当日下午及之后不同:上午版本请求约少一半、thinking 很少、分数约 40,之后版本回到约 33。API 始终报告 Sonnet 5,Bito 无法从外部证明发生了模型部署或路由变化。

结论与边界

Bito 的测试支持一个有限结论:在其自有服务的 Agent 编码任务和固定 prompts 中,Sonnet 5.5 在不同任务上都高于 Sonnet 5,整体平均得分高 5.2 分;同时它用更少的 thinking tokens 和请求完成 session,成本和耗时显著降低。Design review with pushback 是最大差异,test-first fix 是最小差异。

这不是相同 effort 的控制实验:Sonnet 5 使用 high,Sonnet 5.5 使用 medium,且新 Claude Code 版本改变了 system prompt 和默认 effort。Opus 5.5 既是评分器,也是与模型能力相关的外部依赖;没有人工盲评、公开 judge prompt 和逐条 score,因此不能把 50 分当成独立客观量表。

任务来自 Bito 自有服务,固定 prompts、answer key 和完整代码没有公开。成本和耗时是 Claude Code session 快照,受模型路由、缓存、版本、重试、工具和任务结构影响。Sonnet 5 的 2026-09-26 行为变化还说明,模型 API ID 相同不保证运行行为在时间上稳定。

复现说明

要复现 Bito 的比较,需要取得相同的自有服务任务、固定 prompts、answer keys、代码版本和 Claude Code 版本;每个任务让 Sonnet 5 使用 high、Sonnet 5.5 使用 medium,各运行四次,并用 Opus 5.5 读取答案、代码和 key 后按 50 分评分。应锁定 Claude Code 版本并显式传入 effort,避免默认值在测试期间变化。

成本复算需要记录每次请求的 input、output、thinking、cache read、cache write token、model requests、重试和 wall-clock time。若要比较模型本身,应另做相同 effort 的对照;若要比较用户默认体验,则应保留默认设置并单独报告默认值差异。Bito 页面没有公开足以让外部读者完整重跑的任务、提示、answer key 和原始输出,因此本文将其作为有明确方法和结果汇总的独立比较,而不是完全可复现的公开基准。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 5.5

在 Tabbit 中使用并对比模型

Claude Sonnet 5.5

相关测评

媒体Anthropic 官方网站

Claude Sonnet 5.5 官方能力基准与适用边界

媒体Artificial Analysis2026-09-28

Artificial Analysis:Claude Sonnet 5.5 的智能指数与 Agent 任务独立测评

社区X / Arena.ai2026-09-30

Arena.ai Code Arena:Claude Sonnet 5.5 High 的 WebDev 真实任务排名

媒体CodeRabbit 官方博客2026-09-28

CodeRabbit:Claude Sonnet 5.5 与 Sonnet 5、Opus 5.5 的代码审查比较

Claude Sonnet 5.5

相关提示词

媒体Claude Platform Docs

Anthropic 官方提示指南:Claude Sonnet 5.5 的 effort、主动性与工具调用

媒体Claude Platform Docs

Anthropic 官方迁移指南:Claude Sonnet 5.5 API 配置与 breaking changes

媒体Claude Platform Docs2026-09-28

Anthropic 官方模型概览:Claude Sonnet 5.5 当前配置

社区GitHub(由 Reddit r/ClaudeAI 帖子提供的原始文件)

社区配置:面向 Claude Sonnet 5.5 的 CLAUDE.md 工作规则