Bito 在自有服务的 Agent 编码任务上让每个任务、每个模型重复运行四次,并用 50 分制和 Opus 5.5 评分;在各自 Claude Code 默认设置下,Sonnet 5.5 平均得分 38.5 对 Sonnet 5 的 33.3,单次 session 成本约低 71%,耗时约为三分之一,但默认 effort 不同且任务、提示词和评分实现未完整公开。
适合判断的任务:Claude Code 在真实服务代码上的长 session、多轮排查、测试优先修复、设计评审、模糊 bug 报告和快速修复。
不适合外推的任务:非 Bito 服务、其他代码库、其他 Agent harness、固定相同 effort 的公平模型比较,以及仅凭 Opus 5.5 judge 分数推断真实开发者接受度。
适用的模型版本:Claude Sonnet 5 与 Claude Sonnet 5.5;页面另提到 Sonnet 5 在 2026-09-26 不同时间段出现行为变化,但 API 始终报告为 Sonnet 5。
测试环境或客户端:Claude Code;测试使用 Bito 自有服务中的 Agent coding tasks,固定 prompts,每项任务每个模型运行 4 次。页面未公开完整任务代码、prompt、answer key 或 Claude Code 项目配置。
推荐的推理档位和参数:沿用 Claude Code 默认设置:Sonnet 5 为 high effort,Sonnet 5.5 为 medium effort。Bito 建议团队直接使用 Sonnet 5.5 默认值,但该建议与本文测评条件绑定。
Bito 将模型放入其用于其他模型比较的真实编码工作基准。任务包含短任务和长多轮 session:长任务会从定位相关代码、分析故障、规划并实现修复,到审计修复结果。页面列出的任务包括:
长 session:Slack bot 的 rate limiting;
长 session:跨两个服务追踪 trace ID;
模糊 bug 报告;
test-first fix;
带作者反驳的 design review;
quick fix。
每个模型获得相同的固定 prompts;每个任务每个模型运行四次。整个比较消耗了数亿 token。每次运行按 50 分制 answer key 评分,answer key 列出正确答案需要的事实、早期错误答案曾出现的错误说法,以及计划或实现必须完成的内容;每条 key 都与代码核对。评分器是 Claude Opus 5.5,同时读取答案、代码和 answer key。
Bito 使用 Claude Code 默认设置,以模拟多数用户:Sonnet 5 为 high effort,Sonnet 5.5 为 medium effort。页面说明 Claude Code 在 Sonnet 5.5 测试期间从 2.1.283 更新到 2.1.284;更新改变了默认 effort(由 high 变为 medium)并切换到 Opus 使用的较短 system prompt。Bito 丢弃跨版本的运行,并在关闭自动更新后用新版本重跑全部内容。
| 模型与设置 | 得分(满分 50) | 每次 session 成本 | 每次 session 时间 |
|---|---|---|---|
| Sonnet 5,默认(high effort) | 33.3 | $2.65 | 10.7 分钟 |
| Sonnet 5.5,默认(medium effort) | 38.5 | $0.78 | 3.8 分钟 |
Bito 报告 Sonnet 5.5 在其测量的每个任务上都胜过 Sonnet 5,session 成本约低 71%,耗时约为三分之一。页面没有公开每个任务四次运行的完整原始分数和方差,只给出总分和任务级汇总。
| 任务 | Sonnet 5 | Sonnet 5.5 |
|---|---|---|
| 长 session:Slack bot rate limiting | 32.8 | 36.5 |
| 长 session:两个服务间的 trace ID | 32.6 | 40.1 |
| 模糊 bug 报告 | 35.2 | 38.0 |
| Test-first fix | 40.8 | 42.0 |
| Design review with pushback | 27.4 | 35.9 |
| Quick fix | 31.1 | 38.4 |
这是页面描述的最大提升场景:Agent 审查一个 pull request 后,作者回复“实际不会有影响”。正确做法是回到代码核对,因为代码显示两个 workflow 确实会冲突。
Sonnet 5 在四次运行中的两次接受了作者说法,没有重新检查代码。
Sonnet 5.5 每次都提出反驳,并引用显示冲突的具体代码行。
该 turn 的分数范围为 Sonnet 5.5 38–41,Sonnet 5 20–35。
页面将 test-first fix 视为提升最小的任务,因为它更机械,Sonnet 5 原本已经表现较好。
在长 session 中,Bito 记录到:
| 指标 | Sonnet 5 | Sonnet 5.5 |
|---|---|---|
| 平均 thinking tokens / session | 约 92,000 | 约 25,000 |
| 平均 model requests / session | 96 | 41 |
| 单次 request 耗时 | 约 10 秒 | 约 10 秒 |
Bito 的解释是,Sonnet 5.5 每次请求耗时相近,但请求更少,因此 session 更快;这是该评测中观察到的工作量差异,不是所有 API 工作负载的延迟保证。
Bito 根据 Claude Code 的账单观察两种模型的 token 价格接近:两者 cache read 均约为每百万 token $0.20;Sonnet 5.5 的 output 略便宜,cache write 略贵。页面将主要成本差异归因于工作量,而非 token 单价。
Sonnet 5.5 在长 session 中平均约 25,000 thinking tokens 和 41 次请求,Sonnet 5 约 92,000 thinking tokens 和 96 次请求;因此 Bito 的测量中 Sonnet 5.5 的 session 成本是 $0.78,Sonnet 5 是 $2.65。成本数字是 Bito 的 Claude Code session 快照,页面没有披露完整输入、输出、cache 命中、重试和价格时间点。
Bito 还测试了 Sonnet 5.5 的 low effort:相较默认 medium,成本只节省 9%,得分下降接近 1 分。作者据此认为 Sonnet 5.5 已经在 medium 下较精简,继续降低 effort 的节省有限。页面未给出该补充运行的完整得分、重复次数和成本表。
| 项目 | Bito 页面披露内容 |
|---|---|
| 任务来源 | Bito 自有服务上的真实 Agent coding tasks |
| 提示词 | 所有模型使用相同固定 prompts;原文未公开全文 |
| 重复次数 | 每项任务每个模型 4 次 |
| 评分满分 | 50 分 |
| 评分器 | Claude Opus 5.5,读取答案、代码和 answer key |
| Sonnet 5 默认 effort | high |
| Sonnet 5.5 默认 effort | medium |
| Claude Code 版本 | 2.1.283 → 2.1.284;跨更新运行被丢弃,新版本关闭自动更新后重跑 |
| 资源规模 | Bito 称该比较消耗数亿 token |
Bito 报告模型成绩的 run-to-run 噪声约为 1–2 分,并认为本次 5.2 分的总分差异明显高于该噪声。作者还观察到 2026-09-26 上午的 Sonnet 5 行为与当日下午及之后不同:上午版本请求约少一半、thinking 很少、分数约 40,之后版本回到约 33。API 始终报告 Sonnet 5,Bito 无法从外部证明发生了模型部署或路由变化。
Bito 的测试支持一个有限结论:在其自有服务的 Agent 编码任务和固定 prompts 中,Sonnet 5.5 在不同任务上都高于 Sonnet 5,整体平均得分高 5.2 分;同时它用更少的 thinking tokens 和请求完成 session,成本和耗时显著降低。Design review with pushback 是最大差异,test-first fix 是最小差异。
这不是相同 effort 的控制实验:Sonnet 5 使用 high,Sonnet 5.5 使用 medium,且新 Claude Code 版本改变了 system prompt 和默认 effort。Opus 5.5 既是评分器,也是与模型能力相关的外部依赖;没有人工盲评、公开 judge prompt 和逐条 score,因此不能把 50 分当成独立客观量表。
任务来自 Bito 自有服务,固定 prompts、answer key 和完整代码没有公开。成本和耗时是 Claude Code session 快照,受模型路由、缓存、版本、重试、工具和任务结构影响。Sonnet 5 的 2026-09-26 行为变化还说明,模型 API ID 相同不保证运行行为在时间上稳定。
要复现 Bito 的比较,需要取得相同的自有服务任务、固定 prompts、answer keys、代码版本和 Claude Code 版本;每个任务让 Sonnet 5 使用 high、Sonnet 5.5 使用 medium,各运行四次,并用 Opus 5.5 读取答案、代码和 key 后按 50 分评分。应锁定 Claude Code 版本并显式传入 effort,避免默认值在测试期间变化。
成本复算需要记录每次请求的 input、output、thinking、cache read、cache write token、model requests、重试和 wall-clock time。若要比较模型本身,应另做相同 effort 的对照;若要比较用户默认体验,则应保留默认设置并单独报告默认值差异。Bito 页面没有公开足以让外部读者完整重跑的任务、提示、answer key 和原始输出,因此本文将其作为有明确方法和结果汇总的独立比较,而不是完全可复现的公开基准。
Claude Sonnet 5.5