在作者选取的 3 个 Addy Osmani agent-skills、较小任务集和各模型默认 Claude Code effort 下,Sonnet 5.5 在无 skill 的 Git workflow 测试中已达到 Opus 5.5 加 skill 后的分数,但三次运行波动明显,且由 Opus 5 作为 judge model,因此不能据此证明两种模型通用能力相同。
适合判断的任务:代码审查、Git workflow、文档/ADR 这三类流程型 Agent 任务中,Skills 对 Sonnet 5.5 与 Opus 5.5 的局部影响、生成结果波动和粗略成本差异。
不适合外推的任务:复杂推理、并发调试、隐藏跨模块约束、开放式研究、其他 Skills 或大规模生产任务;也不能把一个 judge model 的 rubric 分数当作客观质量分数。
适用的模型版本:Claude Sonnet 5.5 与 Claude Opus 5.5;作者另在评论中提到 Sonnet 5 和旧版 Claude Code 的历史结果,但主测试比较的是两个 5.5 模型。
测试环境或客户端:Claude Code;3 个来自 Addy Osmani agent-skills repo 的 skill:code review、Git workflow、docs/ADRs。每个模型分别在有 skill 和无 skill 条件下处理相同任务。
推荐的推理档位和参数:原帖没有手动设置 effort,两个模型均使用各自在 Claude Code 中的默认设置;由于默认值不同,不能把结果视为相同 effort 的公平对照。
作者在 Sonnet 5.5 发布后,用 3 个 Skills 对 Claude Sonnet 5.5 和 Claude Opus 5.5 做比较。每个模型执行相同任务,分别测试“不加载 skill”和“加载 skill”;整套测试重复 3 次。答案由 Opus 5 按 rubric 评分。作者提供了 Git workflow 的三次分数,并报告了 code review、docs/ADRs 的范围和运行波动。
作者在原帖中明确列出以下限制:只有 3 个 skill、任务集较小、由另一个模型负责评分,而且没有把两个模型的 effort 固定到同一个值,均保留 Claude Code 默认设置。作者还强调同一模型、同一任务和同一设置的分数也会变化,因此不信任单次运行。
原帖评论补充说明,作者对每个答案进行了三次独立 rubric 评分,并设置了“结果不足以判断”的结论,不强行排名。作者还说,之前报告中把保存的答案交给另一个 grader 复评时,51 个分数中有 50 个仍落在同一结论一侧;但作者没有为本帖中 0.83 到 0.71 的具体答案拆分生成波动和评分波动。
分数顺序为第 1、2、3 次运行;分数来自原帖所述的 Opus 5 judge model。
| 模型 | 无 skill | 有 skill |
|---|---|---|
| Claude Opus 5.5 | 0.51 / 0.49 / 0.58 | 0.86 / 0.86 / 0.86 |
| Claude Sonnet 5.5 | 0.86 / 0.85 / 0.86 | 0.86 / 0.86 / 0.86 |
作者的直接观察是:Opus 5.5 在 Git workflow 上需要该 skill 才达到 Sonnet 5.5 无 skill 的分数;对 Sonnet 5.5 来说,该 skill 在这组任务上几乎没有改变分数。加载 skills 后,作者在 3 个 skill 的 3 次运行中都无法凭输出分辨两个模型。
在 code review 无 skill 的一个比较中,Opus 5.5 三次分数为 0.83 / 0.86 / 0.71;作者称旧版 Claude Code 在上一周同类测试曾得到 0.68。
原帖称,9 次比较中有 5 次会因查看哪一次运行而改变结论。
作者评论补充:带 skill 的 code review 中,两个 5.5 模型大约在 0.89–0.91;docs/ADRs 任务中,Sonnet 5 为 0.60–0.70、Sonnet 5.5 为 0.78–0.85、Opus 5.5 为 0.65–0.85,均随运行变化。作者称 Sonnet 5.5 在 docs 任务上有 3 次中的 2 次超过 Sonnet 5。
作者估算生成答案的 API 成本为:
| 模型 | 整套生成成本 |
|---|---|
| Claude Sonnet 5.5 | 约 $2.30 |
| Claude Opus 5.5 | 约 $5.74 |
原帖没有给出请求级 token、价格表、缓存命中、任务数量或成本计算脚本,因此这两个数只能作为作者在其环境下的估算。
| 项目 | 原帖披露内容 |
|---|---|
| Skills | Addy Osmani agent-skills repo 的 code review、Git workflow、docs/ADRs |
| 对比模型 | Claude Sonnet 5.5、Claude Opus 5.5 |
| 条件 | 每个模型分别有 skill / 无 skill |
| 重复次数 | 每种条件 3 次 |
| 评分器 | Claude Opus 5 |
| effort | Claude Code 各模型默认设置,未固定为同一值 |
| Git workflow 分数 | Opus 5.5 无 skill 0.51 / 0.49 / 0.58;有 skill 0.86 / 0.86 / 0.86;Sonnet 5.5 无 skill 0.86 / 0.85 / 0.86;有 skill 0.86 / 0.86 / 0.86 |
| 成本估算 | Sonnet 5.5 约 $2.30;Opus 5.5 约 $5.74 |
原帖称所有数字和原始文件位于作者提供的开放源码工具报告中。本文只核对并使用 Reddit 原帖及其可见评论,没有打开该外部报告链接,也没有把报告中未在原帖展示的材料计入结果。
这项测试支持一个局部结论:在流程性 Skills 和较小任务集上,Sonnet 5.5 的无 skill 结果可以达到 Opus 5.5 加同一 skill 的 Git workflow 分数;在作者的三次运行中,加载 skill 后没有凭输出观察到两个 5.5 模型的明显差异。结果同时显示,单次运行可能改变结论,模型生成波动是实际选型时需要测量的变量。
测试不能说明 Sonnet 5.5 和 Opus 5.5 的通用能力相同。任务只覆盖 3 个 skills,任务规模较小;judge model 是 Opus 5,分数来自 rubric 而不是人工盲评或可公开复算的自动评分脚本;两个模型使用各自 Claude Code 默认 effort,模型能力和推理设置没有隔离。Git workflow 的多个 0.85–0.86 分数还可能受到 rubric 上限影响,原帖评论也提出了这一点。
成本数字同样不能直接外推到其他请求。原帖没有披露完整任务数、输入和输出 token、缓存、价格版本、重试、工具调用或成本计算过程。若要据此选型,应在自己的任务集上固定模型、effort、工具和评分器,至少重复三次,并分别报告生成波动与 judge 复评波动。
要复现原帖主测试,至少需要取得相同的 3 个 Skills、相同任务集和 Claude Code 版本,分别运行 Sonnet 5.5 与 Opus 5.5 的有 skill / 无 skill 条件,每种条件重复 3 次,并使用同一 rubric 和 Opus 5 judge。为解决原帖暴露的混杂因素,还应固定两个模型的 effort,保存全部原始答案,隐藏模型名后重复评分,并记录输入、输出、工具调用、重试、缓存和成本。
原帖本身未公开足以让读者仅凭 Reddit 页面完整重跑的任务清单、skill 版本、rubric、judge prompt、API 参数和原始输出,因此本记录将其归为有明确方法和部分结果的可复现测试,而不是完整独立复现。
Claude Sonnet 5.5