在 u/fuzzypetiolesguy 自建的多 Agent pseudo harness 中,Sonnet 5.5 与 Opus 5.5 在 35 个隐藏测试代码修复任务和 8 个研究问题上打平,Sonnet 5.5 约快 22%;但它在 35 次代码任务中有 4 次越过指定文件夹,作者因此只让它承担 proofreader,全部数据仍属于未公开 prompt、日志和隐藏测试的个人报告。
适合判断的任务:代码修复、已知答案的资料查找、代码变更校对,以及把 Sonnet 5.5 放入 Opus 5.5 主导的多 Agent 工作流时的角色分工。
不适合外推的任务:通用代码能力、开放式研究、不同 harness 或权限设置下的文件边界行为、正式基准排名,以及没有同样隐藏测试和规则时的成本收益。
适用的模型版本:Claude Sonnet 5.5、Claude Opus 5.5;校对对照还包括较小的 Claude Haiku 模型。
测试环境或客户端:作者称测试由 Opus 5.5 运行其多 Agent pseudo harness ruleset;原帖没有公开 harness、完整 prompt、权限配置、隐藏测试、输出日志或评分脚本。
推荐的推理档位和参数:原帖未披露模型 effort、温度、工具版本或其他 API 参数;报告目标是 accuracy、速度和新增命中,而不是价格最优。
作者先说明自己的工作流:Opus 5.5 负责研究和写代码,较小的 Haiku 模型在保存前校对;Sonnet 5.5 要想加入“AI crew”,需要在准确率上匹配并明显更快,或捕获更多问题。作者称总计完成约 90 次测试运行。
可见报告分为五类:
Bug fixes:35 个 broken-code 任务,用 hidden tests 检查修复是否正确。
Speed:比较每个任务的平均耗时。
Staying in its lane:检查模型是否只在指定文件夹内工作。
Research:8 个有已知答案的 lookup questions,其中包括一个询问不存在文件的问题。
Proofreading:在两次测试变更中植入 33 个错误,包括 fake keys、passwords 和作者自定义 style rules,再比较模型能否发现。
作者没有给出每项任务的完整输入、隐藏测试内容、权限配置、运行次数如何分配到各类任务、原始输出或可下载日志,因此“约 90 次”只能按原帖作者的总数记录,不能由公开页面完整重算。
| 模型 | 修复通过数 | 未修复数 |
|---|---|---|
| Claude Opus 5.5 | 34/35 | 1 |
| Claude Sonnet 5.5 | 34/35 | 1 |
作者报告两者在 hidden tests 下打平。页面没有公开隐藏测试、失败案例、代码库、提交内容或通过判定脚本。
| 模型 | 每个任务耗时 | 相对结果 |
|---|---|---|
| Claude Opus 5.5 | 约 28 秒 | 对照 |
| Claude Sonnet 5.5 | 约 22 秒 | 约快 22% |
作者在第一次运行前设定的门槛是 25% 提速,因此其判断是“接近但不够”。页面没有说明计时是否包含工具调用、重试、冷启动或完整 Agent turn。
| 模型 | 越过指定文件夹次数 |
|---|---|
| Claude Opus 5.5 | 0/35 |
| Claude Sonnet 5.5 | 4/35 |
Sonnet 5.5 越界产生的主要是 scratch files,作者称大多无害,但把它视为代码编辑 Agent 不应养成的习惯。该结果受 harness 的工作目录、权限和监控方式影响;这些设置未公开。
| 模型 | 正确事实 | 发现虚构内容 |
|---|---|---|
| Claude Opus 5.5 | 8/8 | 0 |
| Claude Sonnet 5.5 | 8/8 | 0 |
8 个问题包含一个关于不存在文件的查询。作者报告两者都答对事实,且都没有编造内容;没有公开问题文本、来源、评分表或检索工具配置。
| 模型 | 捕获错误 | False alarms | 指向错误行 |
|---|---|---|---|
| Claude Sonnet 5.5 | 33/33 | 未报告 | 未报告 |
| Claude Haiku | 29/33 | 3 | 4 |
植入内容包括 fake keys、passwords 和作者自定义 style rules。作者称 Haiku 的多数漏检来自 style rules,并特别提到包括 em dash 规则;没有公开每个错误的位置、校对 prompt 或判定标准。
| 项目 | 页面可见内容 |
|---|---|
| 总运行量 | 约 90 次 |
| 修复任务 | 35 个,hidden tests |
| 修复结果 | Opus 34/35;Sonnet 34/35 |
| 速度 | Sonnet 约 22 秒/任务;Opus 约 28 秒/任务;约快 22% |
| 文件范围 | Sonnet 4/35 越过指定文件夹;Opus 0/35 |
| 研究 | 8 个已知答案问题,两者全部答对且未编造 |
| 校对 | 33 个植入错误;Sonnet 33/33;Haiku 29/33、3 次 false alarm、4 次错误行 |
| 作者最终分工 | Sonnet 5.5 负责 proofreader;Opus 负责 research 和 code;Haiku 被替换 |
作者称结果在每次运行中保持一致,但没有公开每次运行的逐项分数、置信区间或统计测试,不能把这句话解释为独立可复核的稳定性结论。
另一位评论者描述了自己的 5 天 ERP migration app 测试:一个仓库有 136 个 PR,轮换不同模型负责 build 和 review。评论者报告:GPT-6 Astra 审查 Claude 构建的代码约每轮发现 1.25 个真实 bug,Fable 审查 Opus 构建的代码约每轮发现 1 个;Astra 对 Opus 构建且 Fable 通过的 31 次 merge 做 audit,发现 7 个真实 bug,分布在 6 次 merge 中,其中 2 个严重。
该评论者还称,让 orchestrator 自己审查代码几乎是 rubber stamp,约 0.13 个真实发现/轮;用新 reviewer session 和“你没有构建这段代码,请在 lab copy 中破坏它”的 adversarial brief 后表现更好。Sonnet 5.5 在第一天完成了 Opus 已开始的两个 fix rounds,其中一个第一次就通过并合并;每轮使用 Opus 先前同一 PR 的约三分之一到一半 token。评论者明确说样本太早,正在观察的是每次 merge 所需的 review rounds。
这条评论没有公开仓库、PR 清单、模型参数、prompt、bug 判定或日志,只作为不同工作流的有限对照,不能与主报告的 35 个 hidden-test 任务直接合并计算。
u/Physical_Gold_1485 只说自己针对行业任务做了不同 effort 的 Opus 5.5 与 Sonnet 5 测试,观察到 Sonnet 更便宜但 Opus 5.5 全部答对,并尝试调整 subagent 定义;该评论没有公开数量、prompt、评分和原始数据。它只能作为方向相反的个人意见,不能当作受控测评结果。
这份一手报告支持一个有限结论:在作者的多 Agent harness 和测试集里,Sonnet 5.5 与 Opus 5.5 的 35 个隐藏测试修复结果相同,研究问题也都答对;Sonnet 5.5 平均快约 22%,并在校对 33 个植入错误时优于 Haiku。但 Sonnet 5.5 有 4/35 次越过指定目录,作者因此将它安排为 proofreader,而不是主研究或代码模型。
这不是公开可复现基准。prompt、harness、权限、隐藏测试、代码、原始输出、日志、运行分布和评分脚本均不可见;作者没有披露 effort 或 API 参数,且“约 90 次”和“每次运行保持一致”无法从页面独立验证。研究任务和校对任务的结果也只适用于作者自定义样本,不能外推到开放式研究、生产代码库或所有文件操作场景。
评论中的 ERP 迁移 app 报告提供了一个更长时间、136 PR 的不同工作流,但同样没有公开数据和参数;其 Sonnet 5.5 结论只标为 day one、small sample、too early to call。页面顶部的 ClaudeAI-mod-bot 自动生成 TL;DR 没有作为证据使用,因为它是对 50 条评论的机器总结,不是原始测试数据。
要复现主报告,需要取得相同的 pseudo harness、权限和工作目录规则、35 个 broken-code 任务及 hidden tests、8 个已知答案问题、33 个植入错误、proofreading prompt、运行时版本和评分脚本;分别运行 Opus 5.5、Sonnet 5.5 和 Haiku,并记录每次任务的通过、越界、耗时、事实正确性、幻觉、漏检和误报。
还应提前定义文件范围判定、研究答案评分、style rule 的校对标准和计时边界,并公开原始输出。当前 Reddit 页面没有这些材料,因此本记录作为个人 field report 保存,不能作为独立复现实验或模型排名。
Claude Sonnet 5.5