Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
社区Claude Sonnet 5.5

Reddit 一手实测:Claude Sonnet 5.5 在修复、研究和校对任务中的约 90 次运行

原始来源

Reddit r/ClaudeAI

作者u/fuzzypetiolesguy(测试报告);原帖作者 u/thedirewulf

原文日期2026-09-28

Tabbit 整理2026-09-28

查看原文

一句话结论

在 u/fuzzypetiolesguy 自建的多 Agent pseudo harness 中,Sonnet 5.5 与 Opus 5.5 在 35 个隐藏测试代码修复任务和 8 个研究问题上打平,Sonnet 5.5 约快 22%;但它在 35 次代码任务中有 4 次越过指定文件夹,作者因此只让它承担 proofreader,全部数据仍属于未公开 prompt、日志和隐藏测试的个人报告。

适用场景

  • 适合判断的任务:代码修复、已知答案的资料查找、代码变更校对,以及把 Sonnet 5.5 放入 Opus 5.5 主导的多 Agent 工作流时的角色分工。

  • 不适合外推的任务:通用代码能力、开放式研究、不同 harness 或权限设置下的文件边界行为、正式基准排名,以及没有同样隐藏测试和规则时的成本收益。

  • 适用的模型版本:Claude Sonnet 5.5、Claude Opus 5.5;校对对照还包括较小的 Claude Haiku 模型。

  • 测试环境或客户端:作者称测试由 Opus 5.5 运行其多 Agent pseudo harness ruleset;原帖没有公开 harness、完整 prompt、权限配置、隐藏测试、输出日志或评分脚本。

  • 推荐的推理档位和参数:原帖未披露模型 effort、温度、工具版本或其他 API 参数;报告目标是 accuracy、速度和新增命中,而不是价格最优。

测评方法

作者先说明自己的工作流:Opus 5.5 负责研究和写代码,较小的 Haiku 模型在保存前校对;Sonnet 5.5 要想加入“AI crew”,需要在准确率上匹配并明显更快,或捕获更多问题。作者称总计完成约 90 次测试运行。

可见报告分为五类:

  1. Bug fixes:35 个 broken-code 任务,用 hidden tests 检查修复是否正确。

  2. Speed:比较每个任务的平均耗时。

  3. Staying in its lane:检查模型是否只在指定文件夹内工作。

  4. Research:8 个有已知答案的 lookup questions,其中包括一个询问不存在文件的问题。

  5. Proofreading:在两次测试变更中植入 33 个错误,包括 fake keys、passwords 和作者自定义 style rules,再比较模型能否发现。

作者没有给出每项任务的完整输入、隐藏测试内容、权限配置、运行次数如何分配到各类任务、原始输出或可下载日志,因此“约 90 次”只能按原帖作者的总数记录,不能由公开页面完整重算。

关键结果

代码修复:35 个隐藏测试任务

模型修复通过数未修复数
Claude Opus 5.534/351
Claude Sonnet 5.534/351

作者报告两者在 hidden tests 下打平。页面没有公开隐藏测试、失败案例、代码库、提交内容或通过判定脚本。

速度

模型每个任务耗时相对结果
Claude Opus 5.5约 28 秒对照
Claude Sonnet 5.5约 22 秒约快 22%

作者在第一次运行前设定的门槛是 25% 提速,因此其判断是“接近但不够”。页面没有说明计时是否包含工具调用、重试、冷启动或完整 Agent turn。

文件范围遵守:35 个代码任务

模型越过指定文件夹次数
Claude Opus 5.50/35
Claude Sonnet 5.54/35

Sonnet 5.5 越界产生的主要是 scratch files,作者称大多无害,但把它视为代码编辑 Agent 不应养成的习惯。该结果受 harness 的工作目录、权限和监控方式影响;这些设置未公开。

研究:8 个已知答案问题

模型正确事实发现虚构内容
Claude Opus 5.58/80
Claude Sonnet 5.58/80

8 个问题包含一个关于不存在文件的查询。作者报告两者都答对事实,且都没有编造内容;没有公开问题文本、来源、评分表或检索工具配置。

Proofreading:33 个植入错误

模型捕获错误False alarms指向错误行
Claude Sonnet 5.533/33未报告未报告
Claude Haiku29/3334

植入内容包括 fake keys、passwords 和作者自定义 style rules。作者称 Haiku 的多数漏检来自 style rules,并特别提到包括 em dash 规则;没有公开每个错误的位置、校对 prompt 或判定标准。

原始数据

u/fuzzypetiolesguy 报告摘要

项目页面可见内容
总运行量约 90 次
修复任务35 个,hidden tests
修复结果Opus 34/35;Sonnet 34/35
速度Sonnet 约 22 秒/任务;Opus 约 28 秒/任务;约快 22%
文件范围Sonnet 4/35 越过指定文件夹;Opus 0/35
研究8 个已知答案问题,两者全部答对且未编造
校对33 个植入错误;Sonnet 33/33;Haiku 29/33、3 次 false alarm、4 次错误行
作者最终分工Sonnet 5.5 负责 proofreader;Opus 负责 research 和 code;Haiku 被替换

作者称结果在每次运行中保持一致,但没有公开每次运行的逐项分数、置信区间或统计测试,不能把这句话解释为独立可复核的稳定性结论。

有限对照评论:u/Ogden_Morrow

另一位评论者描述了自己的 5 天 ERP migration app 测试:一个仓库有 136 个 PR,轮换不同模型负责 build 和 review。评论者报告:GPT-6 Astra 审查 Claude 构建的代码约每轮发现 1.25 个真实 bug,Fable 审查 Opus 构建的代码约每轮发现 1 个;Astra 对 Opus 构建且 Fable 通过的 31 次 merge 做 audit,发现 7 个真实 bug,分布在 6 次 merge 中,其中 2 个严重。

该评论者还称,让 orchestrator 自己审查代码几乎是 rubber stamp,约 0.13 个真实发现/轮;用新 reviewer session 和“你没有构建这段代码,请在 lab copy 中破坏它”的 adversarial brief 后表现更好。Sonnet 5.5 在第一天完成了 Opus 已开始的两个 fix rounds,其中一个第一次就通过并合并;每轮使用 Opus 先前同一 PR 的约三分之一到一半 token。评论者明确说样本太早,正在观察的是每次 merge 所需的 review rounds。

这条评论没有公开仓库、PR 清单、模型参数、prompt、bug 判定或日志,只作为不同工作流的有限对照,不能与主报告的 35 个 hidden-test 任务直接合并计算。

其他评论的范围

u/Physical_Gold_1485 只说自己针对行业任务做了不同 effort 的 Opus 5.5 与 Sonnet 5 测试,观察到 Sonnet 更便宜但 Opus 5.5 全部答对,并尝试调整 subagent 定义;该评论没有公开数量、prompt、评分和原始数据。它只能作为方向相反的个人意见,不能当作受控测评结果。

结论与边界

这份一手报告支持一个有限结论:在作者的多 Agent harness 和测试集里,Sonnet 5.5 与 Opus 5.5 的 35 个隐藏测试修复结果相同,研究问题也都答对;Sonnet 5.5 平均快约 22%,并在校对 33 个植入错误时优于 Haiku。但 Sonnet 5.5 有 4/35 次越过指定目录,作者因此将它安排为 proofreader,而不是主研究或代码模型。

这不是公开可复现基准。prompt、harness、权限、隐藏测试、代码、原始输出、日志、运行分布和评分脚本均不可见;作者没有披露 effort 或 API 参数,且“约 90 次”和“每次运行保持一致”无法从页面独立验证。研究任务和校对任务的结果也只适用于作者自定义样本,不能外推到开放式研究、生产代码库或所有文件操作场景。

评论中的 ERP 迁移 app 报告提供了一个更长时间、136 PR 的不同工作流,但同样没有公开数据和参数;其 Sonnet 5.5 结论只标为 day one、small sample、too early to call。页面顶部的 ClaudeAI-mod-bot 自动生成 TL;DR 没有作为证据使用,因为它是对 50 条评论的机器总结,不是原始测试数据。

复现说明

要复现主报告,需要取得相同的 pseudo harness、权限和工作目录规则、35 个 broken-code 任务及 hidden tests、8 个已知答案问题、33 个植入错误、proofreading prompt、运行时版本和评分脚本;分别运行 Opus 5.5、Sonnet 5.5 和 Haiku,并记录每次任务的通过、越界、耗时、事实正确性、幻觉、漏检和误报。

还应提前定义文件范围判定、研究答案评分、style rule 的校对标准和计时边界,并公开原始输出。当前 Reddit 页面没有这些材料,因此本记录作为个人 field report 保存,不能作为独立复现实验或模型排名。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Sonnet 5.5

在 Tabbit 中使用并对比模型

Claude Sonnet 5.5

相关测评

媒体Anthropic 官方网站

Claude Sonnet 5.5 官方能力基准与适用边界

媒体Artificial Analysis2026-09-28

Artificial Analysis:Claude Sonnet 5.5 的智能指数与 Agent 任务独立测评

社区X / Arena.ai2026-09-30

Arena.ai Code Arena:Claude Sonnet 5.5 High 的 WebDev 真实任务排名

媒体CodeRabbit 官方博客2026-09-28

CodeRabbit:Claude Sonnet 5.5 与 Sonnet 5、Opus 5.5 的代码审查比较

Claude Sonnet 5.5

相关提示词

媒体Claude Platform Docs

Anthropic 官方提示指南:Claude Sonnet 5.5 的 effort、主动性与工具调用

媒体Claude Platform Docs

Anthropic 官方迁移指南:Claude Sonnet 5.5 API 配置与 breaking changes

媒体Claude Platform Docs2026-09-28

Anthropic 官方模型概览:Claude Sonnet 5.5 当前配置

社区GitHub(由 Reddit r/ClaudeAI 帖子提供的原始文件)

社区配置:面向 Claude Sonnet 5.5 的 CLAUDE.md 工作规则