CodeRabbit 在其代码审查流水线中的两组测试显示,Opus 5.5 找到了一些生产基线漏掉的问题,但同时也漏掉基线抓到的问题;Standard 在 80 个 OSS 模式上略优于 Max,Signal 的 13 个较难案例上 Max 的可操作命中更多,但评论量与 Token 用量也更高。
适合判断的任务:在 CodeRabbit 的 PR 审查流程中比较已知缺陷命中、可操作精度、评论量,以及 Standard/Max 配置的取舍。
不适合外推的任务:不能据此推断通用代码生成能力、其他审查器的效果,或生产团队会接受这些评论;Signal 只有 13 个案例,也不足以代表广泛的软件缺陷分布。
适用的模型版本:Claude Opus 5.5;Standard 和 Max 是 CodeRabbit 流水线配置,不等同于单一 API effort 值或 Anthropic 默认设置。
测试环境或客户端:CodeRabbit 自有代码审查流水线;与其生产模型组合(production baseline)比较。
推理档位和参数:Standard 组合较低的推理 effort,Max 组合较高的 effort。原文未公开各阶段的完整参数映射。
CodeRabbit 使用同一组审查流水线配置处理 OSS August 基准中的 80 个共同已知缺陷模式,并在独立的 Signal 基准上测试 13 个较难案例。每组均比较生产基线、Opus 5.5 Standard 和 Opus 5.5 Max。结果经过验证、去重和过滤。
报告指标包括已知问题命中数、可操作精度和评论量。文中“精度”指经基准判定器确认、针对目标问题的评论占比,不是开发者接受率。Actionable 结果只统计变更行内的可操作发现;full-stream 还包括变更行以外的发现。Severity 的 Major/Minor 是模型给评论的标签,并非不同缺陷数量。
OSS August:80 个模式
| 配置 | 可操作召回 | 可操作精度 | 报告评论数 |
|---|---|---|---|
| 生产基线 | 49/80 · 61.3% | 39.3% | 116 |
| Opus 5.5 Standard | 51/80 · 63.8% | 38.6% | 127 |
| Opus 5.5 Max | 50/80 · 62.5% | 35.7% | 140 |
相对各自测试基线,Standard 的可操作召回增加 2.50 个百分点、精度下降 0.7 个百分点;Max 的召回增加 1.25 个百分点、精度下降 3.6 个百分点。Standard 相对基线新增命中 11 个模式,同时漏掉基线命中的 9 个;Max 新增命中 14 个,同时漏掉 13 个。另有 20 个模式三者都未命中。原文指出两种 Opus 5.5 配置都发现了 Cal.com 重试计数并发更新问题,而生产基线漏掉了它。
Signal:13 个较难模式
| 配置 | 可操作命中 | 可操作精度 | 报告评论数 | Major 评论 | Minor 评论 |
|---|---|---|---|---|---|
| 生产基线 | 5/13 · 38.5% | 29.4% | 17 | 11 | 6 |
| Opus 5.5 Standard | 8/13 · 61.5% | 66.7% | 21 | 14 | 7 |
| Opus 5.5 Max | 10/13 · 76.9% | 52.0% | 25 | 13 | 12 |
纳入变更行以外的发现后,基线覆盖 7/13,Standard 和 Max 均为 10/13。Standard 与 Max 完整审查命中的问题组合不同。原文未提供两配置的逐案例命中清单,因此无法从该文计算互补审查的实际组合效果。
Token 用量
| 配置 | OSS August:相对生产基线 | Signal:相对生产基线 |
|---|---|---|
| Opus 5.5 Standard | +49.2% | +40.6% |
| Opus 5.5 Max | +57.6% | +60.1% |
这是运行汇总中的 Token 用量变化;原文没有拆分输入、输出、缓存 Token,也未给出相应的美元成本或延迟。文章另列模型标价:输入每百万 Token $4、输出 $20、缓存读取 $0.20,并称其分别低于 Opus 5 的 $5、$25、$0.50;标价变化不能直接推出一次审查的总成本下降。
在这两组测试中,Opus 5.5 带来了与基线不同的缺陷命中组合。OSS August 上的覆盖提升幅度不大,且伴随较低的可操作精度和更多评论。
Standard 在 OSS August 上以较少评论取得略高命中数和精度,适合作为 CodeRabbit 自测中的初始候选。Signal 上 Max 的变更行内命中数更高,但精度低于 Standard,评论更多;纳入变更行外发现后,Standard 与 Max 都命中 10/13。
文章将 Opus 5 的历史结果与 Opus 5.5 并列作背景,但两轮使用不同测试集与配置,不能解释为模型版本间的直接增量比较。
这是 CodeRabbit 对自有产品流水线的评测。公开正文未提供 80/13 个测试样本的完整清单、判定器细节、逐评论原始记录或运行脚本;测试不能独立复跑。结果也没有测量把两个审查器同时运行时的成本、评论量或实际收益。
结论适用于该文描述的基准与流水线。团队若要选型,应在自身代码库中检查新增命中和丢失命中,并同时记录审阅负担、各类 Token、成本和耗时。
复核原文的 “What we tested”“Start your evaluation with Standard”“Test what higher effort changes” 和定价段落。复现同类对比需要取得相同版本的 80 个 OSS 模式及 13 个 Signal 案例、生产基线与两个 CodeRabbit 配置、判定器及过滤规则,并记录变更行内外发现和完整 Token 分类;这些材料并未由本文完整公开。
Claude Opus 5.5