METR 的初步评估认为 Claude Opus 5.5 相较 Fable 5.1 在多项 AI 研发相关任务上有渐进提升,可能略微提高研究者生产力,但尚无证据显示它能完全自动化 AI 研发。
适合判断的任务:长时程 AI 研发任务、模型训练与优化、概念论证、游戏代理编程、开放式研究与报告撰写。
不适合外推的任务:一般办公与日常问答、未测试的软件工程任务、对齐属性、Anthropic 政策阈值合规性,以及所有 AI 研发工作能否自动化。
适用的模型版本:Claude Opus 5.5;比较对象为 Fable 5.1。
测试环境或客户端:METR 获得的 API 访问;测试持续 10 个工作日。具体 API 参数、模型快照和完整运行环境未披露。
推理档位和参数:未注明。
METR 将这项工作描述为预部署初步评估,主要收集 Claude Opus 5.5 对 AI 研发影响的证据,关注两个问题:模型本身可能带来多大研发加速;AI 是否已显著加速了 Claude Opus 5.5 的开发。
能力测试使用 API 访问,在 10 个工作日内开展,包含五项任务:
Budget NanoGPT Speedrun:对 NanoGPT Speedrun 竞赛任务的受限版本,用于评估 AI 研发能力。
Language Model Conceptual Argumentation (LMCA):概念推理数据集,原文称该数据集见 Cooper 等人 2026 年的研究。
Train a Program:训练一个机器学习模型,使其复现给定软件的行为。
Gaming Bot:编写 Python 程序,通过非视觉 API 操控游戏。
Sunlight:开展开放式研究并撰写相应报告。
METR 还参考了其先前模型能力趋势研究、Anthropic 对能力与控制因素问卷的回答及一位 Anthropic 研究员访谈。另有一份由 METR 独立团队进行的 Anthropic 内部 AI 研发加速初步评估;该团队访问权限更高,只向本文团队提供结论,没有提供支撑证据或推理细节。因此,METR 将其作为输入,但没有在本文中直接论证该报告的主张。
METR 认为其定量评估显示 Claude Opus 5.5 相比 Fable 5.1 是渐进改进,而非不连续跃升;可验证任务(Budget NanoGPT、Gaming Bot)和较难验证任务(LMCA、Sunlight)均有提升。原文未公布各任务的分数、效应量或统计检验结果。
METR 认为 Claude Opus 5.5 的 AI 研发加速潜力略高于 Fable 5.1,可能为研究者带来稍高的生产力提升,也可能自动化研发中的有限部分;但不太可能完全自动化 AI 研发。
METR 指出模型在困难长时程任务和开放式推理中仍有专家通常具备的定性弱点,尤其是预见、预测、建立反馈循环以及研究判断力或品味。METR 表示现有证据没有显示这些判断能力相较 Fable 5.1 有大幅进步。
对“AI 是否显著加速了 Claude Opus 5.5 的开发”,METR 引用了另一份初步报告的估计:“能力整体约加速 1.5 倍(即 1 年完成相当于 1.5 年的进展),有约 30% 概率达到 2 倍加速”。METR 特别说明该报告没有标注估计适用的时间段,不能确定该估计是否对应 Claude Opus 5.5 的开发。
Anthropic 在问卷和访谈中称 Claude Opus 5.5 延续了 Mythos 级别的 Anthropic ECI 趋势。此项是 Anthropic 的说法,不是 METR 在本文展示的量化测试结果。
| 项目 | 原文披露内容 |
|---|---|
| API 测试窗口 | 10 个工作日 |
| 能力任务数 | 5 项:Budget NanoGPT Speedrun、LMCA、Train a Program、Gaming Bot、Sunlight |
| 直接比较模型 | Fable 5.1 |
| 任务级分数、样本量、重复次数 | 未披露 |
| 提示词、评分规则、推理参数、完整测试配置 | 未披露 |
| 内部 AI 研发加速估计 | 约 1.5 倍整体加速;约 30% 概率达到 2 倍;适用时间段不明,且来源报告未提供本文团队核验所需的证据细节 |
这篇报告适合作为 Claude Opus 5.5 在 AI 研发相关长时程任务上的初步能力判断。METR 自己的核心判断是:相较 Fable 5.1 有跨任务的渐进进步,但不足以据此推断 AI 研发已可被完全自动化。原文没有提供足以独立复算的任务级数据,因此上述结果应作为 METR 的定性评估结论,而非可复核的分数榜单。
独立性需要结合原文披露阅读:METR 称该评估依据一项无偿 AI 研发评估协议开展;METR 起草了初始摘要,Anthropic 有机会审阅并编辑摘要文本,最终文本被纳入 Claude Opus 5.5 系统卡。METR 也明确表示,这项工作不是为了核验 Anthropic 某项政策阈值的合规主张,也不评估模型是否具有特定对齐属性。
内部加速估计来自另一支 METR 团队,本文团队没有拿到其支持证据;METR 对此项估计的纳入称为更全面评估流程的试验版本。该估计的时间范围不明,不能直接归因到 Claude Opus 5.5 的开发周期。
原文没有公开五项任务的完整输入、数据集版本、任务数量、采样方式、运行配置或逐项结果,现阶段无法依据该页面独立复算。要复现比较,至少还需取得相同任务版本和评分标准、Claude Opus 5.5 与 Fable 5.1 的明确模型快照、API 参数、每项任务的运行次数及原始输出。METR 页面直接链接 Claude Opus 5.5 系统卡,但本记录只依据上述 METR 页面陈述其评估方法与结论。
Claude Opus 5.5