Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
媒体Claude Opus 5.5

METR 对 Claude Opus 5.5 的预部署能力评估

原始来源

METR 官网

作者未注明

原文日期2026-09-22

Tabbit 整理2026-09-22

查看原文

一句话结论

METR 的初步评估认为 Claude Opus 5.5 相较 Fable 5.1 在多项 AI 研发相关任务上有渐进提升,可能略微提高研究者生产力,但尚无证据显示它能完全自动化 AI 研发。

适用场景

  • 适合判断的任务:长时程 AI 研发任务、模型训练与优化、概念论证、游戏代理编程、开放式研究与报告撰写。

  • 不适合外推的任务:一般办公与日常问答、未测试的软件工程任务、对齐属性、Anthropic 政策阈值合规性,以及所有 AI 研发工作能否自动化。

  • 适用的模型版本:Claude Opus 5.5;比较对象为 Fable 5.1。

  • 测试环境或客户端:METR 获得的 API 访问;测试持续 10 个工作日。具体 API 参数、模型快照和完整运行环境未披露。

  • 推理档位和参数:未注明。

测评方法

METR 将这项工作描述为预部署初步评估,主要收集 Claude Opus 5.5 对 AI 研发影响的证据,关注两个问题:模型本身可能带来多大研发加速;AI 是否已显著加速了 Claude Opus 5.5 的开发。

能力测试使用 API 访问,在 10 个工作日内开展,包含五项任务:

  1. Budget NanoGPT Speedrun:对 NanoGPT Speedrun 竞赛任务的受限版本,用于评估 AI 研发能力。

  2. Language Model Conceptual Argumentation (LMCA):概念推理数据集,原文称该数据集见 Cooper 等人 2026 年的研究。

  3. Train a Program:训练一个机器学习模型,使其复现给定软件的行为。

  4. Gaming Bot:编写 Python 程序,通过非视觉 API 操控游戏。

  5. Sunlight:开展开放式研究并撰写相应报告。

METR 还参考了其先前模型能力趋势研究、Anthropic 对能力与控制因素问卷的回答及一位 Anthropic 研究员访谈。另有一份由 METR 独立团队进行的 Anthropic 内部 AI 研发加速初步评估;该团队访问权限更高,只向本文团队提供结论,没有提供支撑证据或推理细节。因此,METR 将其作为输入,但没有在本文中直接论证该报告的主张。

关键结果

  • METR 认为其定量评估显示 Claude Opus 5.5 相比 Fable 5.1 是渐进改进,而非不连续跃升;可验证任务(Budget NanoGPT、Gaming Bot)和较难验证任务(LMCA、Sunlight)均有提升。原文未公布各任务的分数、效应量或统计检验结果。

  • METR 认为 Claude Opus 5.5 的 AI 研发加速潜力略高于 Fable 5.1,可能为研究者带来稍高的生产力提升,也可能自动化研发中的有限部分;但不太可能完全自动化 AI 研发。

  • METR 指出模型在困难长时程任务和开放式推理中仍有专家通常具备的定性弱点,尤其是预见、预测、建立反馈循环以及研究判断力或品味。METR 表示现有证据没有显示这些判断能力相较 Fable 5.1 有大幅进步。

  • 对“AI 是否显著加速了 Claude Opus 5.5 的开发”,METR 引用了另一份初步报告的估计:“能力整体约加速 1.5 倍(即 1 年完成相当于 1.5 年的进展),有约 30% 概率达到 2 倍加速”。METR 特别说明该报告没有标注估计适用的时间段,不能确定该估计是否对应 Claude Opus 5.5 的开发。

  • Anthropic 在问卷和访谈中称 Claude Opus 5.5 延续了 Mythos 级别的 Anthropic ECI 趋势。此项是 Anthropic 的说法,不是 METR 在本文展示的量化测试结果。

原始数据

项目原文披露内容
API 测试窗口10 个工作日
能力任务数5 项:Budget NanoGPT Speedrun、LMCA、Train a Program、Gaming Bot、Sunlight
直接比较模型Fable 5.1
任务级分数、样本量、重复次数未披露
提示词、评分规则、推理参数、完整测试配置未披露
内部 AI 研发加速估计约 1.5 倍整体加速;约 30% 概率达到 2 倍;适用时间段不明,且来源报告未提供本文团队核验所需的证据细节

结论与边界

这篇报告适合作为 Claude Opus 5.5 在 AI 研发相关长时程任务上的初步能力判断。METR 自己的核心判断是:相较 Fable 5.1 有跨任务的渐进进步,但不足以据此推断 AI 研发已可被完全自动化。原文没有提供足以独立复算的任务级数据,因此上述结果应作为 METR 的定性评估结论,而非可复核的分数榜单。

独立性需要结合原文披露阅读:METR 称该评估依据一项无偿 AI 研发评估协议开展;METR 起草了初始摘要,Anthropic 有机会审阅并编辑摘要文本,最终文本被纳入 Claude Opus 5.5 系统卡。METR 也明确表示,这项工作不是为了核验 Anthropic 某项政策阈值的合规主张,也不评估模型是否具有特定对齐属性。

内部加速估计来自另一支 METR 团队,本文团队没有拿到其支持证据;METR 对此项估计的纳入称为更全面评估流程的试验版本。该估计的时间范围不明,不能直接归因到 Claude Opus 5.5 的开发周期。

复现说明

原文没有公开五项任务的完整输入、数据集版本、任务数量、采样方式、运行配置或逐项结果,现阶段无法依据该页面独立复算。要复现比较,至少还需取得相同任务版本和评分标准、Claude Opus 5.5 与 Fable 5.1 的明确模型快照、API 参数、每项任务的运行次数及原始输出。METR 页面直接链接 Claude Opus 5.5 系统卡,但本记录只依据上述 METR 页面陈述其评估方法与结论。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Opus 5.5

在 Tabbit 中使用并对比模型

Claude Opus 5.5

相关测评

媒体Anthropic 官方网站2026-09-22

Claude Opus 5.5 官方能力基准与适用边界

媒体SonarSource 官方博客2026-09-22

SonarSource:Claude Opus 5.5 Java 代码生成质量评估

媒体Artificial Analysis2026-09-22

Artificial Analysis 测评:Claude Opus 5.5 登顶智能指数,成本与输出量实测

媒体CodeRabbit 官方博客2026-09-22

CodeRabbit:Claude Opus 5.5 在代码审查中的召回与精度权衡

Claude Opus 5.5

相关提示词

媒体Anthropic Claude Platform Docs

Anthropic 官方 Claude Opus 5.5 提示方法

媒体Anthropic Claude Platform Docs

Anthropic 官方 Claude Opus 5.5 新能力与 API 配置

社区Reddit、GitHub2026-09-22

Reddit 用户分享的 Claude Opus 5.5 Claude Code 配置

媒体Amazon Bedrock 官方文档2026-09-22

在 Amazon Bedrock 上接入 Claude Opus 5.5