Anthropic 的发布数据把 Fable 5.1 定位为面向长时域编码、科学研究和知识工作的高端 Agent 模型,但不同 effort、工具、harness 与生产安全护栏会显著改变结果,不能只看单一榜单数字。
适合的任务:长时域编码与调试、科学研究型 Agent、知识工作、桌面/浏览器操作、复杂多步骤分析和需要持续验证的工作流。
不适合的任务:只需低延迟短答、没有工具或验证环节的简单问答;对高风险双用途网络安全和生命科学任务,Fable 的护栏可能转交到其他模型或拒绝。
适用的模型版本:Claude Fable 5.1;页面同时列出 Fable 5、Opus 5 和 GPT-5.6 Sol 作为对照。
适用的客户端、Agent 或 API:发布页未限定单一客户端;图表和 benchmark 使用各自 harness,不能默认等同于 Claude.ai、Claude Code 或第三方 API 的结果。
推荐的推理档位和参数:官方建议从 High 开始,再用 Low、Medium、xhigh、max 在自己的 eval 上做扫参;发布页说明 Claude Code 默认 High,Claude Cowork 与 Claude.ai 默认 Medium。
发布页没有公开每个 benchmark 的完整题目、提示词、采样重复次数和所有 harness 配置,因此以下数字是官方发布基线,不是独立复现结果。
| 任务/基准 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol | 备注 |
|---|---|---|---|---|---|
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% | Agentic scientific research;官方图表注明标准误约 ±3.5–4.5 点 |
| Terminal-Bench 4.0 | 55.8% | 52.3% | 42.0% | 37.3% | Agentic coding;页面另列 Mythos 5.1 为 60.9%,不能与 Fable 的护栏条件混用 |
| GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 | Knowledge work |
| OSWorld 2.0(partial) | 77.9% | 72.9% | 75.4% | — | Computer use;GPT-5.6 Sol 未提供 |
| OSWorld 2.0(strict) | 41.7% | 36.1% | 39.6% | — | Computer use;与 partial 是不同口径 |
| Humanity’s Last Exam(无工具) | 60.9% | 57.8% | 56.6% | — | Multidisciplinary reasoning |
| Humanity’s Last Exam(有工具) | 65.0% | 63.8% | 63.6% | — | 工具条件改变,不能与无工具结果直接比较 |
| AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% | Business workflows |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% | Agentic coding |
发布页还给出 Terminal-Bench-Science 的复核说明:公开排行榜使用 Claude Code harness、每题 3 次试验,Opus 5 为 30.0%、Fable 5 为 21.4%;Anthropic 自己的设置复现为 29.0% 和 24.7%,并称两者都在噪声范围内。这说明 harness 差异本身足以改变分数。
科学研究和根因分析是最有辨识度的强项候选:Terminal-Bench-Science 的 52.6% 高于官方对照模型;但需要保留标准误和实验 harness,不能把它解释为所有科学任务都提升约一倍。
知识工作和工程 Agent 处于前沿区间:GDPval-AA v2 为 1853,CursorBench 为 73.4%,适合把模型用于跨文件修改、复杂研究和带验证的长流程。
成本/质量应按 effort 路由:官方称 Fable 5.1 在 Low/Medium 可达到接近或优于 Fable 5 的结果;实际选型应记录质量、token、延迟和每任务成本,而不是只比较 max 分数。
这是模型提供方自报结果;页面没有公开所有原始题目、逐题轨迹、提示词、方差和完整 API 参数。
官方承认生产安全护栏会影响 benchmark:在护栏介入的 OSWorld 任务中,Fable 5.1 与 Fable 5 记为零;AutomationBench 中 Fable 5 也有同类情况。其他受限的网络安全和生命科学任务由 Opus 模型完成,因此不能把所有表格数字都视为“纯 Fable 5.1 能力”。
Terminal-Bench-Science 公开榜与 Anthropic 设置的对照分数不同;复现时必须固定题集版本、harness、effort、工具和安全设置。
发布页中的合作方引述(如 Millennium、MongoDB、Browserbase)属于客户案例,未随页公开完整测试集和方法,不能按独立受控 benchmark 解读。
Fable 5.1 与 Mythos 5.1 使用同一模型但不同护栏;页面中的 Mythos 分数不能直接当作可公开调用的 Fable 结果。
固定 claude-fable-5-1 的模型快照、effort(至少 Low/Medium/High/max)、最大输出、工具定义和安全路由。
为编码、科学检索、知识工作和电脑操作分别建立带明确成功判定的任务集;记录完整输入、工具轨迹、输出 token、延迟、成本和护栏介入。
对每个任务至少重复 3 次,并报告均值、标准误和失败类型;不要用一次运行替代官方的多试验比较。
将本页表格作为“官方基线”,另行与 Artificial Analysis、SimpleBench 等独立来源对照。
Claude Fable 5.1