Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Fable 5.1

Claude Fable 5.1 官方发布:多基准、成本档位与安全边界

原始来源

Anthropic News / Introducing Claude Fable 5.1 and Claude Mythos 5.1

作者Anthropic

原文日期2026-09

Tabbit 整理2026-09-08

查看原文

一句话结论

Anthropic 的发布数据把 Fable 5.1 定位为面向长时域编码、科学研究和知识工作的高端 Agent 模型,但不同 effort、工具、harness 与生产安全护栏会显著改变结果,不能只看单一榜单数字。

适用场景

  • 适合的任务:长时域编码与调试、科学研究型 Agent、知识工作、桌面/浏览器操作、复杂多步骤分析和需要持续验证的工作流。

  • 不适合的任务:只需低延迟短答、没有工具或验证环节的简单问答;对高风险双用途网络安全和生命科学任务,Fable 的护栏可能转交到其他模型或拒绝。

  • 适用的模型版本:Claude Fable 5.1;页面同时列出 Fable 5、Opus 5 和 GPT-5.6 Sol 作为对照。

  • 适用的客户端、Agent 或 API:发布页未限定单一客户端;图表和 benchmark 使用各自 harness,不能默认等同于 Claude.ai、Claude Code 或第三方 API 的结果。

  • 推荐的推理档位和参数:官方建议从 High 开始,再用 Low、Medium、xhigh、max 在自己的 eval 上做扫参;发布页说明 Claude Code 默认 High,Claude Cowork 与 Claude.ai 默认 Medium。

测试方法/数据

发布页没有公开每个 benchmark 的完整题目、提示词、采样重复次数和所有 harness 配置,因此以下数字是官方发布基线,不是独立复现结果。

任务/基准Fable 5.1Fable 5Opus 5GPT-5.6 Sol备注
Terminal-Bench-Science 0.152.6%24.7%29.0%22.4%Agentic scientific research;官方图表注明标准误约 ±3.5–4.5 点
Terminal-Bench 4.055.8%52.3%42.0%37.3%Agentic coding;页面另列 Mythos 5.1 为 60.9%,不能与 Fable 的护栏条件混用
GDPval-AA v21853172318241711Knowledge work
OSWorld 2.0(partial)77.9%72.9%75.4%—Computer use;GPT-5.6 Sol 未提供
OSWorld 2.0(strict)41.7%36.1%39.6%—Computer use;与 partial 是不同口径
Humanity’s Last Exam(无工具)60.9%57.8%56.6%—Multidisciplinary reasoning
Humanity’s Last Exam(有工具)65.0%63.8%63.6%—工具条件改变,不能与无工具结果直接比较
AutomationBench31.4%17.1%26.9%19.6%Business workflows
CursorBench 3.2.073.4%70.5%70.0%67.2%Agentic coding

发布页还给出 Terminal-Bench-Science 的复核说明:公开排行榜使用 Claude Code harness、每题 3 次试验,Opus 5 为 30.0%、Fable 5 为 21.4%;Anthropic 自己的设置复现为 29.0% 和 24.7%,并称两者都在噪声范围内。这说明 harness 差异本身足以改变分数。

结论

  1. 科学研究和根因分析是最有辨识度的强项候选:Terminal-Bench-Science 的 52.6% 高于官方对照模型;但需要保留标准误和实验 harness,不能把它解释为所有科学任务都提升约一倍。

  2. 知识工作和工程 Agent 处于前沿区间:GDPval-AA v2 为 1853,CursorBench 为 73.4%,适合把模型用于跨文件修改、复杂研究和带验证的长流程。

  3. 成本/质量应按 effort 路由:官方称 Fable 5.1 在 Low/Medium 可达到接近或优于 Fable 5 的结果;实际选型应记录质量、token、延迟和每任务成本,而不是只比较 max 分数。

边界与风险

  • 这是模型提供方自报结果;页面没有公开所有原始题目、逐题轨迹、提示词、方差和完整 API 参数。

  • 官方承认生产安全护栏会影响 benchmark:在护栏介入的 OSWorld 任务中,Fable 5.1 与 Fable 5 记为零;AutomationBench 中 Fable 5 也有同类情况。其他受限的网络安全和生命科学任务由 Opus 模型完成,因此不能把所有表格数字都视为“纯 Fable 5.1 能力”。

  • Terminal-Bench-Science 公开榜与 Anthropic 设置的对照分数不同;复现时必须固定题集版本、harness、effort、工具和安全设置。

  • 发布页中的合作方引述(如 Millennium、MongoDB、Browserbase)属于客户案例,未随页公开完整测试集和方法,不能按独立受控 benchmark 解读。

  • Fable 5.1 与 Mythos 5.1 使用同一模型但不同护栏;页面中的 Mythos 分数不能直接当作可公开调用的 Fable 结果。

复现建议

  1. 固定 claude-fable-5-1 的模型快照、effort(至少 Low/Medium/High/max)、最大输出、工具定义和安全路由。

  2. 为编码、科学检索、知识工作和电脑操作分别建立带明确成功判定的任务集;记录完整输入、工具轨迹、输出 token、延迟、成本和护栏介入。

  3. 对每个任务至少重复 3 次,并报告均值、标准误和失败类型;不要用一次运行替代官方的多试验比较。

  4. 将本页表格作为“官方基线”,另行与 Artificial Analysis、SimpleBench 等独立来源对照。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Fable 5.1

在 Tabbit 中使用并对比模型

Claude Fable 5.1

相关测评

官方OpenRouter Model Page2026-09-02

OpenRouter:Claude Fable 5.1 的 Provider 性能与基准快照

媒体Artificial Analysis2026-09-01

Artificial Analysis:Claude Fable 5.1 智能指数、任务分项与成本

媒体SimpleBench

SimpleBench:Claude Fable 5.1 的日常推理与人类基线

社区Reddit / r/ArtificialInteligence2026-09-02

Reddit 社区:Fable 5.1 基准质疑与任务分层体验

Claude Fable 5.1

相关提示词

媒体Anthropic Claude Platform Docs

Claude Fable 5.1 官方提示方法:写作密度、工具批处理与任务收尾

社区Reddit(r/claude)2026-09-02

Reddit 社区提示技巧:长文分析、反方论证与简洁执行

社区Reddit(r/ClaudeAI)2026-09-05

Reddit 案例:Fable 5.1 + Blender MCP 一次性生成大型世界区域