Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Fable 5.1

Artificial Analysis:Claude Fable 5.1 智能指数、任务分项与成本

原始来源

Artificial Analysis

作者Artificial Analysis

原文日期2026-09-01

Tabbit 整理2026-09-08

查看原文

一句话结论

Artificial Analysis 的预发布独立评测显示 Fable 5.1 在 Intelligence Index 上达到 66 分、多个 agentic 任务创最高记录,但 max 档每任务成本高于 Fable 5,xhigh 往往是更平衡的成本/能力点。

适用场景

  • 适合的任务:高难度知识工作、Agent 编码、科学/数学问题、金融工具调用和需要高质量专业产物的工作流。

  • 不适合的任务:对成本和输出 token 极敏感的高并发简单任务;对展示质量要求极高的演示文稿任务,Fable 5.1 在 AA-Briefcase 的 presentation 子分项落后于 Opus 5。

  • 适用的模型版本:Claude Fable 5.1,比较了 Low/Medium/High/xhigh/max effort;部分请求使用 Anthropic 的默认 server-side fallback。

  • 适用的客户端、Agent 或 API:Artificial Analysis 的开放参考 Agent harness Stirrup;不是 Claude.ai 或 Claude Code 的端到端产品分数。

  • 推荐的推理档位和参数:先以 xhigh 与 max 做质量上限对照;需要压低成本时测试 xhigh/medium,而不是假设 max 一定最优。

测试方法/数据

Artificial Analysis 称其在预发布阶段对 Fable 5.1 做了评估,并使用 Anthropic 的默认 server-side fallback;当请求触发安全护栏时,约 4% 的 Intelligence Index 输出 token 由 Fable 5.1 以外的 Opus 4.8 或 Opus 5 提供。该边界必须随结果一起记录。

核心结果:

  • Intelligence Index:Fable 5.1 max 为 66,高于 Opus 5 max 63、Fable 5 max 62、GPT-5.6 Sol max 61 和 Grok 4.6 high 61;Fable 5.1 相对 Fable 5 提升 4 分。

  • Humanity’s Last Exam:59.1%,高于此前 Fable 5 的 55.5%。

  • Terminal-Bench v2.1:91.4%;SciCode:62.0%;文章称两项均为其当时测到的最高分。

  • 𝜏³-Banking:相对 Fable 5 提升 9 个百分点。

  • GDPval-AA v2:Fable 5.1 max 1853 Elo,Fable 5 max 1723;Opus 5 max 为 1824,差距在置信区间内。

  • AA-Briefcase:Fable 5.1 max 1694 Elo,Opus 5 max 1685,文章判断两者基本持平;Fable 5.1 analytical quality 为 2025、presentation 为 1495,Opus 5 对应为 1980 和 1572。

  • AA-Omniscience:Fable 5.1 max 尝试回答 93.4% 的问题,准确率 67.2%;Fable 5 为 87.8% 和 65.4%。未答对的问题中,Fable 5.1 的尝试率为 72.6%,高于 Fable 5 的 63.6%,因此综合指数与 Fable 5 持平。

  • 成本:Fable 5.1 max 每个 Intelligence Index 任务约 $3.76,Fable 5 max $3.14,Opus 5 max $2.34;Fable 5.1 约使用 Fable 5 的 1.7 倍输出 token。xhigh 得分 65、每任务约 $2.72。

  • effort 范围:Fable 5.1 从 low 到 max 的输出 token 约从 13.1M 增至 143.7M,Intelligence Index 从 58 到 66,跨度约 11 倍。

结论

  • 若目标是高难度研究、agentic 编码或工具型知识工作,Fable 5.1 的强项是高端能力和任务完成质量,而不是单纯低价。

  • 若任务可接受略低的最高分,xhigh 的 65 分/$2.72 比 max 的 66 分/$3.76 更适合作为成本敏感的默认档位;最终仍需用自己的任务集验证。

  • GDPval-AA v2 与 AA-Briefcase 表明它在分析质量上强,但“专业产物的展示质量”不一定同步领先;报告时应拆开子分项。

边界与风险

  • 评测方称使用了参考 Agent harness 和默认 fallback;约 4% 输出 token 来自 Opus fallback,不能简单称为“100% Fable 5.1 原生结果”。

  • Intelligence Index 汇总了多个子评测,不能替代具体任务的成功率;不同模型的 effort、输出 token 和工具轨迹也不相同。

  • GDPval-AA v2 的 Fable 5.1 与 Opus 5 差距在置信区间内;不应将 1853 解读为统计显著的全面领先。

  • AA-Omniscience 显示更高尝试率同时带来更多错误尝试;需要按“答对率、拒答/不尝试率、幻觉率”拆解,不只看准确率。

  • 文章是评测机构发布的聚合报告,完整逐题原始输出和所有参数需以 Artificial Analysis 的模型页/数据产品进一步核验。

复现建议

  1. 固定 Fable 5.1 的 effort、fallback 策略和工具 harness,并明确是否允许安全触发后路由到 Opus。

  2. 复制相同任务集,分别记录完成率、rubric 分数、输出 token、缓存命中、每任务成本和 fallback 比例。

  3. 对 GDPval/Briefcase 类专业产物拆分分析质量与呈现质量,避免一个总分掩盖差异。

  4. 以 xhigh、max、Fable 5 和 Opus 5 做成对重复测试,并报告置信区间或标准误。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Fable 5.1

在 Tabbit 中使用并对比模型

Claude Fable 5.1

相关测评

官方OpenRouter Model Page2026-09-02

OpenRouter:Claude Fable 5.1 的 Provider 性能与基准快照

媒体Anthropic News / Introducing Claude Fable 5.1 and Claude Mythos 5.12026-09

Claude Fable 5.1 官方发布:多基准、成本档位与安全边界

媒体SimpleBench

SimpleBench:Claude Fable 5.1 的日常推理与人类基线

社区Reddit / r/ArtificialInteligence2026-09-02

Reddit 社区:Fable 5.1 基准质疑与任务分层体验

Claude Fable 5.1

相关提示词

媒体Anthropic Claude Platform Docs

Claude Fable 5.1 官方提示方法:写作密度、工具批处理与任务收尾

社区Reddit(r/claude)2026-09-02

Reddit 社区提示技巧:长文分析、反方论证与简洁执行

社区Reddit(r/ClaudeAI)2026-09-05

Reddit 案例:Fable 5.1 + Blender MCP 一次性生成大型世界区域