Artificial Analysis 的预发布独立评测显示 Fable 5.1 在 Intelligence Index 上达到 66 分、多个 agentic 任务创最高记录,但 max 档每任务成本高于 Fable 5,xhigh 往往是更平衡的成本/能力点。
适合的任务:高难度知识工作、Agent 编码、科学/数学问题、金融工具调用和需要高质量专业产物的工作流。
不适合的任务:对成本和输出 token 极敏感的高并发简单任务;对展示质量要求极高的演示文稿任务,Fable 5.1 在 AA-Briefcase 的 presentation 子分项落后于 Opus 5。
适用的模型版本:Claude Fable 5.1,比较了 Low/Medium/High/xhigh/max effort;部分请求使用 Anthropic 的默认 server-side fallback。
适用的客户端、Agent 或 API:Artificial Analysis 的开放参考 Agent harness Stirrup;不是 Claude.ai 或 Claude Code 的端到端产品分数。
推荐的推理档位和参数:先以 xhigh 与 max 做质量上限对照;需要压低成本时测试 xhigh/medium,而不是假设 max 一定最优。
Artificial Analysis 称其在预发布阶段对 Fable 5.1 做了评估,并使用 Anthropic 的默认 server-side fallback;当请求触发安全护栏时,约 4% 的 Intelligence Index 输出 token 由 Fable 5.1 以外的 Opus 4.8 或 Opus 5 提供。该边界必须随结果一起记录。
核心结果:
Intelligence Index:Fable 5.1 max 为 66,高于 Opus 5 max 63、Fable 5 max 62、GPT-5.6 Sol max 61 和 Grok 4.6 high 61;Fable 5.1 相对 Fable 5 提升 4 分。
Humanity’s Last Exam:59.1%,高于此前 Fable 5 的 55.5%。
Terminal-Bench v2.1:91.4%;SciCode:62.0%;文章称两项均为其当时测到的最高分。
𝜏³-Banking:相对 Fable 5 提升 9 个百分点。
GDPval-AA v2:Fable 5.1 max 1853 Elo,Fable 5 max 1723;Opus 5 max 为 1824,差距在置信区间内。
AA-Briefcase:Fable 5.1 max 1694 Elo,Opus 5 max 1685,文章判断两者基本持平;Fable 5.1 analytical quality 为 2025、presentation 为 1495,Opus 5 对应为 1980 和 1572。
AA-Omniscience:Fable 5.1 max 尝试回答 93.4% 的问题,准确率 67.2%;Fable 5 为 87.8% 和 65.4%。未答对的问题中,Fable 5.1 的尝试率为 72.6%,高于 Fable 5 的 63.6%,因此综合指数与 Fable 5 持平。
成本:Fable 5.1 max 每个 Intelligence Index 任务约 $3.76,Fable 5 max $3.14,Opus 5 max $2.34;Fable 5.1 约使用 Fable 5 的 1.7 倍输出 token。xhigh 得分 65、每任务约 $2.72。
effort 范围:Fable 5.1 从 low 到 max 的输出 token 约从 13.1M 增至 143.7M,Intelligence Index 从 58 到 66,跨度约 11 倍。
若目标是高难度研究、agentic 编码或工具型知识工作,Fable 5.1 的强项是高端能力和任务完成质量,而不是单纯低价。
若任务可接受略低的最高分,xhigh 的 65 分/$2.72 比 max 的 66 分/$3.76 更适合作为成本敏感的默认档位;最终仍需用自己的任务集验证。
GDPval-AA v2 与 AA-Briefcase 表明它在分析质量上强,但“专业产物的展示质量”不一定同步领先;报告时应拆开子分项。
评测方称使用了参考 Agent harness 和默认 fallback;约 4% 输出 token 来自 Opus fallback,不能简单称为“100% Fable 5.1 原生结果”。
Intelligence Index 汇总了多个子评测,不能替代具体任务的成功率;不同模型的 effort、输出 token 和工具轨迹也不相同。
GDPval-AA v2 的 Fable 5.1 与 Opus 5 差距在置信区间内;不应将 1853 解读为统计显著的全面领先。
AA-Omniscience 显示更高尝试率同时带来更多错误尝试;需要按“答对率、拒答/不尝试率、幻觉率”拆解,不只看准确率。
文章是评测机构发布的聚合报告,完整逐题原始输出和所有参数需以 Artificial Analysis 的模型页/数据产品进一步核验。
固定 Fable 5.1 的 effort、fallback 策略和工具 harness,并明确是否允许安全触发后路由到 Opus。
复制相同任务集,分别记录完成率、rubric 分数、输出 token、缓存命中、每任务成本和 fallback 比例。
对 GDPval/Briefcase 类专业产物拆分分析质量与呈现质量,避免一个总分掩盖差异。
以 xhigh、max、Fable 5 和 Opus 5 做成对重复测试,并报告置信区间或标准误。
Claude Fable 5.1