Claude Fable 5.1 适合长时间调用工具的工作,但不是所有场景的通用升级。多文件编程、带验证循环的研究和知识工作可以先试;短编辑、严格配额或低延迟聊天则应先比较更小、更快的模型。
本评测以 Anthropic 发布页为版本和价格锚点,并在 2026 年 9 月 20 日重新打开核对。最值得记住的是:缓存读取降价 75% 至每百万 token 0.25 美元,但完整任务不会因此自动便宜 75%。当前 API ID 是 claude-fable-5-1,实际能力仍取决于接入路线、effort 和安全策略。
结论先说
最适合:多文件编码、工具调用、技术研究和有验收条件的知识工作。
三个优点:官方 Agent 基准强;官方合作案例包含根因分析和无人值守任务;缓存读取价格确实提供成本杠杆。
三个缺点:首 token 和配额风险;安全干预会改变结果;公开证据使用不同 harness 且覆盖不完整。
Tabbit 边界:公开 Tabbit 页面没有登录后的 Fable 5.1 选择器或可执行任务,因此本文不声称 Tabbit 已支持它。
可先看 Claude Fable 5.1 模型资源,再查看其 提示词库 和 评测库。
快速规格
| 项目 | 已发布快照 | 不能证明什么 |
|---|---|---|
| API ID 与版本 | claude-fable-5-1;2026 年 9 月发布页 | 你的套餐或浏览器一定暴露该模型 |
| 输入/输出价格 | 每百万 token 10/50 美元 | 思考、重试和工具后的完整任务成本 |
| 缓存读取 | 每百万 token 0.25 美元,比 Fable 5 低 75% | 每个任务都固定节省 75% |
| 上下文 | 发布材料描述 1M 上下文路线 | 每个 Provider 都开放完整上限 |
| 默认 effort | Claude Code 为 High,Claude Cowork 和 Claude.ai 为 Medium | 所有客户端都有相同设置 |
| 可用路线 | Anthropic API、AWS、Google Cloud、Microsoft Azure | 你的账户、地区、配额和工具权限 |
| 独立快照 | BenchLM:84.7/100、230 个模型中第 1、68 tok/s、首 token 262.88 秒 | 通用延迟承诺或生产复测 |
基准与口径
Anthropic 发布页列出:Terminal-Bench-Science 0.1 为 52.6%,Terminal-Bench 4.0 为 55.8%,GDPval-AA v2 为 1,853,OSWorld 2.0 partial 为 77.9%,strict 为 41.7%,Humanity's Last Exam 无工具为 60.9%、有工具为 65.0%,AutomationBench 为 31.4%,CursorBench 3.2.0 为 73.4%。对应 Fable 5 的可比值分别为 24.7%、42.0%、1,723、72.9%、36.1%、57.8%、63.8%、17.1% 和 70.5%。
这些数字不能拼成一个总榜。Anthropic 说明 Terminal-Bench-Science 的标准误差约为正负 3.5–4.5 分,且发布表使用特定 harness;生产安全策略介入时,OSWorld 和 AutomationBench 任务可能记为零。BenchLM 的 9 月 18 日页面是聚合快照,显示 26 条基准、分类覆盖不完整;Medium 独立文章正文需要会员,本文只使用它公开可见的“两个榜单领先但速度最慢、某项任务成本最高”概括。没有任何一项是你的仓库复跑。
三个具体优点
1. 长链路工具使用是核心场景
52.6% 的 Terminal-Bench-Science 和 55.8% 的 Terminal-Bench 4.0 都指向需要保持上下文、调用工具并检查中间结果的任务。Anthropic 的合作案例还提到 Millennium 追踪罕见崩溃,以及 Ramp 的无人值守实验发现标签伪影和生产告警。这些是厂商选择的案例,不是稳定性保证,却比单轮聊天分数更接近 Agent 工作。
想理解工具权限为何改变评测,可看 Agent 推理与深度研究 和 什么是 Agent 浏览器。
2. 知识工作和诊断有具体线索
GDPval-AA v2 为 1,853;MongoDB 描述了跨服务研究后进行无人值守验证的原型,Red Hat 称 Claude Code 在测试集合中找到了每个坏构建的根因。实际试用时应给它日志、文档和测试命令,再设置明确验收条件。合作案例不能替代你的事故数据。
3. 缓存价格可能改善长会话经济性
重复使用同一上下文时,每百万 token 0.25 美元的缓存读取是实在的成本杠杆。Anthropic 估计典型成本低约 25%,高度 Agent 化成本最多低约 45%。但输出、思考 effort、重试、工具和订阅配额仍会决定完整任务账单。真正应测的是每个验收结果的成本。
三个需要预算的缺点
1. 延迟和配额都是产品体验
BenchLM 在 9 月 18 日显示首 token 262.88 秒、速度 68 tok/s。这只是 Provider 快照,不是 SLA,却足以说明需要本地试用。Reddit 用户 momkeeeeeeee 一边称它是自己用过最好的模型,一边说一天消耗了约 30% 的配额;Every 视频评论中也有人说十到二十分钟就耗尽五小时窗口。套餐、提示词和路线未知,因此只能得出“长任务可能昂贵或缓慢”的结论。
2. 安全策略会改变能力和分数
Anthropic 称生产安全策略可减少 60% 的网络安全误报,同时明确 Fable 可发现漏洞但不能开发 exploit。发布页还说明安全干预的 OSWorld 和 AutomationBench 任务会记零。安全工作应限定为授权防御分析,并保留人工审核。
3. 覆盖广但仍不完整
BenchLM 页面没有测数学、多语、多模态和指令遵循。官方表格混合了 GUI、终端、编码与知识任务,系统卡 PDF 在研究浏览器中无法打开,独立 Medium 正文也有访问限制。未知项应留在决策里,不能把发布表写成普遍排名。
社区信号:赞赏和挫败同时存在
r/ClaudeCode 的 connurp 是全栈 Django 开发者,称 Medium effort 下代码更好、更快,并估算相对 Fable 5 加 Opus 5 的组合每次请求低约 37%。这是个人路由计算,不是基准。r/ClaudeAI 的 momkeeeeeeee 称它擅长整理记忆和综合三份血检结果,却在测试代码库时一天用掉约 30% 配额。
Every 的周测视频评论也出现同样分歧:有人喜欢写作,有人说不到 20 分钟就用完五小时窗口,或编码 token 很快耗尽。评论没有受控样本,但说明配额压力明显依赖任务。
按工作负载判断
| 工作负载 | 结论 | 试用方式 |
|---|---|---|
| 多文件编码和测试 | 值得优先试 | 固定模型 ID,保留测试命令,记录重试和总成本 |
| 带来源的技术研究 | 可以试 | 要求引用、矛盾检查和人工验收 |
| 短改写、快速聊天 | 通常过重 | 先比较更快、更便宜的模型 |
| 授权防御安全工作 | 有条件 | 可做发现和修复分析,保留 exploit 边界与人工签核 |
| 严格订阅配额 | 不宜默认 | 把机械子任务路由给其他模型,先测完整会话 |
| 浏览器研究 | Tabbit 中未验证 | 检查实时选择器,不能从公开首页推断支持 |
浏览器自动化、2026 年最佳 AI 浏览器 和 AI 浏览器对比 只能提供客户端背景,不能证明 Fable 5.1 在 Tabbit 可用。
Tabbit 边界与下一步
本次研究核对了 Tabbit Browser 公开页面。页面有产品和下载信息,但没有登录后的模型选择器、Fable 5.1 输出或 model ID 校验;因此本文不声称完成了 Tabbit 实测。Tabbit 介绍、Agent 浏览器指南 和 Tabbit 使用习惯 解释了浏览器层工作流。
如果账户显示 Fable 5.1,先选择一个可撤销任务:带现有测试的多文件修改,或要求引用的小型研究包。记录模型 ID、effort、缓存读取、输出 token、工具调用、耗时、重试、配额和人工验收结果,再和 Fable 5 及当前模型比较每个合格结果的成本。
最终判断
当任务够长、工具调用能带来回报、预算能承受波动时,Claude Fable 5.1 值得受控试用。官方 Agent 结果、合作案例和更低缓存读取价格都是优点,但不能抵消首 token、配额、安全干预和独立覆盖不足。
从能通过验收的最低 effort 开始;短任务交给小模型,机械子任务有意路由。完成真实 Tabbit 任务并补齐社区截图前,本文保持草稿。
来源
常见问题
Claude Fable 5.1 值得用吗?
如果任务需要长时间调用工具、编程和知识工作,可以先做受控试用。短对话、严格配额和低延迟场景不应直接默认使用。
Fable 5.1 比 Fable 5 便宜吗?
Anthropic 称缓存读取降价 75% 至每百万 token 0.25 美元,典型成本约低 25%,高度 Agent 化任务最多约低 45%。这不是每个完整任务都会获得的固定折扣。
Claude Fable 5.1 适合编程吗?
官方发布页给出 Terminal-Bench-Science 52.6%、Terminal-Bench 4.0 55.8% 和 CursorBench 3.2.0 73.4%。这些是方向性证据,仍需在自己的仓库和测试命令中复核。
为什么 Fable 5.1 会很快消耗配额?
高 effort、长上下文、输出、重试、工具调用和子 Agent 都可能叠加消耗。社区报告缺少套餐和 harness 信息,应作为测量理由而不是统一限制。
Tabbit 能用 Claude Fable 5.1 吗?
本评测没有验证这一点。2026 年 9 月 20 日检查公开 Tabbit 页面时,没有登录后的模型选择器或可运行的 Fable 5.1 工作区。
应怎样理解基准分数?
必须连同任务、harness、日期、effort 和安全规则一起阅读。Anthropic 给出的 Terminal-Bench-Science 标准误差约为正负 3.5–4.5 分,BenchLM 则是聚合快照,不是生产环境复跑。