Tabbit博客

Claude Fable 5.1 评测:Agent 长任务很强,但成本取决于工作负载

基于官方、独立评测和社区原始页面,分析 Claude Fable 5.1 的编码、Agent 工作、价格、基准限制与 Tabbit 未验证的访问边界。

本文目录
  1. 结论先说
  2. 快速规格
  3. 基准与口径
  4. 三个具体优点
  5. 1. 长链路工具使用是核心场景
  6. 2. 知识工作和诊断有具体线索
  7. 3. 缓存价格可能改善长会话经济性
  8. 三个需要预算的缺点
  9. 1. 延迟和配额都是产品体验
  10. 2. 安全策略会改变能力和分数
  11. 3. 覆盖广但仍不完整
  12. 社区信号:赞赏和挫败同时存在
  13. 按工作负载判断
  14. Tabbit 边界与下一步
  15. 最终判断
  16. 来源

Claude Fable 5.1 适合长时间调用工具的工作,但不是所有场景的通用升级。多文件编程、带验证循环的研究和知识工作可以先试;短编辑、严格配额或低延迟聊天则应先比较更小、更快的模型。

本评测以 Anthropic 发布页为版本和价格锚点,并在 2026 年 9 月 20 日重新打开核对。最值得记住的是:缓存读取降价 75% 至每百万 token 0.25 美元,但完整任务不会因此自动便宜 75%。当前 API ID 是 claude-fable-5-1,实际能力仍取决于接入路线、effort 和安全策略。

结论先说

  • 最适合:多文件编码、工具调用、技术研究和有验收条件的知识工作。

  • 三个优点:官方 Agent 基准强;官方合作案例包含根因分析和无人值守任务;缓存读取价格确实提供成本杠杆。

  • 三个缺点:首 token 和配额风险;安全干预会改变结果;公开证据使用不同 harness 且覆盖不完整。

  • Tabbit 边界:公开 Tabbit 页面没有登录后的 Fable 5.1 选择器或可执行任务,因此本文不声称 Tabbit 已支持它。

可先看 Claude Fable 5.1 模型资源,再查看其 提示词库评测库

快速规格

项目已发布快照不能证明什么
API ID 与版本claude-fable-5-1;2026 年 9 月发布页你的套餐或浏览器一定暴露该模型
输入/输出价格每百万 token 10/50 美元思考、重试和工具后的完整任务成本
缓存读取每百万 token 0.25 美元,比 Fable 5 低 75%每个任务都固定节省 75%
上下文发布材料描述 1M 上下文路线每个 Provider 都开放完整上限
默认 effortClaude Code 为 High,Claude Cowork 和 Claude.ai 为 Medium所有客户端都有相同设置
可用路线Anthropic API、AWS、Google Cloud、Microsoft Azure你的账户、地区、配额和工具权限
独立快照BenchLM:84.7/100、230 个模型中第 1、68 tok/s、首 token 262.88 秒通用延迟承诺或生产复测

基准与口径

Anthropic 发布页列出:Terminal-Bench-Science 0.1 为 52.6%,Terminal-Bench 4.0 为 55.8%,GDPval-AA v2 为 1,853,OSWorld 2.0 partial 为 77.9%,strict 为 41.7%,Humanity's Last Exam 无工具为 60.9%、有工具为 65.0%,AutomationBench 为 31.4%,CursorBench 3.2.0 为 73.4%。对应 Fable 5 的可比值分别为 24.7%、42.0%、1,723、72.9%、36.1%、57.8%、63.8%、17.1% 和 70.5%。

这些数字不能拼成一个总榜。Anthropic 说明 Terminal-Bench-Science 的标准误差约为正负 3.5–4.5 分,且发布表使用特定 harness;生产安全策略介入时,OSWorld 和 AutomationBench 任务可能记为零。BenchLM 的 9 月 18 日页面是聚合快照,显示 26 条基准、分类覆盖不完整;Medium 独立文章正文需要会员,本文只使用它公开可见的“两个榜单领先但速度最慢、某项任务成本最高”概括。没有任何一项是你的仓库复跑。

三个具体优点

1. 长链路工具使用是核心场景

52.6% 的 Terminal-Bench-Science 和 55.8% 的 Terminal-Bench 4.0 都指向需要保持上下文、调用工具并检查中间结果的任务。Anthropic 的合作案例还提到 Millennium 追踪罕见崩溃,以及 Ramp 的无人值守实验发现标签伪影和生产告警。这些是厂商选择的案例,不是稳定性保证,却比单轮聊天分数更接近 Agent 工作。

想理解工具权限为何改变评测,可看 Agent 推理与深度研究什么是 Agent 浏览器

2. 知识工作和诊断有具体线索

GDPval-AA v2 为 1,853;MongoDB 描述了跨服务研究后进行无人值守验证的原型,Red Hat 称 Claude Code 在测试集合中找到了每个坏构建的根因。实际试用时应给它日志、文档和测试命令,再设置明确验收条件。合作案例不能替代你的事故数据。

3. 缓存价格可能改善长会话经济性

重复使用同一上下文时,每百万 token 0.25 美元的缓存读取是实在的成本杠杆。Anthropic 估计典型成本低约 25%,高度 Agent 化成本最多低约 45%。但输出、思考 effort、重试、工具和订阅配额仍会决定完整任务账单。真正应测的是每个验收结果的成本。

三个需要预算的缺点

1. 延迟和配额都是产品体验

BenchLM 在 9 月 18 日显示首 token 262.88 秒、速度 68 tok/s。这只是 Provider 快照,不是 SLA,却足以说明需要本地试用。Reddit 用户 momkeeeeeeee 一边称它是自己用过最好的模型,一边说一天消耗了约 30% 的配额;Every 视频评论中也有人说十到二十分钟就耗尽五小时窗口。套餐、提示词和路线未知,因此只能得出“长任务可能昂贵或缓慢”的结论。

2. 安全策略会改变能力和分数

Anthropic 称生产安全策略可减少 60% 的网络安全误报,同时明确 Fable 可发现漏洞但不能开发 exploit。发布页还说明安全干预的 OSWorld 和 AutomationBench 任务会记零。安全工作应限定为授权防御分析,并保留人工审核。

3. 覆盖广但仍不完整

BenchLM 页面没有测数学、多语、多模态和指令遵循。官方表格混合了 GUI、终端、编码与知识任务,系统卡 PDF 在研究浏览器中无法打开,独立 Medium 正文也有访问限制。未知项应留在决策里,不能把发布表写成普遍排名。

社区信号:赞赏和挫败同时存在

r/ClaudeCode 的 connurp 是全栈 Django 开发者,称 Medium effort 下代码更好、更快,并估算相对 Fable 5 加 Opus 5 的组合每次请求低约 37%。这是个人路由计算,不是基准。r/ClaudeAI 的 momkeeeeeeee 称它擅长整理记忆和综合三份血检结果,却在测试代码库时一天用掉约 30% 配额。

Every 的周测视频评论也出现同样分歧:有人喜欢写作,有人说不到 20 分钟就用完五小时窗口,或编码 token 很快耗尽。评论没有受控样本,但说明配额压力明显依赖任务。

按工作负载判断

工作负载结论试用方式
多文件编码和测试值得优先试固定模型 ID,保留测试命令,记录重试和总成本
带来源的技术研究可以试要求引用、矛盾检查和人工验收
短改写、快速聊天通常过重先比较更快、更便宜的模型
授权防御安全工作有条件可做发现和修复分析,保留 exploit 边界与人工签核
严格订阅配额不宜默认把机械子任务路由给其他模型,先测完整会话
浏览器研究Tabbit 中未验证检查实时选择器,不能从公开首页推断支持

浏览器自动化2026 年最佳 AI 浏览器AI 浏览器对比 只能提供客户端背景,不能证明 Fable 5.1 在 Tabbit 可用。

Tabbit 边界与下一步

本次研究核对了 Tabbit Browser 公开页面。页面有产品和下载信息,但没有登录后的模型选择器、Fable 5.1 输出或 model ID 校验;因此本文不声称完成了 Tabbit 实测。Tabbit 介绍Agent 浏览器指南Tabbit 使用习惯 解释了浏览器层工作流。

如果账户显示 Fable 5.1,先选择一个可撤销任务:带现有测试的多文件修改,或要求引用的小型研究包。记录模型 ID、effort、缓存读取、输出 token、工具调用、耗时、重试、配额和人工验收结果,再和 Fable 5 及当前模型比较每个合格结果的成本。

Tabbit Browser

最终判断

当任务够长、工具调用能带来回报、预算能承受波动时,Claude Fable 5.1 值得受控试用。官方 Agent 结果、合作案例和更低缓存读取价格都是优点,但不能抵消首 token、配额、安全干预和独立覆盖不足。

从能通过验收的最低 effort 开始;短任务交给小模型,机械子任务有意路由。完成真实 Tabbit 任务并补齐社区截图前,本文保持草稿。

来源

常见问题

Claude Fable 5.1 值得用吗?

如果任务需要长时间调用工具、编程和知识工作,可以先做受控试用。短对话、严格配额和低延迟场景不应直接默认使用。

Fable 5.1 比 Fable 5 便宜吗?

Anthropic 称缓存读取降价 75% 至每百万 token 0.25 美元,典型成本约低 25%,高度 Agent 化任务最多约低 45%。这不是每个完整任务都会获得的固定折扣。

Claude Fable 5.1 适合编程吗?

官方发布页给出 Terminal-Bench-Science 52.6%、Terminal-Bench 4.0 55.8% 和 CursorBench 3.2.0 73.4%。这些是方向性证据,仍需在自己的仓库和测试命令中复核。

为什么 Fable 5.1 会很快消耗配额?

高 effort、长上下文、输出、重试、工具调用和子 Agent 都可能叠加消耗。社区报告缺少套餐和 harness 信息,应作为测量理由而不是统一限制。

Tabbit 能用 Claude Fable 5.1 吗?

本评测没有验证这一点。2026 年 9 月 20 日检查公开 Tabbit 页面时,没有登录后的模型选择器或可运行的 Fable 5.1 工作区。

应怎样理解基准分数?

必须连同任务、harness、日期、effort 和安全规则一起阅读。Anthropic 给出的 Terminal-Bench-Science 标准误差约为正负 3.5–4.5 分,BenchLM 则是聚合快照,不是生产环境复跑。

下一步

让 Tabbit 与你并肩工作。

跨标签页调研、自动化重复的浏览器工作,让每一处上下文都触手可及。