Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
官方Claude Fable 5.1

OpenRouter:Claude Fable 5.1 的 Provider 性能与基准快照

原始来源

OpenRouter Model Page

作者OpenRouter

原文日期2026-09-02

Tabbit 整理2026-09-08

查看原文

一句话结论

OpenRouter 的实时页显示 Fable 5.1 在多个 Provider 上约有 44–56 tok/s 的一周平均吞吐、约 4.18–6.01 秒平均首段/请求延迟,并提供 GPQA Diamond、TAU-Bench 和结构化输出错误率等路由快照,适合做接入层选型而不是替代受控能力评测。

适用场景

  • 适合的任务:比较同一模型经 Azure、Anthropic、Amazon Bedrock BYOK 和 Google Vertex 接入时的延迟、吞吐、可用性与结构化输出表现。

  • 不适合的任务:据此推断模型推理能力、长时域 Agent 成功率或不同客户端的端到端体验;Provider 路由和流量组成会影响结果。

  • 适用的模型版本:OpenRouter 上的 anthropic/claude-fable-5.1。

  • 适用的客户端、Agent 或 API:OpenRouter 路由;页面列出 Hermes Agent、Claude Code、Kilo Code 等流量较大的应用,但不是这些应用的受控对比实验。

  • 推荐的推理档位和参数:页面未公开这些遥测对应的 effort、prompt、输出长度或采样设置;生产接入需自行固定这些变量。

测试方法/数据

页面对各 Provider 展示 P50 运行数据:

  • 标准端点报价均为输入 $10/百万 token、输出 $50/百万 token、cache read $0.25/百万 token。

  • Provider P50:Azure 延迟 14.96s、吞吐 56 tok/s;Anthropic 延迟 5.97s、吞吐 45 tok/s、可用性 99.91%;Amazon Bedrock(BYOK)延迟 11.58s、吞吐 53 tok/s;Google Vertex 延迟 4.84s、吞吐 65 tok/s、可用性 99.35%。

  • 过去一周平均吞吐:Vertex 56 tok/s、Bedrock 46 tok/s、Anthropic 44 tok/s;平均首段/请求延迟:Vertex 4.18s、Anthropic 5.96s、Azure 6.01s;端到端平均延迟则分别为 12.51s、16.20s、16.15s。

  • AutoExacto Benchmarks:GPQA Diamond 自动路由 90.9%、Anthropic 86.5%、Vertex 84.9%、Azure 86.3%;TAU-Bench Anthropic 79.3%、Vertex 76.7%、Azure 74.7%。页面未给出自动路由与 Provider 结果的完整题集和重复次数。

  • 结构化输出错误率:Anthropic 平均 8.33%,Bedrock 33.12%,Azure 38.51%;缓存命中率约 85.26%–86.82%。

  • 采集时页面显示过去 3 天 OpenRouter uptime 100%、availability 99.92%,但不绕过 Provider 故障的“无路由”availability 为 98.25%。

结论

OpenRouter 的证据主要用于部署层判断:Vertex 在该页面快照中吞吐和延迟领先,Anthropic 端点结构化输出错误率较低;如果任务依赖 JSON/结构化调用,Provider 差异可能比模型名本身更影响稳定性。生产环境应固定 provider 过滤、路由策略和重试方式后再测。

边界与风险

  • 这是平台实时遥测,不是公开的受控 benchmark 报告;页面没有完整输入集、输出长度分布、effort、采样参数或统计置信区间。

  • P50、过去一周平均值和过去三天 uptime 的时间窗口不同,不能混为一个统一指标。

  • OpenRouter 会在 Provider 失败时自动切换;启用路由与禁用路由的可用性不可直接比较。

  • BYOK、计费、缓存和数据保留政策各不相同;页面特别提示 Anthropic 数据保留规则不允许 zero data retention,生产合规需另行核对。

  • 性能数据会随 Provider 排队、区域、流量和页面时间窗口变化;本文只保存 2026-09-08 的快照。

复现建议

  1. 固定 OpenRouter provider 过滤、区域、路由策略、模型快照、prompt 长度、输出上限和 effort。

  2. 使用同一输入集对每个 Provider 重复请求,记录 TTFT、端到端延迟、吞吐、结构化输出解析成功率、重试和 fallback。

  3. 将接入层指标与能力评测分开报告;不要用 provider 的 GPQA/TAU 快照替代完整模型 benchmark。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Fable 5.1

在 Tabbit 中使用并对比模型

Claude Fable 5.1

相关测评

媒体Anthropic News / Introducing Claude Fable 5.1 and Claude Mythos 5.12026-09

Claude Fable 5.1 官方发布:多基准、成本档位与安全边界

媒体Artificial Analysis2026-09-01

Artificial Analysis:Claude Fable 5.1 智能指数、任务分项与成本

媒体SimpleBench

SimpleBench:Claude Fable 5.1 的日常推理与人类基线

社区Reddit / r/ArtificialInteligence2026-09-02

Reddit 社区:Fable 5.1 基准质疑与任务分层体验

Claude Fable 5.1

相关提示词

媒体Anthropic Claude Platform Docs

Claude Fable 5.1 官方提示方法:写作密度、工具批处理与任务收尾

社区Reddit(r/claude)2026-09-02

Reddit 社区提示技巧:长文分析、反方论证与简洁执行

社区Reddit(r/ClaudeAI)2026-09-05

Reddit 案例:Fable 5.1 + Blender MCP 一次性生成大型世界区域