OpenRouter 的实时页显示 Fable 5.1 在多个 Provider 上约有 44–56 tok/s 的一周平均吞吐、约 4.18–6.01 秒平均首段/请求延迟,并提供 GPQA Diamond、TAU-Bench 和结构化输出错误率等路由快照,适合做接入层选型而不是替代受控能力评测。
适合的任务:比较同一模型经 Azure、Anthropic、Amazon Bedrock BYOK 和 Google Vertex 接入时的延迟、吞吐、可用性与结构化输出表现。
不适合的任务:据此推断模型推理能力、长时域 Agent 成功率或不同客户端的端到端体验;Provider 路由和流量组成会影响结果。
适用的模型版本:OpenRouter 上的 anthropic/claude-fable-5.1。
适用的客户端、Agent 或 API:OpenRouter 路由;页面列出 Hermes Agent、Claude Code、Kilo Code 等流量较大的应用,但不是这些应用的受控对比实验。
推荐的推理档位和参数:页面未公开这些遥测对应的 effort、prompt、输出长度或采样设置;生产接入需自行固定这些变量。
页面对各 Provider 展示 P50 运行数据:
标准端点报价均为输入 $10/百万 token、输出 $50/百万 token、cache read $0.25/百万 token。
Provider P50:Azure 延迟 14.96s、吞吐 56 tok/s;Anthropic 延迟 5.97s、吞吐 45 tok/s、可用性 99.91%;Amazon Bedrock(BYOK)延迟 11.58s、吞吐 53 tok/s;Google Vertex 延迟 4.84s、吞吐 65 tok/s、可用性 99.35%。
过去一周平均吞吐:Vertex 56 tok/s、Bedrock 46 tok/s、Anthropic 44 tok/s;平均首段/请求延迟:Vertex 4.18s、Anthropic 5.96s、Azure 6.01s;端到端平均延迟则分别为 12.51s、16.20s、16.15s。
AutoExacto Benchmarks:GPQA Diamond 自动路由 90.9%、Anthropic 86.5%、Vertex 84.9%、Azure 86.3%;TAU-Bench Anthropic 79.3%、Vertex 76.7%、Azure 74.7%。页面未给出自动路由与 Provider 结果的完整题集和重复次数。
结构化输出错误率:Anthropic 平均 8.33%,Bedrock 33.12%,Azure 38.51%;缓存命中率约 85.26%–86.82%。
采集时页面显示过去 3 天 OpenRouter uptime 100%、availability 99.92%,但不绕过 Provider 故障的“无路由”availability 为 98.25%。
OpenRouter 的证据主要用于部署层判断:Vertex 在该页面快照中吞吐和延迟领先,Anthropic 端点结构化输出错误率较低;如果任务依赖 JSON/结构化调用,Provider 差异可能比模型名本身更影响稳定性。生产环境应固定 provider 过滤、路由策略和重试方式后再测。
这是平台实时遥测,不是公开的受控 benchmark 报告;页面没有完整输入集、输出长度分布、effort、采样参数或统计置信区间。
P50、过去一周平均值和过去三天 uptime 的时间窗口不同,不能混为一个统一指标。
OpenRouter 会在 Provider 失败时自动切换;启用路由与禁用路由的可用性不可直接比较。
BYOK、计费、缓存和数据保留政策各不相同;页面特别提示 Anthropic 数据保留规则不允许 zero data retention,生产合规需另行核对。
性能数据会随 Provider 排队、区域、流量和页面时间窗口变化;本文只保存 2026-09-08 的快照。
固定 OpenRouter provider 过滤、区域、路由策略、模型快照、prompt 长度、输出上限和 effort。
使用同一输入集对每个 Provider 重复请求,记录 TTFT、端到端延迟、吞吐、结构化输出解析成功率、重试和 fallback。
将接入层指标与能力评测分开报告;不要用 provider 的 GPQA/TAU 快照替代完整模型 benchmark。
Claude Fable 5.1