Claude Fable 5.1 模型测评导航
汇总 Claude Fable 5.1 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。
官方
1 条已核对来源的资料媒体
3 条已核对来源的资料Claude Fable 5.1 官方发布:多基准、成本档位与安全边界
Anthropic 的发布数据把 Fable 5.1 定位为面向长时域编码、科学研究和知识工作的高端 Agent 模型,但不同 effort、工具、harness 与生产安全护栏会显著改变结果,不能只看单一榜单数字。
Artificial Analysis:Claude Fable 5.1 智能指数、任务分项与成本
Artificial Analysis 的预发布独立评测显示 Fable 5.1 在 Intelligence Index 上达到 66 分、多个 agentic 任务创最高记录,但 max 档每任务成本高于 Fable 5,xhigh 往往是更平衡的成本/能力点。
SimpleBench:Claude Fable 5.1 的日常推理与人类基线
SimpleBench 的公开排行榜显示 Fable 5.1 得分 86.6%,高于该项目九名人类参与者的平均基线 83.7%,说明它在空间/时间、社会常识和语言陷阱题上表现强,但人类基线样本很小且不是通用能力证明。
社区
1 条已核对来源的资料Claude Fable 5.1
在 Tabbit 中使用并对比模型
汇总 Claude Fable 5.1 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。