Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Fable 5.1

SimpleBench:Claude Fable 5.1 的日常推理与人类基线

原始来源

SimpleBench

作者SimpleBench Team

Tabbit 整理2026-09-08

查看原文

一句话结论

SimpleBench 的公开排行榜显示 Fable 5.1 得分 86.6%,高于该项目九名人类参与者的平均基线 83.7%,说明它在空间/时间、社会常识和语言陷阱题上表现强,但人类基线样本很小且不是通用能力证明。

适用场景

  • 适合的任务:需要识别日常情境、空间/时间关系、社会智能和语言陷阱的选择题型推理。

  • 不适合的任务:编码、工具调用、长时域 Agent、科学研究和专业知识工作的选型;SimpleBench 是纯文本多选题,不能替代这些任务的 eval。

  • 适用的模型版本:排行榜列出 Claude Fable 5.1,分数标为 AVG@5;页面不在榜单行中公开具体 effort。

  • 适用的客户端、Agent 或 API:页面提供公开数据集、代码和在线试做;模型评测运行细节应以项目代码/技术报告为准。

  • 推荐的推理档位和参数:原页未公开 Fable 5.1 的 effort、温度和完整 API 参数;复现时不得自行假定为 max 或默认档位。

测试方法/数据

  • SimpleBench 是超过 200 道题的文本多选 benchmark,覆盖时空推理、社会智能和“语言对抗鲁棒性”(trick questions)。每题有 6 个选项。

  • 页面介绍称,九名非专业人类参与者构成平均基线 83.7%;每位参与者完成随机 25 题,覆盖全部 200+ 题,选择标准为英语母语、至少高中数学水平,未控制 IQ 或一般推理能力。

  • 当前榜单使用 Score (AVG@5)。Fable 5.1 为 86.6%,GPT-6 Astra Pro 为 86.5%,人类基线为 83.7%,GPT-6 Astra 为 83.6%,Gemini 3.8 Flash 为 82.4%,Fable 5 为 81.9%。

  • 项目公开 simple_bench_public.json 数据集与 GitHub 代码链接,页面另提供技术报告,具备进一步复核入口。

结论

Fable 5.1 在这套强调“看似简单、但容易被语言或常识陷阱误导”的日常推理题上超过人类平均基线约 2.9 个百分点。它适合被纳入日常判断、语义陷阱与社会常识类回归集,但这个结果不能外推为“整体智能超过人类”。

边界与风险

  • 人类基线只有 9 人,项目自身明确称样本较小;参与者选择存在偏差,83.7% 不等于人口平均水平。

  • 榜单的 AVG@5 说明存在多次平均,但当前页面没有在榜单行公开每次采样的提示词、温度、effort、模型快照和随机种子;复现时需查项目代码与技术报告并记录版本。

  • 题目是文本多选题,不测工具调用、代码执行、知识检索、输出质量或真实项目成功率。

  • 榜单会随新模型加入而变化;本文记录的是 2026-09-08 采集时的快照,不应当作永久排名。

  • “超过人类基线”只适用于该 benchmark 的平均分比较,不能直接转化成通用 AGI 或真实工作效率结论。

复现建议

  1. 从项目页面下载公开题集和代码,锁定 commit、题集版本与 AVG@5 评测方式。

  2. 明确 Fable 5.1 模型快照、effort、temperature、max tokens 和是否允许多次采样;保存每题五次输出与最终聚合分数。

  3. 与 Fable 5、Opus 5、GPT-5.6 Sol 等模型使用完全相同的题集和参数,报告每个分项及置信区间。

  4. 将结果仅用于“日常推理/陷阱题”能力判断,并与 Agent、编码和知识工作基准分开呈现。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Fable 5.1

在 Tabbit 中使用并对比模型

Claude Fable 5.1

相关测评

官方OpenRouter Model Page2026-09-02

OpenRouter:Claude Fable 5.1 的 Provider 性能与基准快照

媒体Anthropic News / Introducing Claude Fable 5.1 and Claude Mythos 5.12026-09

Claude Fable 5.1 官方发布:多基准、成本档位与安全边界

媒体Artificial Analysis2026-09-01

Artificial Analysis:Claude Fable 5.1 智能指数、任务分项与成本

社区Reddit / r/ArtificialInteligence2026-09-02

Reddit 社区:Fable 5.1 基准质疑与任务分层体验

Claude Fable 5.1

相关提示词

媒体Anthropic Claude Platform Docs

Claude Fable 5.1 官方提示方法:写作密度、工具批处理与任务收尾

社区Reddit(r/claude)2026-09-02

Reddit 社区提示技巧:长文分析、反方论证与简洁执行

社区Reddit(r/ClaudeAI)2026-09-05

Reddit 案例:Fable 5.1 + Blender MCP 一次性生成大型世界区域