SimpleBench 的公开排行榜显示 Fable 5.1 得分 86.6%,高于该项目九名人类参与者的平均基线 83.7%,说明它在空间/时间、社会常识和语言陷阱题上表现强,但人类基线样本很小且不是通用能力证明。
适合的任务:需要识别日常情境、空间/时间关系、社会智能和语言陷阱的选择题型推理。
不适合的任务:编码、工具调用、长时域 Agent、科学研究和专业知识工作的选型;SimpleBench 是纯文本多选题,不能替代这些任务的 eval。
适用的模型版本:排行榜列出 Claude Fable 5.1,分数标为 AVG@5;页面不在榜单行中公开具体 effort。
适用的客户端、Agent 或 API:页面提供公开数据集、代码和在线试做;模型评测运行细节应以项目代码/技术报告为准。
推荐的推理档位和参数:原页未公开 Fable 5.1 的 effort、温度和完整 API 参数;复现时不得自行假定为 max 或默认档位。
SimpleBench 是超过 200 道题的文本多选 benchmark,覆盖时空推理、社会智能和“语言对抗鲁棒性”(trick questions)。每题有 6 个选项。
页面介绍称,九名非专业人类参与者构成平均基线 83.7%;每位参与者完成随机 25 题,覆盖全部 200+ 题,选择标准为英语母语、至少高中数学水平,未控制 IQ 或一般推理能力。
当前榜单使用 Score (AVG@5)。Fable 5.1 为 86.6%,GPT-6 Astra Pro 为 86.5%,人类基线为 83.7%,GPT-6 Astra 为 83.6%,Gemini 3.8 Flash 为 82.4%,Fable 5 为 81.9%。
项目公开 simple_bench_public.json 数据集与 GitHub 代码链接,页面另提供技术报告,具备进一步复核入口。
Fable 5.1 在这套强调“看似简单、但容易被语言或常识陷阱误导”的日常推理题上超过人类平均基线约 2.9 个百分点。它适合被纳入日常判断、语义陷阱与社会常识类回归集,但这个结果不能外推为“整体智能超过人类”。
人类基线只有 9 人,项目自身明确称样本较小;参与者选择存在偏差,83.7% 不等于人口平均水平。
榜单的 AVG@5 说明存在多次平均,但当前页面没有在榜单行公开每次采样的提示词、温度、effort、模型快照和随机种子;复现时需查项目代码与技术报告并记录版本。
题目是文本多选题,不测工具调用、代码执行、知识检索、输出质量或真实项目成功率。
榜单会随新模型加入而变化;本文记录的是 2026-09-08 采集时的快照,不应当作永久排名。
“超过人类基线”只适用于该 benchmark 的平均分比较,不能直接转化成通用 AGI 或真实工作效率结论。
从项目页面下载公开题集和代码,锁定 commit、题集版本与 AVG@5 评测方式。
明确 Fable 5.1 模型快照、effort、temperature、max tokens 和是否允许多次采样;保存每题五次输出与最终聚合分数。
与 Fable 5、Opus 5、GPT-5.6 Sol 等模型使用完全相同的题集和参数,报告每个分项及置信区间。
将结果仅用于“日常推理/陷阱题”能力判断,并与 Agent、编码和知识工作基准分开呈现。
Claude Fable 5.1