SimpleBench 当前榜单把 Gemini 3.8 Flash 列为 第 4 名、82.4%(AVG@5);它低于最高人类分数 95.4% 和 Claude Fable 5.1 的 86.6%,也低于人类基线 83.7%(低 1.3 个百分点)。这说明它在该基准的日常物理、时间、社会常识和语言陷阱题上接近但尚未达到该样本的人类平均水平,不能外推为通用推理能力排名。
适合观察的任务:英文六选一题中的空间/时间推理、社会智能,以及带有措辞误导或文字游戏的现实世界判断。
不适合直接推断的任务:中文理解、视觉推理、代码、长程 Agent、专业知识或生产系统成功率。
适用的模型版本:官方榜单明确标注的 Gemini 3.8 Flash;不要延伸到 Gemini 3.8 Flash Cyber 或其他 provider、客户端和推理档位。
适用的测试对象:SimpleBench 的标准文本多选题;不是 Gemini App 或 API 的端到端体验测评。
题量:技术报告定义为 204 道独立题,每题 6 个选项;官网概括为 200+ 题。题目由团队手工编写,并经内部成员和 4 名博士级专家审核。
覆盖结构:约 40% 空间推理、10% 时间推理、25% 社会智能、25% 语言对抗/陷阱题;类别可以交叉。
AVG@5:每个模型进行 5 次独立运行;先计算每次运行的答对比例,再取 5 次准确率的算术平均:
AVG@5 = (第 1 次准确率 + … + 第 5 次准确率) / 5
另有 MAJ@5,同一道题在 5 次中至少答对 3 次才算正确;当前官网榜单的列名是 Score (AVG@5),并未公开 Gemini 3.8 Flash 的单次分数、MAJ@5 或误差区间。
采样设置:官网设置面板显示 temperature 0.7、top-p 0.95(o1 系列除外)。历史技术报告还说明所有模型使用统一指令,标准提示要求输出 Final Answer: A-F;官网脚注提到会尝试针对基准优化的 engineered prompt,但当前 Gemini 3.8 Flash 条目未披露具体提示词。
评分:从模型输出中提取 Final Answer: X,与标准答案字母比较;解析失败会报错。官方代码的 num_responses > 1 才启用多数投票,默认一次响应,因此代码本身不能直接产生官网 AVG@5。
榜单数据文件将该条目标记为 dateAdded: 2026-09-03,组织为 Google:
| 榜单条目 | 分数(AVG@5) | 说明 |
|---|---|---|
| Claude Fable 5.1 | 86.6% | 第 1 名 |
| GPT-6 Astra Pro | 86.5% | 第 2 名 |
| GPT-6 Astra | 83.6% | 第 3 名 |
| Gemini 3.8 Flash | 82.4% | 第 4 名;Google |
| Human Baseline | 83.7% | 非模型对照,Gemini 低 1.3 个百分点 |
| Gemini 3.1 Pro Preview | 79.6% | 第 8 名;Gemini 3.8 Flash 高 2.8 个百分点 |
| Gemini 3.5 Flash | 76.7% | 第 10 名;Gemini 3.8 Flash 高 5.7 个百分点 |
| Highest Human Score | 95.4% | 榜单人类对照 |
榜单只给出点估计和相对排序;相邻模型并不等于同一时刻、同一 provider 或同一完整运行配置,不能把名次差距当作统计显著性。
样本:9 名母语为英语、具备至少高中数学水平的参与者。
分配方式:每人随机完成 25 道题,合计覆盖全部 204 道题至少一次;不是每人完整作答 204 题。
结果:9 人分数取平均得到 83.7% Human Baseline;官网当前榜单另列 95.4% Highest Human Score。
测试说明:参与者被要求每题约 3 分钟,可用纸笔,并被提醒题目可能包含文字游戏、空间变化和社会常识陷阱。
公开题不足以重算榜单:当前公开 simple_bench_public.json 经官方页面打开并解析后只有 question_id 1–10 共 10 题,其余题目保持私有;不能用 10 题结果声称复现 82.4%。
官方代码不能直接复现该模型条目:当前 GitHub 项目的模型映射仍是旧模型列表,没有 Gemini 3.8 Flash;run_benchmark.py 默认 num_responses=1,且项目当前提交记录为 2024 年,晚于该条目的 2026-09-03 榜单日期。
运行条件不完整:榜单没有公布 Gemini 3.8 Flash 的精确 API 模型 ID/快照、provider、完整提示词、五次原始输出、单次得分、重试和失败处理日志、token 或置信区间。因此可以核验 82.4% 这一官方榜单点估计,不能核验其每一步运行。
人类基线代表性有限:样本只有 9 人,没有控制 IQ/一般推理能力;自愿参与、英文熟练度、答题时间和疲劳都可能影响 83.7%。该基线不是人口统计意义上的人类平均值。
基准范围有限:题目为英文、手工设计的六选一文本题,重点是“最现实”的日常判断和陷阱识别;它不覆盖开放式回答、中文语境、工具使用或真实世界执行。
提示词可能影响名次:官方报告显示额外提醒陷阱、现实物理和过度自信的 engineered prompt 能明显改变旧模型成绩;当前条目没有公开 Gemini 3.8 Flash 是否及如何使用该提示,因此不应把 82.4% 当作裸模型固有能力。
固定 SimpleBench 版本、204 题完整私有集、英文原题、标准答案、Gemini 3.8 Flash 的精确模型 ID/快照和 provider;没有私有集时只报告公开 10 题实验。
记录实际系统提示、temperature 0.7、top-p 0.95、max tokens、重试/解析失败处理及每次 API 输出;不要用当前旧版模型映射冒充 3.8 Flash。
对完整题集进行 5 次相互独立运行,分别计算 5 次准确率、AVG@5 和 MAJ@5;同时报告每次分数和缺失/失败答案数量。
若做模型对照,固定同一题集、提示、采样参数和运行次数;若使用 engineered prompt,单独命名实验,不与标准榜单口径混合。
将本地结果标记为“独立复测”,不要把它与官网 82.4% 直接合并;官网只公开了榜单点估计,原始 Gemini 3.8 Flash 运行条件无法完全复原。
SimpleBench 官方主页榜单:https://simple-bench.com/。页面列出 Gemini 3.8 Flash 为第 4 名、82.4%,列标题为 Score (AVG@5),并列出人类基线 83.7%、最高人类分数 95.4% 及 temperature/top-p 设置。
SimpleBench 官方技术报告(项目历史提交中的 PDF):https://github.com/simple-bench/SimpleBench/blob/96fa7ada8cf046fb5332a37122f397754b128d7b/SimpleBench.pdf。报告定义 204 题、五次独立运行的 AVG@5/MAJ@5、人类样本与局限。
SimpleBench 官方公开数据:https://raw.githubusercontent.com/simple-bench/SimpleBench/main/simple_bench_public.json。当前文件包含 10 道公开题,question_id 为 1–10。
SimpleBench 官方复现代码:https://github.com/simple-bench/SimpleBench/blob/main/run_benchmark.py、https://github.com/simple-bench/SimpleBench/blob/main/weave_utils/scorers.py。代码展示答案提取、多选评分和多数投票实现,但没有 Gemini 3.8 Flash 的模型映射。
SimpleBench 将自己概括为“Where Everyday Human Reasoning Still Surpasses Frontier Models”。这准确限定了它测量的是一组英文日常推理与语言陷阱题,不是对模型全部能力的总评。
Gemini 3.8 Flash