Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Gemini 3.8 Flash

Gemini 3.8 Flash:AI IQ 能力基准与任务边界

原始来源

AI IQ(AIIQ,Liberated Software LLC)

作者AI IQ

原文日期2026-09-02

Tabbit 整理2026-09-08

查看原文

一句话结论

AIIQ 当前模型页给 Gemini 3.8 Flash AI IQ 125、排名 #14/131,并列出 8 个源基准分数;其中学术推理覆盖 5/6、程序推理仅 1/6、可靠性 2/7,而抽象、数学和计算机使用分别是 0/3、0/5、0/6。因此,这个页面支持“在少数公开基准上表现强”的判断,不支持把综合 IQ 或缺失维度的估算当成完整能力实测。

适用场景

  • 适合观察的任务:长文档抽取/综合/推理、专家学术问答、多模态图表与图像理解、科学研究代码,以及隔离容器中的终端开发与系统任务。

  • 不适合直接推断的任务:浏览器或桌面自动化、完整软件工程仓库修复、通用视觉能力、低延迟体验或生产级可靠性;模型页的 Computer Use 为 0/6,没有该维度的源基准覆盖。

  • 适用的模型版本:AIIQ 页面中的 exact 型号 Gemini 3.8 Flash;不要延伸到 Gemini 3.7 Flash、Gemini 3.8 Flash 的其他未标注配置或供应商路由。

  • 适用的客户端、Agent 或 API:AIIQ 的模型与基准展示页;页面没有公开 Gemini API 的具体 system prompt、采样参数或完整 Agent harness。

  • 推荐参数:AIIQ 未给出可据此复现的 temperature、推理档位、停止条件或重试配置;复测时应自行固定并报告这些变量。

测试环境

  • AIIQ 将 6 个维度等权组织为 Abstract、Math、Academic、Programmatic、Computer Use、Reliability;模型页的综合 IQ 是这 6 个维度的展示值。

  • AIIQ 方法论称 Artificial Analysis Intelligence Index 是主要聚合来源,提供 HLE、GPQA Diamond、SciCode、Terminal-Bench 2.1、CritPt、MMMU-Pro、AA Omniscience 与 AA Long Context Reasoning 等分数;Terminal-Bench 页面还列出 Vals.ai 作为来源/回退来源。

  • 基准页面的成本效率图会展开同一模型的多推理档位配置,但分数条保留每模型一个 canonical row。因此页面中的模型分数不能被解释成一次公开、统一 harness 的单次运行。

  • AIIQ 页面同时列出上下文窗口 1,048,576 tokens、输入/输出价格 $0.75/$3.75 每百万 token、约 305 tokens/s 和典型响应时间 15 秒;这些是页面资料或派生指标,不是本文复现测量。

输入/配置

  • 模型资料:AIIQ 将 Gemini 3.8 Flash 标为 Google、Proprietary;模型页 FAQ 称公开发布时间为 2026-09-02。

  • 综合计算:每个原始分数 s 先按该基准的 IQ 70、85、100、115、130、145、160 期望分数阶梯做分段线性插值 f_b(s),再对维度内基准取平均,最后对 6 个维度取等权平均:

    $$\mathrm{IQ}=\frac{1}{6}\sum_{d=1}^{6}\mathrm{IQ}_d$$

  • 缺失值规则:方法论明确说缺失基准会在 scoring pipeline 内做保守插补;因此 0/6 等 coverage 是“没有源基准覆盖”,不是得分为零,也不是直接测量结果。

  • 页面原始资料边界:未见模型专属原始题目、逐题输出、随机种子、完整调用日志、采样配置或独立复跑报告;可复核范围是页面列出的分数、来源标注、任务语义和计算规则。

结果数据

模型页汇总

项目AIIQ 页面值解释边界
Composite AI IQ1256 个维度的派生综合值,不是原始 benchmark 分数
IQ 排名#14 / 131采集时点的动态排行榜位置
Abstract Reasoning103(0/3)未列出 ARC 源基准覆盖,维度值含缺失处理
Mathematical Reasoning126(0/5)未列出数学源基准覆盖,不能当作直接数学测评
Academic Reasoning141(5/6)8 个已列结果中学术类覆盖最充分
Programmatic Reasoning132(1/6)主要由 Terminal-Bench 2.1 的单项覆盖支持
Computer Use124(0/6)无该维度源基准覆盖,页面值为派生估算
Reliability122(2/7)由 AA Omniscience 与 AA Long Context Reasoning 等可靠性信号覆盖

Gemini 3.8 Flash 的源基准读数

基准分数AIIQ 页面给出的任务边界维度
AA Long Context Reasoning8110K–100K token 长文档中的抽取、连接与推理;页面列举学术论文、公司财报、政府咨询、法律文件、行业报告、营销材料和调查Reliability
AA Omniscience29.55Artificial Analysis 的事实可靠性指数;正确答案加分、幻觉扣分,拒答不扣分;0 表示正确与错误相抵Reliability
CritPt18.286原创 critical-point analysis 研究物理问题,按原始 source points 计分;AIIQ 标为低可博弈性Academic
GPQA Diamond95.253198 道公开的四选一博士级科学题;随机基线 25%,公开题集使高分段存在饱和与记忆风险Academic
Humanity's Last Exam47.8223,000 道专家贡献题,创建时筛除已有模型可回答的题;页面标注 76% exact-match、低可博弈性Academic
MMMU-Pro85.607覆盖文字、示意图、图表和图片的多模态学术推理Academic
SciCode53.588以代码实现科学研究问题;要求识别科学概念、回忆领域事实、推导数值方法/模拟并转化为计算Academic
Terminal-Bench 2.187.6489 个隔离 Docker 容器 shell 任务,覆盖实用系统管理与开发;页面以 pass@1 口径展示Programmatic

基准页的图表说明大多标注 Data updated Sep 7, 2026;Terminal-Bench 2.1 页标注 Sep 6, 2026。这些日期与模型页采集日不同,不能把动态刷新视为同一批次实验。

结论

  1. AIIQ 的 8 个结果显示 Gemini 3.8 Flash 在 HLE、GPQA Diamond、MMMU-Pro、SciCode 与 Terminal-Bench 2.1 等来源行上有可量化读数;其中 Terminal-Bench 的 87.64% 只覆盖 89 个 Docker/shell 任务,不能外推到所有编码工作。

  2. 学术 IQ 141 的 coverage 为 5/6,属于相对有数据支撑的维度;综合 IQ 125 仍混合了大量缺失维度的保守插补,不能等同于“六项能力都测过”。

  3. 可靠性信号具有明确边界:AA Omniscience 不惩罚拒答,AA Long Context Reasoning 只覆盖 10K–100K token 长文档。它们不能替代生产场景中的事实核验、引用正确率或更长上下文回归。

  4. AIIQ 是聚合展示:主要分数来自 Artificial Analysis,Terminal-Bench 还使用 Vals.ai 回退/交叉来源;页面没有提供模型级的原始题目、完整 harness 或独立运行日志。适合做来源索引和任务边界速览,不适合当作 AIIQ 自测或统一竞赛成绩。

局限

  • AIIQ 的 Composite IQ、各维度 IQ 和排名是派生指标;基准 raw score 与 IQ 之间的校准阶梯、缺失值插补和等权平均会显著影响最终数字。

  • 0/3、0/5、0/6 等 coverage 不是失败分数,但对应维度的页面值仍可能显示出来;引用时必须同时写 coverage,不能只摘 IQ。

  • 不同基准的题型、规模、评分和可博弈性不同:GPQA Diamond 是公开四选一题,HLE 是专家题,MMMU-Pro 是多模态题,Terminal-Bench 是可执行 shell 任务,分数不可横向平均成一个“正确率”。

  • 页面展示的是第三方已发布/聚合的 source-backed 数据,未公开 Gemini 3.8 Flash 的独立复现实验配置、原始输出或置信区间;AIIQ 的来源标签不等于源平台或 Google 对所有推导值背书。

  • 价格、响应时间、吞吐和排行榜会随供应商、缓存、并发和数据刷新变化;页面的 $35.75 effective cost 是派生成本,不应与 $0.75/$3.75 的标价混为一谈。

复现步骤

  1. 固定 exact 模型版本、供应商/API 路由、推理档位、temperature、上下文上限、停止条件、重试策略和工具 schema,并将 HLE、GPQA、MMMU-Pro、SciCode、Terminal-Bench 分开记录。

  2. 对 HLE、GPQA、MMMU-Pro、SciCode 保存题集版本、模态输入、逐题输出和评分脚本;对 Terminal-Bench 保存 89 个容器任务、命令轨迹、最终状态和 pass@1 判定。

  3. 对长上下文任务分别测试 10K、50K、100K 及目标业务长度,记录抽取召回、引用正确率、幻觉率、拒答率和端到端延迟;不要把 AA Long Context Reasoning 的 81 直接当作 1M 上下文保证。

  4. 用同一版本的 Artificial Analysis/源平台读数重算原始分数,再按 AIIQ 方法论的分段线性阶梯计算维度与综合 IQ;分别报告 source-backed coverage 与插补项。

  5. 对 Computer Use、浏览、桌面和仓库级软件工程建立额外任务集;AIIQ 本页没有这些维度的源覆盖,不能用 124 的 Computer Use IQ 代替实测。

原始证据与数据

  • AIIQ Gemini 3.8 Flash 模型页直接列出 IQ 125、#14、1M context、$0.75/$3.75 价格、8 个 benchmark 分数以及 6 个维度的 coverage。

  • AIIQ 基准页的任务语义与图表说明分别给出:AA Long Context Reasoning 的长文档抽取/综合/推理、AA Omniscience 的事实可靠性指数、MMMU-Pro 的文字/图表/图片多模态推理、Terminal-Bench 2.1 的 89 个 Docker shell 任务。

  • AIIQ 方法论页给出 6 维等权公式、基准 IQ 阶梯的分段线性插值、缺失值保守插补规则,并将 Artificial Analysis Intelligence Index 说明为主要聚合来源。

  • AIIQ 基准页的 source labels 显示 Artificial Analysis;Terminal-Bench 2.1 还显示 Vals.ai Terminal-Bench 2.1,故本文将其标为聚合/回退来源,而非 AIIQ 独立重跑。

来源摘录或观察(仅做合规短引)

AIIQ 将模型页描述为 “source-backed benchmark results and derived ranking context”。这句话准确划定了证据边界:页面有源分数,也有由插值与插补产生的排名语境,二者不能混为一次完整模型测评。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.8 Flash

在 Tabbit 中使用并对比模型

Gemini 3.8 Flash

相关测评

官方Google Blog(The Keyword)2026-09-02

Gemini 3.8 Flash:Google 官方发布基准与复现边界

媒体Artificial Analysis(官网模型页、方法论与发布文章;X 官方账号用于发现并核对发布帖)2026-09-02

Gemini 3.8 Flash:Artificial Analysis 智能、速度、价格与延迟

媒体Vals AI2026-09-05

Vals AI Finance Agent v2:Gemini 3.8 Flash 的专业金融 Agent 基准

媒体SimpleBench 官方榜单与项目

SimpleBench:Gemini 3.8 Flash 的日常推理与语言陷阱基准

Gemini 3.8 Flash

相关提示词

官方Google AI for Developers / Google DeepMind2026-09-02

Gemini 3.8 Flash:Google 官方模型参数与 API 配置

官方Google AI for Developers2026-06-10

Gemini 3.8 Flash:Google 官方结构化提示与 Agent 工作流

官方Google AI for Developers

Gemini 3.8 Flash:Google 官方函数调用配置与工具工作流

官方Google AI for Developers2026-09-02

Gemini 3.8 Flash:Google 官方结构化输出配置