Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Gemini 3.8 Flash

Gemini 3.8 Flash:Artificial Analysis 智能、速度、价格与延迟

原始来源

Artificial Analysis(官网模型页、方法论与发布文章;X 官方账号用于发现并核对发布帖)

作者Artificial Analysis

原文日期2026-09-02

Tabbit 整理2026-09-08

查看原文

一句话结论

Gemini 3.8 Flash 的速度/延迟随推理档位明显变化:Artificial Analysis 当前 v4.3 页面记录 high 为 285.9 tok/s、首个答案 token 延迟 17.36 秒,medium 为 246.3 tok/s、8.29 秒,low 为 265.3 tok/s、0.78 秒;但 Intelligence Index 也从 2026-09-02 发布时的 v4.2 口径 59/57/52,变为当前 v4.3 快照的 41/40/34。两组数字不是同一版测试,不能直接比较成“模型退步”。

适用场景

  • 适合的任务:需要长上下文、多模态输入、工具调用和较快答案生成的编码、Agent、文档与企业工作流。

  • 不适合的任务:把 high 档当作低延迟聊天默认值,或把单次 tok/s 当作完整任务耗时;high 的 TTFT 与推理 token 开销明显更高。

  • 适用的模型版本:gemini-3.8-flash;本文同时记录 Artificial Analysis 的 high、medium、low 推理页,不把三档当成三个 API 模型。

  • 适用的客户端、Agent 或 API:Artificial Analysis 测试所依据的 Google API;Google 官方页列出 Gemini API、Google AI Studio、Gemini App、Google Antigravity 等可用入口。

  • 推荐的推理档位和参数:延迟敏感任务先测 low;质量与延迟折中测 medium;复杂长程 Agent 再测 high。Google 官方文档列出 low、medium、high,不支持 minimal。

测试环境、版本与测量时点

  • v4.2 发布快照:Artificial Analysis 于 2026-09-02 发布的 Gemini 3.8 Flash 文章与 X 帖使用 Intelligence Index v4.2;high/medium/low 分别为 59/57/52。该文章还报告 high 的约 300 tok/s、2.5 分钟/任务,low 为约 0.8 分钟/任务。

  • v4.3 当前快照:2026-09-08 打开 Artificial Analysis 模型页时,页面已标注 Intelligence Index v4.3;该版本纳入 AA-Briefcase、GDPval-AA v2、AutomationBench-AA、Terminal-Bench v4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1 共 10 项评估。

  • 性能测量时点:Artificial Analysis 性能方法论规定,常规 1k、10k 与视觉工作负载每日测试 8 次,网页数值以过去 72 小时的中位数(P50)表示;因此下表是 2026-09-08 页面快照,不是固定永久值。

  • 服务与参数:性能主测试服务器位于 Google Cloud us-central1-a;推理模型默认温度为 0.6,性能基准的 token 计数使用 o200k_base。Intelligence Index 成本则使用提供商 API 报告的 token 数。

  • 独立/自报边界:Intelligence Index、输出速度、TTFT、成本和任务 token 是 Artificial Analysis 的独立测量/计算;Google 的模型状态、模态、上下文和价格是厂商自报规格。Artificial Analysis 的“基于 Google API”不等于 Google 对其评测分数背书。

结果数据

Artificial Analysis v4.3 当前模型页

推理档位Intelligence Index输出速度TTFT(首个答案 token)单 Intelligence Index 任务成本API 价格(输入/输出,每 1M token)上下文窗口
high41285.9 tok/s17.36 s$1.24$0.75 / $3.751M
medium40246.3 tok/s8.29 s$0.93$0.75 / $3.751M
low34265.3 tok/s0.78 s未知(页面显示 N/A)$0.75 / $3.751M

以上速度、TTFT 与价格均来自各档 Artificial Analysis 模型页;页面说明速度与 TTFT 基于 Google API,价格可能因提供商而异。缓存命中折扣为 90%。high 页还显示 Intelligence Index 评测累计生成约 170M 输出 token,medium 约 95M;这是评测总量,不是单次请求上限。

Artificial Analysis v4.2 发布口径

推理档位Intelligence Index每任务成本速度/时间补充
high59$0.58约 300 tok/s;约 2.5 分钟/任务;平均输出约 48k token
medium57$0.41发布文章给出成本,不给出该档独立 TTFT
low52$0.24约 0.8 分钟/任务;平均输出约 14k token

v4.2 的成本是发布文章中的“每 Intelligence Index 任务”口径;发布文章称 high 相对 Gemini 3.7 Flash 的 $0.40 高约 40%,原因是平均输出 token 增加约 30% 且 Agent 评估回合增加。不能用 v4.2 的 $0.58 与 v4.3 页面 high 的 $1.24 做价格趋势判断,因为评估集合已从 v4.2 改为 v4.3。

官方规格交叉核对

项目Google 官方页面边界
API 模型 IDgemini-3.8-flash;稳定版API 文档字符串,不代表第三方平台同步更新
输入/输出输入文本、图片、视频、音频、PDF;输出文本模态能力规格,不是每个客户端 UI 的保证
Token 限制输入 1,048,576;输出 65,536额度上限,不是每次请求的建议值
推理档位low、medium、high;minimal 不支持具体质量、延迟和 token 消耗需实测
状态General availability / 稳定版地区、账户与第三方供应商可用性仍需单独确认

结论

  1. 先区分评测版本:9 月 2 日发布文章的 v4.2 分数是 high 59、medium 57、low 52;9 月 8 日当前模型页的 v4.3 分数是 41、40、34。版本、评估集合和页面时点不同,不能把两组数字合并成一条排名。

  2. low 是延迟优先档:当前页面 TTFT 仅 0.78 秒,输出速度 265.3 tok/s;但 Intelligence Index 为 34,且 v4.3 页面尚未提供其单任务成本。

  3. high 是质量/任务能力优先档:v4.3 分数 41、速度 285.9 tok/s,但 TTFT 17.36 秒;对交互式产品应把等待推理时间纳入体验预算。

  4. 价格不能只看每百万 token:当前输入/输出价格相同为 $0.75/$3.75、缓存命中折扣 90%,但单任务成本还由输入、缓存、推理、答案 token 与评估回合共同决定。

  5. 1M 上下文是能力边界而非质量保证:Google 与 Artificial Analysis 都列出 1M token;真正的长文档工作流仍需按输入位置、检索召回、引用正确率和端到端延迟做专项测试。

局限

  • Artificial Analysis 当前页面使用 v4.3,发布文章使用 v4.2;两版评估集合不同,不能直接计算“分数下降”或跨版排名变化。

  • 性能值是过去 72 小时的 P50;TTFT 受服务器位置、网络和提供商排队影响,us-central1-a 的结果不一定代表中国大陆或其他地区。

  • Artificial Analysis 的输出速度在推理模型上可能按答案 chunk 的后 80% 计算,且性能 benchmark 与 Intelligence Index 使用不同 token 计数口径;价格比较存在 tokenizer 效率限制。

  • v4.3 low 页面单任务成本显示 N/A;不能用 v4.2 的 $0.24 或 high/medium 成本推算 low 的当前值。

  • AA-Briefcase、GDPval-AA v2 等评估包含私有测试集或内部评分流程;平台公开方法论提高了可复核性,但不等于第三方审计。

  • Google DeepMind 页面报告的 DeepSWE、Vals Finance Agent、Harvey Legal Agent 与 HLE-Verified 等结果属于 Google 发布方材料,本文未将其与 Artificial Analysis 分数混为独立测量。

复现步骤

  1. 固定 API 模型 ID gemini-3.8-flash,分别运行 low、medium、high,记录首个 reasoning token、首个答案 token、完整响应时间、输入/输出/推理 token 和失败重试。

  2. 对同一批编码、工具调用、PDF/长文档和多模态任务,分别计算 TTFT P50/P95、输出 tok/s、任务完成率、每完成任务成本和人工接管率。

  3. 在至少两个地区或提供商重复性能测量,报告网络位置、账号类型、请求并发和 API 版本;不要把 Artificial Analysis 的 Google API 结果外推给其他供应商。

  4. 保存评测集合版本(v4.2 或 v4.3)、页面采集时间和价格快照;模型或 Artificial Analysis 方法更新后重新跑同一任务集。

  5. 对 100k、500k 和接近 1M token 的上下文分别测试召回、引用正确率、答案 token、TTFT 与端到端时延,避免把“支持 1M”写成“1M 内质量恒定”。

原始证据与数据

  • Artificial Analysis 当前 high 模型页记录:v4.3 Intelligence Index 41、285.9 tok/s、TTFT 17.36s、$1.24/任务、输入/输出 $0.75/$3.75、缓存折扣 90%、1M 上下文。

  • Artificial Analysis 当前 medium/low 模型页记录:medium 为 40、246.3 tok/s、TTFT 8.29s、$0.93/任务;low 为 34、265.3 tok/s、TTFT 0.78s、单任务成本 N/A;两档均为 1M 上下文。

  • Artificial Analysis 2026-09-02 发布文章与对应 X 帖记录 v4.2 high/medium/low 为 59/57/52,成本为 $0.58/$0.41/$0.24,并给出 high 约 300 tok/s、2.5 分钟/任务与 low 约 0.8 分钟/任务。

  • Artificial Analysis 性能方法论说明:常规指标取过去 72 小时 P50;TTFT 是请求发出至首 token,首个答案 token 延迟会计入推理时间;输出速度是收到首 chunk 后的 tokens/s。

  • Google AI Developers 模型页确认 gemini-3.8-flash、输入 1,048,576 token、输出 65,536 token、输入模态和 low/medium/high 推理档位;Google DeepMind 模型页确认 GA 状态、1M 输入与 64k 输出等产品规格。

来源摘录或观察(仅做合规短引)

Artificial Analysis 将 high 描述为“notably fast”,但其当前页面同时给出 17.36 秒 TTFT;这说明输出速度与用户感知的首答延迟是两个指标。Google 官方则把 3.8 Flash 定位为面向长周期软件工程、自主 Agent 和复杂企业工作流的 Flash 模型。两者都不能替代目标业务的同 harness 复测。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.8 Flash

在 Tabbit 中使用并对比模型

Gemini 3.8 Flash

相关测评

官方Google Blog(The Keyword)2026-09-02

Gemini 3.8 Flash:Google 官方发布基准与复现边界

媒体AI IQ(AIIQ,Liberated Software LLC)2026-09-02

Gemini 3.8 Flash:AI IQ 能力基准与任务边界

媒体Vals AI2026-09-05

Vals AI Finance Agent v2:Gemini 3.8 Flash 的专业金融 Agent 基准

媒体SimpleBench 官方榜单与项目

SimpleBench:Gemini 3.8 Flash 的日常推理与语言陷阱基准

Gemini 3.8 Flash

相关提示词

官方Google AI for Developers / Google DeepMind2026-09-02

Gemini 3.8 Flash:Google 官方模型参数与 API 配置

官方Google AI for Developers2026-06-10

Gemini 3.8 Flash:Google 官方结构化提示与 Agent 工作流

官方Google AI for Developers

Gemini 3.8 Flash:Google 官方函数调用配置与工具工作流

官方Google AI for Developers2026-09-02

Gemini 3.8 Flash:Google 官方结构化输出配置