Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
官方Gemini 3.8 Flash

Gemini 3.8 Flash:Google 官方发布基准与复现边界

原始来源

Google Blog(The Keyword)

作者Tulsee Doshi、Raluca Ada Popa / Google DeepMind

原文日期2026-09-02

Tabbit 整理2026-09-08

查看原文

一句话结论

Google 在发布说明的内嵌对照表中,将 Gemini 3.8 Flash 与 Gemini 3.7 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Terra 放在同一表中比较。3.8 Flash 相比 3.7 Flash 在表内每个对应分数项都更高,但没有在所有项目上超过其他厂商模型;这些数字是 Google 发布的厂商评测结果,不是独立复测。

适用场景

  • 适合的任务:把官方表作为长程编码、Agent 终端、专业知识工作、法律/金融流程、文档与图表理解、生物信息学任务的版本迁移参考。

  • 不适合的任务:据此给出跨厂商绝对排名、承诺线上成功率,或把“未标注工具”推断成“无工具”。

  • 适用的模型版本:Google 发布说明中的 Gemini 3.8 Flash(2026-09-02 发布)。

  • 适用的客户端、Agent 或 API:发布说明提到 Google Antigravity、Gemini API / Google AI Studio、Android Studio、Stitch、Gemini Enterprise 及 Gemini app;具体可用性不由这张基准表保证。

测试环境

  • 官方表格模型列:Gemini 3.8 Flash、Gemini 3.7 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Terra。

  • 价格口径:输入价格注明“$/1M tokens, no caching”;3.8/3.7 的 $0.75 输入、$3.75 输出为 introductory price,表下注明 2026-12-31 后恢复为 $1.50 / $7.50。

  • 工具标注:原图明确写出 CharXiv Reasoning 为 No tools,OSWorld-2.0 为 Partial score 且 batch tool enabled;其余项目在表中未标注工具状态,不能补推。

  • 页面说明:正文称 3.8 Flash 在复杂任务上会执行更多 reasoning steps 并迭代调用工具,较高 effort 可能使用更多 tokens;表格未给出每项的 effort、工具 harness 或采样配置。

原始数据表

以下按 Google 页面内嵌原图逐项转录;百分比保留 %,GDPval-AA v2 保留 Elo,不把原图的颜色/粗体高亮当作统计显著性。

价格(原图)

项目Gemini 3.8 FlashGemini 3.7 FlashClaude Opus 5Claude Sonnet 5GPT-5.6 SolGPT-5.6 Terra
输入价格($/1M tokens,无缓存)$0.75($1.50 regular)$0.75($1.50 regular)$5.00$2.00$4.00$2.00
输出价格($/1M tokens)$3.75($7.50 regular)$3.75($7.50 regular)$25.00$10.00$20.00$12.00

基准分数(原图)

基准任务/指标工具标注Gemini 3.8 FlashGemini 3.7 FlashClaude Opus 5Claude Sonnet 5GPT-5.6 SolGPT-5.6 Terra
DeepSWE v1.1Long-horizon software engineering未标注73.7%65.3%74.0%53.8%72.7%69.6%
GDPval-AA v2Knowledge work;Elo未标注154514821824158417101528
Vals Finance Agent v2Financial analyst tasks未标注61.4%59.0%58.6%53.9%53.8%54.4%
Harvey's Legal Agent BenchmarkComplex legal workflows;All pass rate未标注10.0%8.8%6.7%5.0%2.5%0.8%
Terminal-bench 2.1Agentic terminal coding未标注89.4%85.8%89.1%80.4%88.8%87.4%
Terminal-bench 4.0General agent capabilities未标注19.1%11.2%51.8%12.4%37.3%23.6%
GDP.PDFExpert PDF document comprehension;All pass rate未标注35.0%34.0%37.0%28.0%40.0%29.0%
CharXiv ReasoningInformation synthesis from complex chartsNo tools86.2%84.5%83.7%70.1%85.8%85.9%
LVBenchLong video understanding未标注;3.8 为 agentic/static 两档87.8%(agentic);87.1%(static)85.4%75.4%68.5%82.1%78.9%
HLE-VerifiedMultidisciplinary expert reasoning未标注54.9%53.6%54.4%31.0%54.5%51.1%
OSWorld-2.0Agentic computer use;Partial scorebatch tool enabled59.0%50.6%75.4%42.6%62.6%50.2%
BioMysteryBench(Human Solvable)Bioinformatics research workflows未标注88.8%87.1%90.1%87.5%79.5%83.8%
BioMysteryBench(Human Difficult)Bioinformatics research workflows未标注56.5%43.5%49.4%34.1%44.7%49.4%
LABBench2Biology real-world research tasks未标注86.2%82.1%84.2%80.1%82.1%81.2%

结果解读

  • 3.8 对 3.7 的版本差异:DeepSWE v1.1 为 73.7% vs 65.3%,GDPval-AA v2 为 1545 vs 1482,Vals Finance Agent v2 为 61.4% vs 59.0%,Terminal-bench 2.1 为 89.4% vs 85.8%,OSWorld-2.0 为 59.0% vs 50.6%;BioMysteryBench 的 Human Difficult 子项差距最大,为 56.5% vs 43.5%。

  • 并非全面领先:Claude Opus 5 在 DeepSWE v1.1(74.0%)、GDPval-AA v2(1824)、Terminal-bench 4.0(51.8%)、GDP.PDF(37.0%)及 BioMysteryBench Human Solvable(90.1%)更高;GPT-5.6 Sol 在 GDP.PDF(40.0%)更高;Claude Opus 5 在 OSWorld-2.0(75.4%)更高。

  • 3.8 在表中更高的项目:Vals Finance Agent v2、Harvey's Legal Agent Benchmark、Terminal-bench 2.1、CharXiv Reasoning、LVBench(两种 3.8 数值均高于对照)、HLE-Verified、BioMysteryBench Human Difficult、LABBench2。这里的“更高”只表示该表点估计,不代表跨任务可合并为一个总分。

厂商自报边界

  • 这是 Google 在发布说明中公开的比较表;即使基准名称属于外部项目,页面没有公开每个项目的完整 prompt、数据 split/版本、样本量、重复次数、随机种子、置信区间、模型快照、thinking/effort 设置或评分脚本。

  • 工具条件只在原图明确标出的两处可核验:CharXiv 为 No tools,OSWorld-2.0 为 batch tool enabled。其他行的工具、Agent scaffold、人工介入和失败重试均未知,不能把分数归因于裸模型。

  • 正文明确说复杂任务中 3.8 Flash 会执行额外推理步骤并迭代调用工具,较高 effort 可能消耗更多 tokens;这意味着“质量提升”和“计算/工具预算增加”可能同时存在。

  • 价格也是发布时的促销口径:表中的 $0.75 / $3.75 不是永久价格;成本比较应记录价格生效日期、缓存状态、输入/输出 tokens 和工具调用成本。

  • Google 将 3.8 Flash 定位为“most intelligent workhorse model”属于厂商定位语句;它不能替代特定业务任务上的验收,也不能由表中有限项目外推到所有任务。

复现步骤

  1. 记录实际使用的 Gemini 3.8 Flash 模型字符串、快照/日期、客户端、effort、上下文、输出上限和价格版本;不要只记录“Gemini Flash”。

  2. 按表格逐项固定同一数据版本、输入、评分规则和重复次数;CharXiv 复现时保持无工具,OSWorld-2.0 单独记录 batch tool 是否启用。

  3. 对 DeepSWE、终端、法律/金融 Agent、文档、视频、电脑使用和生物信息学任务分别记录成功率、分数、输入/输出 tokens、工具调用、延迟、成本及失败类型。

  4. 将 3.8 与 3.7 的差值、其他模型的差值和置信区间分开报告;不要把不同基准或不同工具条件平均成一个总分。

  5. 若无法获得 Google 未公开的 harness、split 或参数,标注“未复现该官方条件”,并把本文表格仅作为发布时的厂商自报基线。

来源摘录或观察(仅做合规短引)

Google 把 Gemini 3.8 Flash 称为 “most intelligent workhorse model”;这是产品定位,而不是独立测评结论。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.8 Flash

在 Tabbit 中使用并对比模型

Gemini 3.8 Flash

相关测评

媒体Artificial Analysis(官网模型页、方法论与发布文章;X 官方账号用于发现并核对发布帖)2026-09-02

Gemini 3.8 Flash:Artificial Analysis 智能、速度、价格与延迟

媒体AI IQ(AIIQ,Liberated Software LLC)2026-09-02

Gemini 3.8 Flash:AI IQ 能力基准与任务边界

媒体Vals AI2026-09-05

Vals AI Finance Agent v2:Gemini 3.8 Flash 的专业金融 Agent 基准

媒体SimpleBench 官方榜单与项目

SimpleBench:Gemini 3.8 Flash 的日常推理与语言陷阱基准

Gemini 3.8 Flash

相关提示词

官方Google AI for Developers / Google DeepMind2026-09-02

Gemini 3.8 Flash:Google 官方模型参数与 API 配置

官方Google AI for Developers2026-06-10

Gemini 3.8 Flash:Google 官方结构化提示与 Agent 工作流

官方Google AI for Developers

Gemini 3.8 Flash:Google 官方函数调用配置与工具工作流

官方Google AI for Developers2026-09-02

Gemini 3.8 Flash:Google 官方结构化输出配置