Google 在发布说明的内嵌对照表中,将 Gemini 3.8 Flash 与 Gemini 3.7 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Terra 放在同一表中比较。3.8 Flash 相比 3.7 Flash 在表内每个对应分数项都更高,但没有在所有项目上超过其他厂商模型;这些数字是 Google 发布的厂商评测结果,不是独立复测。
适合的任务:把官方表作为长程编码、Agent 终端、专业知识工作、法律/金融流程、文档与图表理解、生物信息学任务的版本迁移参考。
不适合的任务:据此给出跨厂商绝对排名、承诺线上成功率,或把“未标注工具”推断成“无工具”。
适用的模型版本:Google 发布说明中的 Gemini 3.8 Flash(2026-09-02 发布)。
适用的客户端、Agent 或 API:发布说明提到 Google Antigravity、Gemini API / Google AI Studio、Android Studio、Stitch、Gemini Enterprise 及 Gemini app;具体可用性不由这张基准表保证。
官方表格模型列:Gemini 3.8 Flash、Gemini 3.7 Flash、Claude Opus 5、Claude Sonnet 5、GPT-5.6 Sol、GPT-5.6 Terra。
价格口径:输入价格注明“$/1M tokens, no caching”;3.8/3.7 的 $0.75 输入、$3.75 输出为 introductory price,表下注明 2026-12-31 后恢复为 $1.50 / $7.50。
工具标注:原图明确写出 CharXiv Reasoning 为 No tools,OSWorld-2.0 为 Partial score 且 batch tool enabled;其余项目在表中未标注工具状态,不能补推。
页面说明:正文称 3.8 Flash 在复杂任务上会执行更多 reasoning steps 并迭代调用工具,较高 effort 可能使用更多 tokens;表格未给出每项的 effort、工具 harness 或采样配置。
以下按 Google 页面内嵌原图逐项转录;百分比保留 %,GDPval-AA v2 保留 Elo,不把原图的颜色/粗体高亮当作统计显著性。
| 项目 | Gemini 3.8 Flash | Gemini 3.7 Flash | Claude Opus 5 | Claude Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|---|
| 输入价格($/1M tokens,无缓存) | $0.75($1.50 regular) | $0.75($1.50 regular) | $5.00 | $2.00 | $4.00 | $2.00 |
| 输出价格($/1M tokens) | $3.75($7.50 regular) | $3.75($7.50 regular) | $25.00 | $10.00 | $20.00 | $12.00 |
| 基准 | 任务/指标 | 工具标注 | Gemini 3.8 Flash | Gemini 3.7 Flash | Claude Opus 5 | Claude Sonnet 5 | GPT-5.6 Sol | GPT-5.6 Terra |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1 | Long-horizon software engineering | 未标注 | 73.7% | 65.3% | 74.0% | 53.8% | 72.7% | 69.6% |
| GDPval-AA v2 | Knowledge work;Elo | 未标注 | 1545 | 1482 | 1824 | 1584 | 1710 | 1528 |
| Vals Finance Agent v2 | Financial analyst tasks | 未标注 | 61.4% | 59.0% | 58.6% | 53.9% | 53.8% | 54.4% |
| Harvey's Legal Agent Benchmark | Complex legal workflows;All pass rate | 未标注 | 10.0% | 8.8% | 6.7% | 5.0% | 2.5% | 0.8% |
| Terminal-bench 2.1 | Agentic terminal coding | 未标注 | 89.4% | 85.8% | 89.1% | 80.4% | 88.8% | 87.4% |
| Terminal-bench 4.0 | General agent capabilities | 未标注 | 19.1% | 11.2% | 51.8% | 12.4% | 37.3% | 23.6% |
| GDP.PDF | Expert PDF document comprehension;All pass rate | 未标注 | 35.0% | 34.0% | 37.0% | 28.0% | 40.0% | 29.0% |
| CharXiv Reasoning | Information synthesis from complex charts | No tools | 86.2% | 84.5% | 83.7% | 70.1% | 85.8% | 85.9% |
| LVBench | Long video understanding | 未标注;3.8 为 agentic/static 两档 | 87.8%(agentic);87.1%(static) | 85.4% | 75.4% | 68.5% | 82.1% | 78.9% |
| HLE-Verified | Multidisciplinary expert reasoning | 未标注 | 54.9% | 53.6% | 54.4% | 31.0% | 54.5% | 51.1% |
| OSWorld-2.0 | Agentic computer use;Partial score | batch tool enabled | 59.0% | 50.6% | 75.4% | 42.6% | 62.6% | 50.2% |
| BioMysteryBench(Human Solvable) | Bioinformatics research workflows | 未标注 | 88.8% | 87.1% | 90.1% | 87.5% | 79.5% | 83.8% |
| BioMysteryBench(Human Difficult) | Bioinformatics research workflows | 未标注 | 56.5% | 43.5% | 49.4% | 34.1% | 44.7% | 49.4% |
| LABBench2 | Biology real-world research tasks | 未标注 | 86.2% | 82.1% | 84.2% | 80.1% | 82.1% | 81.2% |
3.8 对 3.7 的版本差异:DeepSWE v1.1 为 73.7% vs 65.3%,GDPval-AA v2 为 1545 vs 1482,Vals Finance Agent v2 为 61.4% vs 59.0%,Terminal-bench 2.1 为 89.4% vs 85.8%,OSWorld-2.0 为 59.0% vs 50.6%;BioMysteryBench 的 Human Difficult 子项差距最大,为 56.5% vs 43.5%。
并非全面领先:Claude Opus 5 在 DeepSWE v1.1(74.0%)、GDPval-AA v2(1824)、Terminal-bench 4.0(51.8%)、GDP.PDF(37.0%)及 BioMysteryBench Human Solvable(90.1%)更高;GPT-5.6 Sol 在 GDP.PDF(40.0%)更高;Claude Opus 5 在 OSWorld-2.0(75.4%)更高。
3.8 在表中更高的项目:Vals Finance Agent v2、Harvey's Legal Agent Benchmark、Terminal-bench 2.1、CharXiv Reasoning、LVBench(两种 3.8 数值均高于对照)、HLE-Verified、BioMysteryBench Human Difficult、LABBench2。这里的“更高”只表示该表点估计,不代表跨任务可合并为一个总分。
这是 Google 在发布说明中公开的比较表;即使基准名称属于外部项目,页面没有公开每个项目的完整 prompt、数据 split/版本、样本量、重复次数、随机种子、置信区间、模型快照、thinking/effort 设置或评分脚本。
工具条件只在原图明确标出的两处可核验:CharXiv 为 No tools,OSWorld-2.0 为 batch tool enabled。其他行的工具、Agent scaffold、人工介入和失败重试均未知,不能把分数归因于裸模型。
正文明确说复杂任务中 3.8 Flash 会执行额外推理步骤并迭代调用工具,较高 effort 可能消耗更多 tokens;这意味着“质量提升”和“计算/工具预算增加”可能同时存在。
价格也是发布时的促销口径:表中的 $0.75 / $3.75 不是永久价格;成本比较应记录价格生效日期、缓存状态、输入/输出 tokens 和工具调用成本。
Google 将 3.8 Flash 定位为“most intelligent workhorse model”属于厂商定位语句;它不能替代特定业务任务上的验收,也不能由表中有限项目外推到所有任务。
记录实际使用的 Gemini 3.8 Flash 模型字符串、快照/日期、客户端、effort、上下文、输出上限和价格版本;不要只记录“Gemini Flash”。
按表格逐项固定同一数据版本、输入、评分规则和重复次数;CharXiv 复现时保持无工具,OSWorld-2.0 单独记录 batch tool 是否启用。
对 DeepSWE、终端、法律/金融 Agent、文档、视频、电脑使用和生物信息学任务分别记录成功率、分数、输入/输出 tokens、工具调用、延迟、成本及失败类型。
将 3.8 与 3.7 的差值、其他模型的差值和置信区间分开报告;不要把不同基准或不同工具条件平均成一个总分。
若无法获得 Google 未公开的 harness、split 或参数,标注“未复现该官方条件”,并把本文表格仅作为发布时的厂商自报基线。
Google 把 Gemini 3.8 Flash 称为 “most intelligent workhorse model”;这是产品定位,而不是独立测评结论。
Gemini 3.8 Flash