Google 将 Gemini 3.6 Flash 定位为面向大规模 Agent 的 workhorse:相较 3.5 Flash 输出 token 减少 17%,DeepSWE、MLE-Bench、OSWorld-Verified 和 GDPval-AA v2 均有提升,并以 $1.50/$7.50 的输入/输出价格换取更高的吞吐经济性。
适合的任务:编码 Agent、多步知识工作、计算机使用、多模态文档/图表分析,以及需要降低每个 Agent 任务 token 消耗的生产流量。
不适合的任务:把官方对比当成独立复现、对安全敏感工具开放无监督权限,或只根据单一 benchmark 选择模型。
适用的模型版本:Gemini 3.6 Flash,2026-07-21 发布。
适用的客户端、Agent 或 API:Gemini API、Google AI Studio、Android Studio、Google Antigravity、Gemini Enterprise 和 Gemini app。
推荐的推理档位和参数:官方发布未给出一份完整可复制的 API 参数表;需结合模型卡和 Gemini 3 开发者指南设定 thinking 与工具边界。
Google 博客引用 Artificial Analysis Index 与 Datacurve DeepSWE,并给出与 Gemini 3.5 Flash 的同口径对比;这是官方发布口径,不是 Google 在文章中公开的完整独立复现实验。文章还描述 computer use 为 Gemini API 与 Gemini Enterprise 的客户端工具。
价格:输入 $1.50 / 1M tokens,输出 $7.50 / 1M tokens。
多步 Agent:Google 声称 3.6 Flash 使用更少 reasoning steps 和 tool calls 完成工作流。
安全:增强 CBRN 与 cyber offense misuse 的 Frontier Safety safeguards,并训练以减少 beneficial use 的不必要拒答。
模态:文章定位为 coding、knowledge work 和 multimodal 模型;完整输入/输出限制以模型卡为准。
Artificial Analysis Index:相较 Gemini 3.5 Flash,输出 token 使用量减少 17%。
DeepSWE:49% vs. 37%。
MLE-Bench:63.9% vs. 49.7%。
OSWorld-Verified:83.0% vs. 78.4%。
GDPval-AA v2:1421 vs. 1349。
Google 还称 3.6 Flash 在更少不必要代码编辑和更少 execution loops 下精度更高。
官方证据支持“3.6 Flash 比 3.5 Flash 更省 token、Agent 工具循环更短、编码/计算机使用更强”的方向性判断;它最适合高频、多步、可验证的工作流。官方数字没有说明所有 benchmark 的完整 prompt、重复次数和独立复现状态,因此应与自己的代表性任务回归结合。
文章混合 Artificial Analysis、Datacurve 和 Google 自有结果,完整测试条件并未全部公开。
官方发布强调相对 3.5 Flash 的提升,不等于在所有前沿模型或所有任务上领先。
安全措施是官方声明;实际部署仍需按工具、权限、数据和行业风险做 red-team。
价格与可用客户端会变化,生产接入需核对当前开发者文档和区域可用性。
固定 gemini-3.6-flash 与 gemini-3.5-flash,在同一 API 路径、工具集、输入数据和 reasoning 设置下运行。
选择编码、知识工作、OSWorld 风格 computer use 和多模态文档四类任务,每类记录成功率、tool calls、reasoning/output tokens、延迟和成本。
对相同任务运行足够重复次数,分别报告平均值、方差和失败类型,不把官方单个点估计当成自己的结果。
对有破坏性副作用的计算机使用任务设置人工确认和恢复点,并单独记录拒答/安全拦截。
Google 将 3.6 Flash 描述为 “our workhorse model”;其可验证含义应落在 token、工具调用、任务通过率和成本这四个指标上。
Gemini 3.6 Flash