Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
官方Gemini 3.6 Flash

Gemini 3.6 Flash:Google 官方发布性能与 Agent 安全说明

原始来源

Google Blog

作者Tulsee Doshi

原文日期2026-07-21

Tabbit 整理2026-08-19

查看原文

一句话结论

Google 将 Gemini 3.6 Flash 定位为面向大规模 Agent 的 workhorse:相较 3.5 Flash 输出 token 减少 17%,DeepSWE、MLE-Bench、OSWorld-Verified 和 GDPval-AA v2 均有提升,并以 $1.50/$7.50 的输入/输出价格换取更高的吞吐经济性。

适用场景

  • 适合的任务:编码 Agent、多步知识工作、计算机使用、多模态文档/图表分析,以及需要降低每个 Agent 任务 token 消耗的生产流量。

  • 不适合的任务:把官方对比当成独立复现、对安全敏感工具开放无监督权限,或只根据单一 benchmark 选择模型。

  • 适用的模型版本:Gemini 3.6 Flash,2026-07-21 发布。

  • 适用的客户端、Agent 或 API:Gemini API、Google AI Studio、Android Studio、Google Antigravity、Gemini Enterprise 和 Gemini app。

  • 推荐的推理档位和参数:官方发布未给出一份完整可复制的 API 参数表;需结合模型卡和 Gemini 3 开发者指南设定 thinking 与工具边界。

测试环境

Google 博客引用 Artificial Analysis Index 与 Datacurve DeepSWE,并给出与 Gemini 3.5 Flash 的同口径对比;这是官方发布口径,不是 Google 在文章中公开的完整独立复现实验。文章还描述 computer use 为 Gemini API 与 Gemini Enterprise 的客户端工具。

输入/配置

  • 价格:输入 $1.50 / 1M tokens,输出 $7.50 / 1M tokens。

  • 多步 Agent:Google 声称 3.6 Flash 使用更少 reasoning steps 和 tool calls 完成工作流。

  • 安全:增强 CBRN 与 cyber offense misuse 的 Frontier Safety safeguards,并训练以减少 beneficial use 的不必要拒答。

  • 模态:文章定位为 coding、knowledge work 和 multimodal 模型;完整输入/输出限制以模型卡为准。

结果数据

  • Artificial Analysis Index:相较 Gemini 3.5 Flash,输出 token 使用量减少 17%。

  • DeepSWE:49% vs. 37%。

  • MLE-Bench:63.9% vs. 49.7%。

  • OSWorld-Verified:83.0% vs. 78.4%。

  • GDPval-AA v2:1421 vs. 1349。

  • Google 还称 3.6 Flash 在更少不必要代码编辑和更少 execution loops 下精度更高。

结论

官方证据支持“3.6 Flash 比 3.5 Flash 更省 token、Agent 工具循环更短、编码/计算机使用更强”的方向性判断;它最适合高频、多步、可验证的工作流。官方数字没有说明所有 benchmark 的完整 prompt、重复次数和独立复现状态,因此应与自己的代表性任务回归结合。

局限

  • 文章混合 Artificial Analysis、Datacurve 和 Google 自有结果,完整测试条件并未全部公开。

  • 官方发布强调相对 3.5 Flash 的提升,不等于在所有前沿模型或所有任务上领先。

  • 安全措施是官方声明;实际部署仍需按工具、权限、数据和行业风险做 red-team。

  • 价格与可用客户端会变化,生产接入需核对当前开发者文档和区域可用性。

复现步骤

  1. 固定 gemini-3.6-flash 与 gemini-3.5-flash,在同一 API 路径、工具集、输入数据和 reasoning 设置下运行。

  2. 选择编码、知识工作、OSWorld 风格 computer use 和多模态文档四类任务,每类记录成功率、tool calls、reasoning/output tokens、延迟和成本。

  3. 对相同任务运行足够重复次数,分别报告平均值、方差和失败类型,不把官方单个点估计当成自己的结果。

  4. 对有破坏性副作用的计算机使用任务设置人工确认和恢复点,并单独记录拒答/安全拦截。

来源摘录或观察(仅做合规短引)

Google 将 3.6 Flash 描述为 “our workhorse model”;其可验证含义应落在 token、工具调用、任务通过率和成本这四个指标上。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.6 Flash

在 Tabbit 中使用并对比模型

Gemini 3.6 Flash

相关测评

官方Google DeepMind2026-07-21

Gemini 3.6 Flash:Google DeepMind 模型卡的基准、输入能力与限制

媒体PromptsLove

Gemini 3.6 Flash:PromptsLove 在 OpenCode 中与 Kimi K3 的同配置实测

社区Reddit,r/googleantigravity2026-07-22

Gemini 3.6 Flash:Reddit 社区对验证诚实与监督成本的体验

Gemini 3.6 Flash

相关提示词

官方Google AI for Developers2026-07-30

Gemini 3.6 Flash:Google 官方 API 能力与 thinking 配置清单

媒体PromptsRush2026-07-25

Gemini 3.6 Flash:PromptsRush 的长上下文、多模态与 Agent 提示词