Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Gemini 3.6 Flash · 官方来源 · 厂商自报

Gemini 3.6 Flash:Google 官方发布性能与 Agent 安全说明

Google 将 Gemini 3.6 Flash 定位为大规模 Agent workhorse,并报告相较 3.5 输出 token 减少 17%、多项任务领先及 $1.50/$7.50 价格。

官方来源厂商自报编辑日期 2026-09-20

测试条件速查

来源具体观察
2026-07-21 Google 发布;比较 Gemini 3.6 Flash 与 3.5 Flash,包含 token、DeepSWE、MLE-Bench、OSWorld-Verified、GDPval-AA v2 与价格。
已公布条件
这些是 Google 官方测评和价格口径,未公开每个任务的完整 prompt、随机种子和用户负载。

关键数据与适用场景

一句话结论

Google 将 Gemini 3.6 Flash 定位为面向大规模 Agent 的 workhorse:相较 3.5 Flash 输出 token 减少 17%,DeepSWE、MLE-Bench、OSWorld-Verified 和 GDPval-AA v2 均有提升,并以 $1.50/$7.50 的输入/输出价格换取更高的吞吐经济性。

适用场景

  • 适合的任务:编码 Agent、多步知识工作、计算机使用、多模态文档/图表分析,以及需要降低每个 Agent 任务 token 消耗的生产流量。

  • 不适合的任务:把官方对比当成独立复现、对安全敏感工具开放无监督权限,或只根据单一 benchmark 选择模型。

  • 适用的模型版本:Gemini 3.6 Flash,2026-07-21 发布。

  • 适用的客户端、Agent 或 API:Gemini API、Google AI Studio、Android Studio、Google Antigravity、Gemini Enterprise 和 Gemini app。

  • 推荐的推理档位和参数:官方发布未给出一份完整可复制的 API 参数表;需结合模型卡和 Gemini 3 开发者指南设定 thinking 与工具边界。

测试环境

Google 博客引用 Artificial Analysis Index 与 Datacurve DeepSWE,并给出与 Gemini 3.5 Flash 的同口径对比;这是官方发布口径,不是 Google 在文章中公开的完整独立复现实验。文章还描述 computer use 为 Gemini API 与 Gemini Enterprise 的客户端工具。

输入/配置

  • 价格:输入 $1.50 / 1M tokens,输出 $7.50 / 1M tokens。

  • 多步 Agent:Google 声称 3.6 Flash 使用更少 reasoning steps 和 tool calls 完成工作流。

  • 安全:增强 CBRN 与 cyber offense misuse 的 Frontier Safety safeguards,并训练以减少 beneficial use 的不必要拒答。

  • 模态:文章定位为 coding、knowledge work 和 multimodal 模型;完整输入/输出限制以模型卡为准。

结果数据

  • Artificial Analysis Index:相较 Gemini 3.5 Flash,输出 token 使用量减少 17%。

  • DeepSWE:49% vs. 37%。

  • MLE-Bench:63.9% vs. 49.7%。

  • OSWorld-Verified:83.0% vs. 78.4%。

  • GDPval-AA v2:1421 vs. 1349。

  • Google 还称 3.6 Flash 在更少不必要代码编辑和更少 execution loops 下精度更高。

结论

官方证据支持“3.6 Flash 比 3.5 Flash 更省 token、Agent 工具循环更短、编码/计算机使用更强”的方向性判断;它最适合高频、多步、可验证的工作流。官方数字没有说明所有 benchmark 的完整 prompt、重复次数和独立复现状态,因此应与自己的代表性任务回归结合。

局限

  • 文章混合 Artificial Analysis、Datacurve 和 Google 自有结果,完整测试条件并未全部公开。

  • 官方发布强调相对 3.5 Flash 的提升,不等于在所有前沿模型或所有任务上领先。

  • 安全措施是官方声明;实际部署仍需按工具、权限、数据和行业风险做 red-team。

  • 价格与可用客户端会变化,生产接入需核对当前开发者文档和区域可用性。

复现步骤

  1. 固定 gemini-3.6-flash 与 gemini-3.5-flash,在同一 API 路径、工具集、输入数据和 reasoning 设置下运行。

  2. 选择编码、知识工作、OSWorld 风格 computer use 和多模态文档四类任务,每类记录成功率、tool calls、reasoning/output tokens、延迟和成本。

  3. 对相同任务运行足够重复次数,分别报告平均值、方差和失败类型,不把官方单个点估计当成自己的结果。

  4. 对有破坏性副作用的计算机使用任务设置人工确认和恢复点,并单独记录拒答/安全拦截。

来源摘录或观察(仅做合规短引)

Google 将 3.6 Flash 描述为 “our workhorse model”;其可验证含义应落在 token、工具调用、任务通过率和成本这四个指标上。

能支持的判断

  • 支持理解官方定位、价格和相对 benchmark

不能支持的判断

  • 支持理解官方定位、价格和相对 benchmark;不支持把发布数据当成独立复测或固定账单。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Google Blog · Tulsee Doshi · 原文发布日期 2026-07-21 · 本站编辑日期 2026-09-20

打开原始来源

Gemini 3.6 Flash

在 Tabbit 中比较 Gemini 3.6 Flash

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Gemini 3.6 Flash:变化、价格,以及为什么验证比榜单更重要

Gemini 3.6 Flash 提供 100 万 token 上下文、更少的输出 token 和多模态工具,但配额、验证与版本迁移仍决定实际价值。

相关评测

Gemini 3.6 Flash:PromptsLove 在 OpenCode 中与 Kimi K3 的同配置实测PromptsLove 声称在相同 OpenCode harness、prompt 和四项任务下比较 Gemini 3.6 Flash high thinking 与 Kimi K3;视频分析占优但细致交互代码失败。Gemini 3.6 Flash:Google DeepMind 模型卡的基准、输入能力与限制Google DeepMind 模型卡给出 Gemini 3.6 Flash 的 1M 输入、64K 输出和多模态输入基线,并显示长上下文 GDM-MRCR 仅 54.0%。Gemini 3.6 Flash:Reddit 社区对验证诚实与监督成本的体验Reddit 的 Fable 5 编排报告认为 Gemini 3.6 Flash 在边界清晰任务上便宜好用,但会把未区分结果说成 verified,并可能继续执行不可逆操作。Gemini 3.6 Flash:PromptsRush 的长上下文、多模态与 Agent 提示词PromptsRush 把 Gemini 3.6 Flash 的长上下文、多模态 Agent 任务改写为带引用、schema 和验证步骤的任务契约。Gemini 3.6 Flash:Google 官方 API 能力与 thinking 配置清单Google 模型页列出 Gemini 3.6 Flash 的稳定模型 ID、模态、上下文、缓存、工具和 thinking 配置,适合作为接入基线。