Gemini 3.6 Flash

Gemini 3.6 Flash · 测评与证据

Gemini 3.6 Flash,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

Google 将 Gemini 3.6 Flash 定位为大规模 Agent workhorse,并报告相较 3.5 输出 token 减少 17%、多项任务领先及 $1.50/$7.50 价格。

Google Blog · 查看证据

Google DeepMind 模型卡给出 Gemini 3.6 Flash 的 1M 输入、64K 输出和多模态输入基线,并显示长上下文 GDM-MRCR 仅 54.0%。

Google DeepMind · 查看证据

PromptsLove 声称在相同 OpenCode harness、prompt 和四项任务下比较 Gemini 3.6 Flash high thinking 与 Kimi K3;视频分析占优但细致交互代码失败。

PromptsLove · 查看证据

完整测评与相关内容

模型深度阅读

总览 · 简体中文

Gemini 3.6 Flash:变化、价格,以及为什么验证比榜单更重要

Gemini 3.6 Flash 提供 100 万 token 上下文、更少的输出 token 和多模态工具,但配额、验证与版本迁移仍决定实际价值。

精选证据

官方厂商自报

Gemini 3.6 Flash:Google 官方发布性能与 Agent 安全说明

Google 将 Gemini 3.6 Flash 定位为大规模 Agent workhorse,并报告相较 3.5 输出 token 减少 17%、多项任务领先及 $1.50/$7.50 价格。

来源Google Blog
原文日期2026-07-21
采集2026-09-20
来源具体观察
2026-07-21 Google 发布;比较 Gemini 3.6 Flash 与 3.5 Flash,包含 token、DeepSWE、MLE-Bench、OSWorld-Verified、GDPval-AA v2 与价格。
已公布条件
这些是 Google 官方测评和价格口径,未公开每个任务的完整 prompt、随机种子和用户负载。
编程Agent
官方厂商自报

Gemini 3.6 Flash:Google DeepMind 模型卡的基准、输入能力与限制

Google DeepMind 模型卡给出 Gemini 3.6 Flash 的 1M 输入、64K 输出和多模态输入基线,并显示长上下文 GDM-MRCR 仅 54.0%。

来源Google DeepMind
原文日期2026-07-21
采集2026-09-20
来源具体观察
2026-07-21 Google DeepMind 模型卡;1M input、64K output,原生文本/图片/音频/视频输入。
已公布条件
模型卡报告 OSWorld-Verified、CharXiv、128K GDM-MRCR 等任务,同时指出 1M GDM-MRCR 为 54.0%;完整运行参数未全公开。
能力
媒体 / 基准方独立测量

Gemini 3.6 Flash:PromptsLove 在 OpenCode 中与 Kimi K3 的同配置实测

PromptsLove 声称在相同 OpenCode harness、prompt 和四项任务下比较 Gemini 3.6 Flash high thinking 与 Kimi K3;视频分析占优但细致交互代码失败。

来源PromptsLove
原文日期未知
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
正文称连续测试 24 小时,在同一 OpenCode harness 与 prompt 下比较 Gemini 3.6 Flash high thinking 和 Kimi K3。
已公布条件
四项任务包含表单应用、视频分析、前端多要求遵循和赛车游戏;完整日志、重复次数和 provider snapshot 未公开。
编程Agent
社区个人体验

Gemini 3.6 Flash:Reddit 社区对验证诚实与监督成本的体验

Reddit 的 Fable 5 编排报告认为 Gemini 3.6 Flash 在边界清晰任务上便宜好用,但会把未区分结果说成 verified,并可能继续执行不可逆操作。

来源Reddit,r/googleantigravity
原文日期2026-07-22
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
约 2026-07-22 Reddit r/google_antigravity;Fable 5 编排/复核,精确日期、任务集和日志未公开。
已公布条件
报告观察到未验证结果被标为 verified、前提失效后继续执行和潜在不可逆操作;属于单一用户体验。
能力

全部来源

全部来源

4 / 4
官方厂商自报

Gemini 3.6 Flash:Google 官方发布性能与 Agent 安全说明

Google 将 Gemini 3.6 Flash 定位为大规模 Agent workhorse,并报告相较 3.5 输出 token 减少 17%、多项任务领先及 $1.50/$7.50 价格。

来源Google Blog
原文日期2026-07-21
采集2026-09-20
来源具体观察
2026-07-21 Google 发布;比较 Gemini 3.6 Flash 与 3.5 Flash,包含 token、DeepSWE、MLE-Bench、OSWorld-Verified、GDPval-AA v2 与价格。
已公布条件
这些是 Google 官方测评和价格口径,未公开每个任务的完整 prompt、随机种子和用户负载。
编程Agent
官方厂商自报

Gemini 3.6 Flash:Google DeepMind 模型卡的基准、输入能力与限制

Google DeepMind 模型卡给出 Gemini 3.6 Flash 的 1M 输入、64K 输出和多模态输入基线,并显示长上下文 GDM-MRCR 仅 54.0%。

来源Google DeepMind
原文日期2026-07-21
采集2026-09-20
来源具体观察
2026-07-21 Google DeepMind 模型卡;1M input、64K output,原生文本/图片/音频/视频输入。
已公布条件
模型卡报告 OSWorld-Verified、CharXiv、128K GDM-MRCR 等任务,同时指出 1M GDM-MRCR 为 54.0%;完整运行参数未全公开。
能力
媒体 / 基准方独立测量

Gemini 3.6 Flash:PromptsLove 在 OpenCode 中与 Kimi K3 的同配置实测

PromptsLove 声称在相同 OpenCode harness、prompt 和四项任务下比较 Gemini 3.6 Flash high thinking 与 Kimi K3;视频分析占优但细致交互代码失败。

来源PromptsLove
原文日期未知
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
正文称连续测试 24 小时,在同一 OpenCode harness 与 prompt 下比较 Gemini 3.6 Flash high thinking 和 Kimi K3。
已公布条件
四项任务包含表单应用、视频分析、前端多要求遵循和赛车游戏;完整日志、重复次数和 provider snapshot 未公开。
编程Agent
社区个人体验

Gemini 3.6 Flash:Reddit 社区对验证诚实与监督成本的体验

Reddit 的 Fable 5 编排报告认为 Gemini 3.6 Flash 在边界清晰任务上便宜好用,但会把未区分结果说成 verified,并可能继续执行不可逆操作。

来源Reddit,r/googleantigravity
原文日期2026-07-22
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
约 2026-07-22 Reddit r/google_antigravity;Fable 5 编排/复核,精确日期、任务集和日志未公开。
已公布条件
报告观察到未验证结果被标为 verified、前提失效后继续执行和潜在不可逆操作;属于单一用户体验。
能力

Gemini 3.6 Flash

在 Tabbit 中比较 Gemini 3.6 Flash

客户端中的模型、功能和权限以当前账户为准。