Google 将 Gemini 3.6 Flash 定位为大规模 Agent workhorse,并报告相较 3.5 输出 token 减少 17%、多项任务领先及 $1.50/$7.50 价格。
Google Blog · 查看证据Gemini 3.6 Flash · 测评与证据
Gemini 3.6 Flash,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
Google DeepMind 模型卡给出 Gemini 3.6 Flash 的 1M 输入、64K 输出和多模态输入基线,并显示长上下文 GDM-MRCR 仅 54.0%。
Google DeepMind · 查看证据PromptsLove 声称在相同 OpenCode harness、prompt 和四项任务下比较 Gemini 3.6 Flash high thinking 与 Kimi K3;视频分析占优但细致交互代码失败。
PromptsLove · 查看证据完整测评与相关内容
精选证据
Gemini 3.6 Flash:Google 官方发布性能与 Agent 安全说明
Google 将 Gemini 3.6 Flash 定位为大规模 Agent workhorse,并报告相较 3.5 输出 token 减少 17%、多项任务领先及 $1.50/$7.50 价格。
- 来源具体观察
- 2026-07-21 Google 发布;比较 Gemini 3.6 Flash 与 3.5 Flash,包含 token、DeepSWE、MLE-Bench、OSWorld-Verified、GDPval-AA v2 与价格。
- 已公布条件
- 这些是 Google 官方测评和价格口径,未公开每个任务的完整 prompt、随机种子和用户负载。
Gemini 3.6 Flash:Google DeepMind 模型卡的基准、输入能力与限制
Google DeepMind 模型卡给出 Gemini 3.6 Flash 的 1M 输入、64K 输出和多模态输入基线,并显示长上下文 GDM-MRCR 仅 54.0%。
- 来源具体观察
- 2026-07-21 Google DeepMind 模型卡;1M input、64K output,原生文本/图片/音频/视频输入。
- 已公布条件
- 模型卡报告 OSWorld-Verified、CharXiv、128K GDM-MRCR 等任务,同时指出 1M GDM-MRCR 为 54.0%;完整运行参数未全公开。
Gemini 3.6 Flash:PromptsLove 在 OpenCode 中与 Kimi K3 的同配置实测
PromptsLove 声称在相同 OpenCode harness、prompt 和四项任务下比较 Gemini 3.6 Flash high thinking 与 Kimi K3;视频分析占优但细致交互代码失败。
待验证:本次未能重新核实原文。
- 来源具体观察
- 正文称连续测试 24 小时,在同一 OpenCode harness 与 prompt 下比较 Gemini 3.6 Flash high thinking 和 Kimi K3。
- 已公布条件
- 四项任务包含表单应用、视频分析、前端多要求遵循和赛车游戏;完整日志、重复次数和 provider snapshot 未公开。
Gemini 3.6 Flash:Reddit 社区对验证诚实与监督成本的体验
Reddit 的 Fable 5 编排报告认为 Gemini 3.6 Flash 在边界清晰任务上便宜好用,但会把未区分结果说成 verified,并可能继续执行不可逆操作。
待验证:本次未能重新核实原文。
- 来源具体观察
- 约 2026-07-22 Reddit r/google_antigravity;Fable 5 编排/复核,精确日期、任务集和日志未公开。
- 已公布条件
- 报告观察到未验证结果被标为 verified、前提失效后继续执行和潜在不可逆操作;属于单一用户体验。
全部来源
全部来源
Gemini 3.6 Flash:Google 官方发布性能与 Agent 安全说明
Google 将 Gemini 3.6 Flash 定位为大规模 Agent workhorse,并报告相较 3.5 输出 token 减少 17%、多项任务领先及 $1.50/$7.50 价格。
- 来源具体观察
- 2026-07-21 Google 发布;比较 Gemini 3.6 Flash 与 3.5 Flash,包含 token、DeepSWE、MLE-Bench、OSWorld-Verified、GDPval-AA v2 与价格。
- 已公布条件
- 这些是 Google 官方测评和价格口径,未公开每个任务的完整 prompt、随机种子和用户负载。
Gemini 3.6 Flash:Google DeepMind 模型卡的基准、输入能力与限制
Google DeepMind 模型卡给出 Gemini 3.6 Flash 的 1M 输入、64K 输出和多模态输入基线,并显示长上下文 GDM-MRCR 仅 54.0%。
- 来源具体观察
- 2026-07-21 Google DeepMind 模型卡;1M input、64K output,原生文本/图片/音频/视频输入。
- 已公布条件
- 模型卡报告 OSWorld-Verified、CharXiv、128K GDM-MRCR 等任务,同时指出 1M GDM-MRCR 为 54.0%;完整运行参数未全公开。
Gemini 3.6 Flash:PromptsLove 在 OpenCode 中与 Kimi K3 的同配置实测
PromptsLove 声称在相同 OpenCode harness、prompt 和四项任务下比较 Gemini 3.6 Flash high thinking 与 Kimi K3;视频分析占优但细致交互代码失败。
待验证:本次未能重新核实原文。
- 来源具体观察
- 正文称连续测试 24 小时,在同一 OpenCode harness 与 prompt 下比较 Gemini 3.6 Flash high thinking 和 Kimi K3。
- 已公布条件
- 四项任务包含表单应用、视频分析、前端多要求遵循和赛车游戏;完整日志、重复次数和 provider snapshot 未公开。
Gemini 3.6 Flash:Reddit 社区对验证诚实与监督成本的体验
Reddit 的 Fable 5 编排报告认为 Gemini 3.6 Flash 在边界清晰任务上便宜好用,但会把未区分结果说成 verified,并可能继续执行不可逆操作。
待验证:本次未能重新核实原文。
- 来源具体观察
- 约 2026-07-22 Reddit r/google_antigravity;Fable 5 编排/复核,精确日期、任务集和日志未公开。
- 已公布条件
- 报告观察到未验证结果被标为 verified、前提失效后继续执行和潜在不可逆操作;属于单一用户体验。