Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
官方Gemini 3.6 Flash

Gemini 3.6 Flash:Google DeepMind 模型卡的基准、输入能力与限制

原始来源

Google DeepMind

作者Google DeepMind

原文日期2026-07-21

Tabbit 整理2026-08-19

查看原文

一句话结论

模型卡给出 Gemini 3.6 Flash 的可复核版本基线:1M 输入、64K 输出、原生文本/图片/音频/视频输入;它在 OSWorld-Verified、CharXiv 和 128K GDM-MRCR 具备优势,但 SWE-Bench Pro、DeepSWE 和 GDPval 仍明显受任务类型与对手影响,并且 1M 长上下文的 GDM-MRCR 仅为 54.0%。

适用场景

  • 适合的任务:多模态文件理解、计算机使用、长文档检索、图表综合和中等复杂度的代码/Agent 循环。

  • 不适合的任务:认为 1M context 等于 1M 长度下稳定高召回、无监督运行高风险工具,或把官方 benchmark 横表视为同一 harness 的公平竞赛。

  • 适用的模型版本:Gemini 3.6 Flash,模型卡发布 July 2026。

  • 适用的客户端、Agent 或 API:Gemini API、Google AI Studio 和模型卡所描述的 Agent 工具路径。

  • 推荐的推理档位和参数:模型卡未公开完整 temperature/prompt 配置;思考配置应回到官方 Gemini 3 开发者指南核对。

测试环境

模型卡说明评估覆盖 reasoning、coding、agentic、multimodal 和 long-context,并将结果与 Gemini 3.5 Flash、Gemini 3.1 Pro、GPT-5.6 Luna、Grok 4.5 和 Claude Sonnet 5 并列展示;具体方法链接指向 DeepMind 的 evals methodology 页面。

输入/配置

  • 输入:文本、图片、音频、视频;context window up to 1M。

  • 输出:文本,最大 64K tokens。

  • 价格(模型卡表格):输入 $1.50/1M,输出 $7.50/1M,无缓存输入价格。

  • 模型依赖:基于 Gemini 3.5 Flash;knowledge cutoff 为 2026 年 3 月。

  • 工具/任务:表格包含 Terminal-bench 的 Terminus-2 harness、OSWorld-Verified computer use、GDM-MRCR 长上下文等不同类型设置。

结果数据

基准Gemini 3.6 FlashGemini 3.5 Flash观察
SWE-Bench Pro58.7%55.1%有提升,但低于表中 GPT-5.6 Luna 62.7%、Grok 4.5 64.7%、Claude Sonnet 5 63.2%
DeepSWE v1.149%37%长程软件工程提升明显
Terminal-Bench 2.178.0%76.2%使用 Terminus-2 harness
MLE-Bench63.9%49.7%机器学习工程提升
GDPval-AA v214211349知识工作 Elo
OSWorld-Verified83.0%78.4%表中 Gemini 3.6 Flash 最高
CharXiv(无工具)85.2%84.2%图表推理
CharXiv(有工具)89.4%84.9%工具版更高
GDM-MRCR v2(128K)91.8%77.3%长上下文提升
GDM-MRCR v2(1M pointwise)54.0%26.6%1M 长度下显著低于 128K

结论

模型卡把“擅长 Agent 与多模态”拆成了具体边界:OSWorld、CharXiv 和 128K 检索表现强,SWE/DeepSWE 处在有竞争力但非全面领先的位置;1M 宣传容量不能替代在真实长度上的 recall 回归。生产路由可优先给它文档、图表、视频和 computer-use 子任务,并为高难代码保留升级路径。

局限

  • 表中各 benchmark 的 harness、工具、重复次数和评分方法不完全相同,不能做简单横向平均。

  • 模型卡结果是 Google 发布的评测结果;尚未说明独立第三方复现。

  • 模型卡说明可能随模型改进而更新,且知识截止日期会造成时效性差异。

  • 已知限制包括 hallucination、偶发 slowness/timeout、知识截止和安全策略误拒;高风险任务需要人工审查。

复现步骤

  1. 记录模型卡版本、发布日期、knowledge cutoff 和完整表格;将 128K 与 1M GDM-MRCR 分开。

  2. 在相同模型 ID 和 API 版本中准备 128K、300K、600K、接近 1M 的检索集,计算 needle recall、引用准确率、延迟和成本。

  3. 用同一工具 schema 运行 SWE/Agent、OSWorld 风格和多模态文档任务,记录完整轨迹与失败原因。

  4. 对所有官方数字标注“官方结果”,直到独立 harness 复现后再升级证据等级。

来源摘录或观察(仅做合规短引)

模型卡明确列出 “1M (pointwise) 54.0%” 与 128K 91.8% 两个长上下文读数;宣传 context window 时必须同时展示这两个边界。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.6 Flash

在 Tabbit 中使用并对比模型

Gemini 3.6 Flash

相关测评

官方Google Blog2026-07-21

Gemini 3.6 Flash:Google 官方发布性能与 Agent 安全说明

媒体PromptsLove

Gemini 3.6 Flash:PromptsLove 在 OpenCode 中与 Kimi K3 的同配置实测

社区Reddit,r/googleantigravity2026-07-22

Gemini 3.6 Flash:Reddit 社区对验证诚实与监督成本的体验

Gemini 3.6 Flash

相关提示词

官方Google AI for Developers2026-07-30

Gemini 3.6 Flash:Google 官方 API 能力与 thinking 配置清单

媒体PromptsRush2026-07-25

Gemini 3.6 Flash:PromptsRush 的长上下文、多模态与 Agent 提示词