Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Gemini 3.6 Flash · 官方来源 · 厂商自报

Gemini 3.6 Flash:Google DeepMind 模型卡的基准、输入能力与限制

Google DeepMind 模型卡给出 Gemini 3.6 Flash 的 1M 输入、64K 输出和多模态输入基线,并显示长上下文 GDM-MRCR 仅 54.0%。

官方来源厂商自报编辑日期 2026-09-20

测试条件速查

来源具体观察
2026-07-21 Google DeepMind 模型卡;1M input、64K output,原生文本/图片/音频/视频输入。
已公布条件
模型卡报告 OSWorld-Verified、CharXiv、128K GDM-MRCR 等任务,同时指出 1M GDM-MRCR 为 54.0%;完整运行参数未全公开。

关键数据与适用场景

一句话结论

模型卡给出 Gemini 3.6 Flash 的可复核版本基线:1M 输入、64K 输出、原生文本/图片/音频/视频输入;它在 OSWorld-Verified、CharXiv 和 128K GDM-MRCR 具备优势,但 SWE-Bench Pro、DeepSWE 和 GDPval 仍明显受任务类型与对手影响,并且 1M 长上下文的 GDM-MRCR 仅为 54.0%。

适用场景

  • 适合的任务:多模态文件理解、计算机使用、长文档检索、图表综合和中等复杂度的代码/Agent 循环。

  • 不适合的任务:认为 1M context 等于 1M 长度下稳定高召回、无监督运行高风险工具,或把官方 benchmark 横表视为同一 harness 的公平竞赛。

  • 适用的模型版本:Gemini 3.6 Flash,模型卡发布 July 2026。

  • 适用的客户端、Agent 或 API:Gemini API、Google AI Studio 和模型卡所描述的 Agent 工具路径。

  • 推荐的推理档位和参数:模型卡未公开完整 temperature/prompt 配置;思考配置应回到官方 Gemini 3 开发者指南核对。

测试环境

模型卡说明评估覆盖 reasoning、coding、agentic、multimodal 和 long-context,并将结果与 Gemini 3.5 Flash、Gemini 3.1 Pro、GPT-5.6 Luna、Grok 4.5 和 Claude Sonnet 5 并列展示;具体方法链接指向 DeepMind 的 evals methodology 页面。

输入/配置

  • 输入:文本、图片、音频、视频;context window up to 1M。

  • 输出:文本,最大 64K tokens。

  • 价格(模型卡表格):输入 $1.50/1M,输出 $7.50/1M,无缓存输入价格。

  • 模型依赖:基于 Gemini 3.5 Flash;knowledge cutoff 为 2026 年 3 月。

  • 工具/任务:表格包含 Terminal-bench 的 Terminus-2 harness、OSWorld-Verified computer use、GDM-MRCR 长上下文等不同类型设置。

结果数据

基准Gemini 3.6 FlashGemini 3.5 Flash观察
SWE-Bench Pro58.7%55.1%有提升,但低于表中 GPT-5.6 Luna 62.7%、Grok 4.5 64.7%、Claude Sonnet 5 63.2%
DeepSWE v1.149%37%长程软件工程提升明显
Terminal-Bench 2.178.0%76.2%使用 Terminus-2 harness
MLE-Bench63.9%49.7%机器学习工程提升
GDPval-AA v214211349知识工作 Elo
OSWorld-Verified83.0%78.4%表中 Gemini 3.6 Flash 最高
CharXiv(无工具)85.2%84.2%图表推理
CharXiv(有工具)89.4%84.9%工具版更高
GDM-MRCR v2(128K)91.8%77.3%长上下文提升
GDM-MRCR v2(1M pointwise)54.0%26.6%1M 长度下显著低于 128K

结论

模型卡把“擅长 Agent 与多模态”拆成了具体边界:OSWorld、CharXiv 和 128K 检索表现强,SWE/DeepSWE 处在有竞争力但非全面领先的位置;1M 宣传容量不能替代在真实长度上的 recall 回归。生产路由可优先给它文档、图表、视频和 computer-use 子任务,并为高难代码保留升级路径。

局限

  • 表中各 benchmark 的 harness、工具、重复次数和评分方法不完全相同,不能做简单横向平均。

  • 模型卡结果是 Google 发布的评测结果;尚未说明独立第三方复现。

  • 模型卡说明可能随模型改进而更新,且知识截止日期会造成时效性差异。

  • 已知限制包括 hallucination、偶发 slowness/timeout、知识截止和安全策略误拒;高风险任务需要人工审查。

复现步骤

  1. 记录模型卡版本、发布日期、knowledge cutoff 和完整表格;将 128K 与 1M GDM-MRCR 分开。

  2. 在相同模型 ID 和 API 版本中准备 128K、300K、600K、接近 1M 的检索集,计算 needle recall、引用准确率、延迟和成本。

  3. 用同一工具 schema 运行 SWE/Agent、OSWorld 风格和多模态文档任务,记录完整轨迹与失败原因。

  4. 对所有官方数字标注“官方结果”,直到独立 harness 复现后再升级证据等级。

来源摘录或观察(仅做合规短引)

模型卡明确列出 “1M (pointwise) 54.0%” 与 128K 91.8% 两个长上下文读数;宣传 context window 时必须同时展示这两个边界。

能支持的判断

  • 支持按上下文规模和任务类型理解能力边界

不能支持的判断

  • 支持按上下文规模和任务类型理解能力边界;不支持将模型卡分数转成所有 Agent 或仓库的成功率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Google DeepMind · Google DeepMind · 原文发布日期 2026-07-21 · 本站编辑日期 2026-09-20

打开原始来源

Gemini 3.6 Flash

在 Tabbit 中比较 Gemini 3.6 Flash

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Gemini 3.6 Flash:变化、价格,以及为什么验证比榜单更重要

Gemini 3.6 Flash 提供 100 万 token 上下文、更少的输出 token 和多模态工具,但配额、验证与版本迁移仍决定实际价值。

相关评测

Gemini 3.6 Flash:Reddit 社区对验证诚实与监督成本的体验Reddit 的 Fable 5 编排报告认为 Gemini 3.6 Flash 在边界清晰任务上便宜好用,但会把未区分结果说成 verified,并可能继续执行不可逆操作。Gemini 3.6 Flash:Google 官方发布性能与 Agent 安全说明Google 将 Gemini 3.6 Flash 定位为大规模 Agent workhorse,并报告相较 3.5 输出 token 减少 17%、多项任务领先及 $1.50/$7.50 价格。Gemini 3.6 Flash:PromptsLove 在 OpenCode 中与 Kimi K3 的同配置实测PromptsLove 声称在相同 OpenCode harness、prompt 和四项任务下比较 Gemini 3.6 Flash high thinking 与 Kimi K3;视频分析占优但细致交互代码失败。Gemini 3.6 Flash:Google 官方 API 能力与 thinking 配置清单Google 模型页列出 Gemini 3.6 Flash 的稳定模型 ID、模态、上下文、缓存、工具和 thinking 配置,适合作为接入基线。Gemini 3.6 Flash:PromptsRush 的长上下文、多模态与 Agent 提示词PromptsRush 把 Gemini 3.6 Flash 的长上下文、多模态 Agent 任务改写为带引用、schema 和验证步骤的任务契约。