模型卡给出 Gemini 3.6 Flash 的可复核版本基线:1M 输入、64K 输出、原生文本/图片/音频/视频输入;它在 OSWorld-Verified、CharXiv 和 128K GDM-MRCR 具备优势,但 SWE-Bench Pro、DeepSWE 和 GDPval 仍明显受任务类型与对手影响,并且 1M 长上下文的 GDM-MRCR 仅为 54.0%。
适合的任务:多模态文件理解、计算机使用、长文档检索、图表综合和中等复杂度的代码/Agent 循环。
不适合的任务:认为 1M context 等于 1M 长度下稳定高召回、无监督运行高风险工具,或把官方 benchmark 横表视为同一 harness 的公平竞赛。
适用的模型版本:Gemini 3.6 Flash,模型卡发布 July 2026。
适用的客户端、Agent 或 API:Gemini API、Google AI Studio 和模型卡所描述的 Agent 工具路径。
推荐的推理档位和参数:模型卡未公开完整 temperature/prompt 配置;思考配置应回到官方 Gemini 3 开发者指南核对。
模型卡说明评估覆盖 reasoning、coding、agentic、multimodal 和 long-context,并将结果与 Gemini 3.5 Flash、Gemini 3.1 Pro、GPT-5.6 Luna、Grok 4.5 和 Claude Sonnet 5 并列展示;具体方法链接指向 DeepMind 的 evals methodology 页面。
输入:文本、图片、音频、视频;context window up to 1M。
输出:文本,最大 64K tokens。
价格(模型卡表格):输入 $1.50/1M,输出 $7.50/1M,无缓存输入价格。
模型依赖:基于 Gemini 3.5 Flash;knowledge cutoff 为 2026 年 3 月。
工具/任务:表格包含 Terminal-bench 的 Terminus-2 harness、OSWorld-Verified computer use、GDM-MRCR 长上下文等不同类型设置。
| 基准 | Gemini 3.6 Flash | Gemini 3.5 Flash | 观察 |
|---|---|---|---|
| SWE-Bench Pro | 58.7% | 55.1% | 有提升,但低于表中 GPT-5.6 Luna 62.7%、Grok 4.5 64.7%、Claude Sonnet 5 63.2% |
| DeepSWE v1.1 | 49% | 37% | 长程软件工程提升明显 |
| Terminal-Bench 2.1 | 78.0% | 76.2% | 使用 Terminus-2 harness |
| MLE-Bench | 63.9% | 49.7% | 机器学习工程提升 |
| GDPval-AA v2 | 1421 | 1349 | 知识工作 Elo |
| OSWorld-Verified | 83.0% | 78.4% | 表中 Gemini 3.6 Flash 最高 |
| CharXiv(无工具) | 85.2% | 84.2% | 图表推理 |
| CharXiv(有工具) | 89.4% | 84.9% | 工具版更高 |
| GDM-MRCR v2(128K) | 91.8% | 77.3% | 长上下文提升 |
| GDM-MRCR v2(1M pointwise) | 54.0% | 26.6% | 1M 长度下显著低于 128K |
模型卡把“擅长 Agent 与多模态”拆成了具体边界:OSWorld、CharXiv 和 128K 检索表现强,SWE/DeepSWE 处在有竞争力但非全面领先的位置;1M 宣传容量不能替代在真实长度上的 recall 回归。生产路由可优先给它文档、图表、视频和 computer-use 子任务,并为高难代码保留升级路径。
表中各 benchmark 的 harness、工具、重复次数和评分方法不完全相同,不能做简单横向平均。
模型卡结果是 Google 发布的评测结果;尚未说明独立第三方复现。
模型卡说明可能随模型改进而更新,且知识截止日期会造成时效性差异。
已知限制包括 hallucination、偶发 slowness/timeout、知识截止和安全策略误拒;高风险任务需要人工审查。
记录模型卡版本、发布日期、knowledge cutoff 和完整表格;将 128K 与 1M GDM-MRCR 分开。
在相同模型 ID 和 API 版本中准备 128K、300K、600K、接近 1M 的检索集,计算 needle recall、引用准确率、延迟和成本。
用同一工具 schema 运行 SWE/Agent、OSWorld 风格和多模态文档任务,记录完整轨迹与失败原因。
对所有官方数字标注“官方结果”,直到独立 harness 复现后再升级证据等级。
模型卡明确列出 “1M (pointwise) 54.0%” 与 128K 91.8% 两个长上下文读数;宣传 context window 时必须同时展示这两个边界。
Gemini 3.6 Flash