官方模型页给出了可直接落地的稳定模型 ID、输入输出上限、原生文件模态、缓存/工具能力和 thinking 支持,是接入 Gemini 3.6 Flash 时应优先锁定的配置基线。
适合的任务:Gemini API/AI Studio 接入、文件与多模态输入、代码执行、函数调用、结构化输出、搜索接地和批处理。
不适合的任务:依赖音频生成、图片生成或 Live API 的输出型应用;官方页明确这些能力不受支持。
适用的模型版本:稳定版 gemini-3.6-flash,页面最后更新时间 2026-07-30 UTC。
适用的客户端、Agent 或 API:Gemini API、Google AI Studio,以及能调用官方工具的 Agent 客户端。
推荐的推理档位和参数:官方页只标注支持 thinking;具体 thinking_level、工具和采样配置应以 Gemini 3 开发者指南 当前说明为准,不能沿用旧版 thinking_budget 假设。
模型 ID:gemini-3.6-flash
输入:text / image / video / audio / PDF
输出:text
输入 token 上限:1,048,576
输出 token 上限:65,536
支持:缓存、代码执行、计算机使用(预览)、文件搜索、函数调用、Google Maps 接地、搜索接地、结构化输出、thinking、URL context、Batch API、灵活推理、优先推理
不支持:音频生成、图片生成、Live API在客户端先把模型 ID 固定为 gemini-3.6-flash,不要把搜索结果中的自然语言名称当作 API ID。
对 text、image、video、audio、PDF 各跑一次最小输入探针,单独记录文件大小、时长、token 和失败信息。
逐项启用缓存、代码执行、函数调用、结构化输出和搜索接地;每次只改一个能力,避免把工具错误归因于模型。
对 1M 输入和 65,536 输出不要直接压满生产请求;先用真实工作负载测上下文召回、首 token 延迟、总耗时和成本。
计算机使用仍标为预览功能,必须保留人工确认和可恢复操作边界。
官方输入类型为文本、图片、视频、音频和 PDF;输出为文本。
输入 token 限制 1,048,576,输出 token 限制 65,536。
官方能力表列出缓存、代码执行、计算机使用(预览)、文件搜索、函数调用、Maps 接地、搜索接地、结构化输出、thinking 和 URL context 均支持。
官方使用选项列出 Batch API、灵活推理和优先推理均支持。
官方稳定版本为 gemini-3.6-flash;模型最新更新为 2026 年 7 月;页面最后更新时间为 2026-07-30 UTC。
该页面是能力与限制清单,不提供完整业务 prompt、真实吞吐或质量保证;需要另做工作负载评测。
“支持”不等于所有区域、客户端、订阅层级都已开放;计算机使用尤其标注为预览。
价格、速率限制和缓存计费未在该模型页完整展开,生产报价应回到当前定价页。
官方模型页会更新,保存采集日期和页面版本,避免把后续能力变化倒写到旧测试。
官方页面将该模型概括为 “专为智能体时代而设计”;落地时应以能力表和实际探针结果为准,而不是把定位语句当成性能承诺。
Gemini 3.6 Flash