Gemini 3.6 Flash 适合做多模态代码、文档和边界清晰的 Agent 试点。它的价值不只在 benchmark:Google 称它比 3.5 Flash 使用更少输出 token,而社区反馈说明,只有在结果容易复核时,这种节省才会变成实际收益。
本文的时间锚点是 Google 2026 年 7 月 21 日发布,以及 9 月 20 日重新核对的模型卡:gemini-3.6-flash、输入 1,048,576 token、输出 65,536 token、文本/图片/视频/音频/PDF 输入,以及输入/输出每百万 1.50/7.50 美元的付费 Standard 行。3.7 和 3.8 是相邻路线,不是自动替代。先看 Gemini 3.6 模型页,再确认实际客户端与账户。
快速判断
需要多模态输入、快速 Agent 循环和较低输出账单时可试用 3.6。
“少 17% 输出 token”是有日期的对比,不是每个任务都省钱的保证。
Google 列出幻觉、偶发超时和知识截点,因此必须独立验证。
Gemini API、AI Studio/Antigravity、企业条款和 Tabbit 配额要分开看。
允许写入的 Agent 必须同时给出 diff、测试结果和停止条件。
规格一览
| 项目 | 2026-09-20 核对内容 | 实际边界 |
|---|---|---|
| 模型 ID | 稳定版 gemini-3.6-flash | 仍应检查选择器和请求中的精确 ID。 |
| 输入输出 | 文本、图片、视频、音频、PDF 输入;文本输出 | 客户端可能只开放其中一部分。 |
| token 上限 | 输入 1,048,576;输出 65,536 | 产品或套餐可能设置更小的有效窗口。 |
| 工具 | 缓存、代码执行、计算机使用预览、文件搜索、函数调用、接地、结构化输出、URL 上下文 | API 支持不等于账户和客户端都开放。 |
| 付费价格 | 输入 $1.50 / 输出 $7.50 每百万 token | 免费层、缓存、工具和重试另算。 |
| 知识截点 | 模型卡列出 2026 年 3 月 | 当前事实仍需搜索和引用。 |
先读 什么是 Agent 浏览器 区分浏览器助手和 API,再看 AI 浏览器比较 与 Tabbit Browser 实践。
从 3.5 到 3.6,3.7 又意味着什么
Google 将 3.6 定位为 3.5 Flash 之后的工作模型:代码、知识工作和多模态表现更好,并在引用的 Artificial Analysis 对比中少用 17% 输出 token。发布文还列出 DeepSWE 49% 对 37%、MLE-Bench 63.9% 对 49.7%、OSWorld-Verified 83.0% 对 78.4%、GDPval-AA v2 Elo 1421 对 1349。这些是发布方选择的比较,不能当独立审计。
3.7 和 3.8 改变的是选择,而不是让 3.6 立刻失效。如果 3.6 能以较少循环完成边界明确、容易复核的工作,它的效率有意义;如果任务需要更长自主规划,就应固定任务和验收条件去测试新路线。Agent 深度研究指南可帮助记录努力等级、工具和修正次数。
官方结果必须连同口径阅读
Google 模型卡列出 SWE-Bench Pro 58.7%、DeepSWE 49%、Terminal-Bench 2.1 78.0%、MLE-Bench 63.9%、OSWorld-Verified 83.0%、CharXiv 无工具 85.2%、GDM-MRCR 1M 54.0%。这些行分别测试代码、电脑使用、图表和长上下文,不是一个综合分。1M 行是点测,不代表每个百万 token 请求都便宜或稳定。Google 的发布文还包含 Artificial Analysis 和客户案例,只能作为线索。Gemini prompts与Gemini reviews应保留来源条件,不复制第三方长提示词。
独立与社区反馈
Promptslove 记录了 24 小时 OpenCode、high thinking、四个任务的比较:前端、浏览器游戏、表单构建和 Instagram 视频分析。作者称表单、CSV 导出、编辑与视频分析可用,但前端缺少要求的滚动指针、数字动画、响应式和视觉精度。这是具体的小样本,不是替代官方 benchmark。
r/google_antigravity 的一篇帖子认为,任务范围清晰、先做 instrument、再按通过/失败判断时,3.6 快而有能力;但最重要的问题是“验证”可能只是看起来合理,另有一次不可逆操作风险。另一位半天用户称循环和 token 更少,但后续功能开发漏跑测试和 Firebase 规则。r/SillyTavernAI 用户在 temperature 1 与指定 preset 下称赞写作,却有回复提到 400 错误、拒答和长上下文重复。这些观察说明监督成本也是价格的一部分。
价格、配额和风险
Google 付费 Standard 行为输入/输出每百万 1.50/7.50 美元,输出包含 thinking token。免费层说明提交内容可能用于改进 Google 产品,付费层则写明不会用于改进;发送敏感资料前必须核对当前区域条款。缓存、Search grounding、其他工具、重试和消费者订阅不能藏在 token 单价里。
AI Studio、Gemini API、Antigravity、Android Studio 与 Gemini Enterprise 可能有不同配额和合同。某个产品中跑得快,不证明 API 或另一个产品也有同样隐私条款。Tabbit 是独立路线;可参考 浏览器自动化设计任务,但不能把 Tabbit 会话转换成 Gemini API 发票。
Google 还列出幻觉、偶发超时、持续加强越狱防护和 2026 年 3 月知识截点。社区补充了漏测、错误验证、配额压力、供应商错误和长会话重复。它们不是失败率,而是验收清单。
场景自检与 Tabbit 边界
小型代码补丁应使用固定仓库、diff 和测试;文档或图表任务要有日期和缺失值字段;电脑使用应在可丢弃页面中记录工具调用;长写作需比较短长续写和重复率;生产 Agent 必须设置预算和人工检查点。
本文没有运行已登录的 Gemini 3.6 Flash Tabbit 任务,也没有捕获 4–8 张合格截图,因此不声称选择器、有效上下文、延迟、配额、订阅或价格。若账户出现该模型,先从公开文档抽取五项事实和链接,人工核验后再重复已知答案。首次不要上传机密资料或授予写入权限。
结论
Gemini 3.6 Flash 是多模态代码和边界清晰 Agent 的可信效率型候选。Google 的结果支持 token 效率和相对 3.5 的多项提升,但独立与社区反馈提醒:监督、配额和验证可能吃掉账面节省。用固定任务试点;只有新能力或更长自主性足以抵消路线和复核成本时,才迁移 3.7 或 3.8。高影响任务保留备用模型。
来源
常见问题
Gemini 3.6 Flash 是什么?
Gemini 3.6 Flash 是 Google 面向代码、知识工作和 Agent 的稳定多模态 Flash 模型。Google 列出文本、图片、视频、音频和 PDF 输入,输入上限 1,048,576 token,输出上限 65,536 token。
它相比 Gemini 3.5 Flash 改变了什么?
Google 引用的 Artificial Analysis 对比显示输出 token 少 17%,同时代码、知识工作和多模态表现提升。这是有日期和口径的供应商数据,不等于每项任务成本都下降。
Gemini 3.6 Flash 多少钱?
2026 年 9 月 20 日查看的 Google 付费 Standard 价格是输入每百万 token 1.50 美元、输出 7.50 美元。免费层数据使用条款不同,工具和重试也可能增加费用。
它适合代码 Agent 吗?
Google 模型卡列出 SWE-Bench Pro 58.7%、Terminal-Bench 2.1 78.0% 和 OSWorld-Verified 83.0%。独立与社区反馈更支持边界清晰、有人复核的任务。
Gemini 3.6 Flash 有哪些限制?
Google 列出幻觉、偶发变慢或超时、持续加强的越狱防护,以及 2026 年 3 月知识截点。社区还提到配额、漏测和长上下文重复。
能在 Tabbit 使用 Gemini 3.6 Flash 吗?
本文没有执行已登录的 Gemini 3.6 Flash Tabbit 任务。请检查实时选择器和账户条款,不要从 Gemini API 推断 Tabbit 的可用性、延迟、配额或账单。