Google 的后续发布把 Gemini 3.5 Flash 作为 3.6 Flash 的基线:3.6 在 DeepSWE、MLE Bench、OSWorld-Verified 和 GDPval-AA v2 上超过 3.5,但这些是官方对照,不能替代对 3.5 自身任务集的独立复测。
适合的任务:了解 3.5 Flash 在 Google 后续版本中的基线位置,尤其是编码、电脑使用、知识工作和 Agent 成本效率的版本比较。
不适合的任务:把 3.6 对 3.5 的差值当作跨模型绝对排名,或忽略思考档位、工具和 harness。
适用的模型版本:Gemini 3.5 Flash(作为 3.6 Flash 的官方基线)。
适用的客户端、Agent 或 API:Google Gemini API/企业 Agent 场景;文章称 3.6 的 computer use 可作为 API 内置客户端工具,3.5 的具体接入限制需另查模型页。
推荐的推理档位和参数:原文未公开每项对照的完整 thinking level、采样参数或运行次数;无法核实的参数不应补写。
对照:Gemini 3.6 Flash vs Gemini 3.5 Flash。
来源:Google 官方发布材料,引用 Artificial Analysis Index、Datacurve DeepSWE、MLE Bench、OSWorld-Verified、GDPval-AA v2。
环境细节:文章未公开全部测试输入、样本量、随机种子、工具 harness 或置信区间。
文章将 3.6 Flash 描述为基于 3.5 Flash 的反馈迭代版本,并强调更少 output tokens、更少 reasoning steps 和 tool calls。
3.6 Flash 公布价格为输入 $1.50/百万、输出 $7.50/百万;这是 3.6 价格,不应误记为 3.5 的当前价格。
3.5 Flash 的模型页规格另列为 1,048,576 输入 token、65,536 输出 token、支持思考、函数调用、代码执行、搜索 grounding 和预览版 computer use。
| 指标 | Gemini 3.6 Flash | Gemini 3.5 Flash | 文章上下文 |
|---|---|---|---|
| DeepSWE | 49% | 37% | 3.6 更高 precision、更少不必要代码编辑和执行循环 |
| MLE Bench | 63.9% | 49.7% | 机器学习研究任务 |
| OSWorld-Verified | 83.0% | 78.4% | 电脑使用;文章称 3.6 为 API 内置客户端工具 |
| GDPval-AA v2 | 1,421 | 1,349 | 专业知识工作 |
| Artificial Analysis 输出 token | 比 3.5 少 17% | 基线 | 指数来源为 Artificial Analysis Index |
官方对照支持“3.6 相对 3.5 更高效且质量更好”的版本升级判断,尤其是在编码、ML 研究、电脑使用和知识工作上;但它只告诉我们 3.5 的相对基线,不足以判断 3.5 是否适合某个具体生产任务。
所有数字来自 Google 官方发布,第三方链接被引用但页面没有给出完整原始实验记录。
不同 benchmark 的输入、工具、推理档位、运行次数和评分实现未在文章中完整公开。
3.5 与 3.6 的价格、模型 ID、上下文和工具可用性可能随时间或套餐改变;应以目标 API 的当前模型页为准。
3.6 的优势不能反向推导 3.5 与其他厂商模型的绝对排名。
固定 gemini-3.5-flash 模型版本、thinking level、上下文、工具和输出上限。
在同一代码仓库/电脑环境上运行 DeepSWE、MLE Bench、OSWorld 类任务,至少重复多次并记录成功率、token、工具调用和总耗时。
用与 3.6 相同的 harness 复测,避免把版本升级和测试框架升级混在一起。
将官方差值作为参考区间,另报告自己的置信区间、失败类型和成本。
Google 将 3.5 Flash 描述为 3.6 Flash 的直接反馈基线,并指出 3.6 “takes fewer reasoning steps and tool calls”。这能指导版本迁移评估,但不是 3.5 单独的端到端验收。
Gemini 3.5 Flash