Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
官方Gemini 3.5 Flash

Gemini 3.5 Flash:Google 官方后续发布中的效率与能力对照

原始来源

Google Blog

作者Tulsee Doshi / Google

原文日期2026-07-21

Tabbit 整理2026-08-19

查看原文

一句话结论

Google 的后续发布把 Gemini 3.5 Flash 作为 3.6 Flash 的基线:3.6 在 DeepSWE、MLE Bench、OSWorld-Verified 和 GDPval-AA v2 上超过 3.5,但这些是官方对照,不能替代对 3.5 自身任务集的独立复测。

适用场景

  • 适合的任务:了解 3.5 Flash 在 Google 后续版本中的基线位置,尤其是编码、电脑使用、知识工作和 Agent 成本效率的版本比较。

  • 不适合的任务:把 3.6 对 3.5 的差值当作跨模型绝对排名,或忽略思考档位、工具和 harness。

  • 适用的模型版本:Gemini 3.5 Flash(作为 3.6 Flash 的官方基线)。

  • 适用的客户端、Agent 或 API:Google Gemini API/企业 Agent 场景;文章称 3.6 的 computer use 可作为 API 内置客户端工具,3.5 的具体接入限制需另查模型页。

  • 推荐的推理档位和参数:原文未公开每项对照的完整 thinking level、采样参数或运行次数;无法核实的参数不应补写。

测试环境

  • 对照:Gemini 3.6 Flash vs Gemini 3.5 Flash。

  • 来源:Google 官方发布材料,引用 Artificial Analysis Index、Datacurve DeepSWE、MLE Bench、OSWorld-Verified、GDPval-AA v2。

  • 环境细节:文章未公开全部测试输入、样本量、随机种子、工具 harness 或置信区间。

输入/配置

  • 文章将 3.6 Flash 描述为基于 3.5 Flash 的反馈迭代版本,并强调更少 output tokens、更少 reasoning steps 和 tool calls。

  • 3.6 Flash 公布价格为输入 $1.50/百万、输出 $7.50/百万;这是 3.6 价格,不应误记为 3.5 的当前价格。

  • 3.5 Flash 的模型页规格另列为 1,048,576 输入 token、65,536 输出 token、支持思考、函数调用、代码执行、搜索 grounding 和预览版 computer use。

结果数据

指标Gemini 3.6 FlashGemini 3.5 Flash文章上下文
DeepSWE49%37%3.6 更高 precision、更少不必要代码编辑和执行循环
MLE Bench63.9%49.7%机器学习研究任务
OSWorld-Verified83.0%78.4%电脑使用;文章称 3.6 为 API 内置客户端工具
GDPval-AA v21,4211,349专业知识工作
Artificial Analysis 输出 token比 3.5 少 17%基线指数来源为 Artificial Analysis Index

结论

官方对照支持“3.6 相对 3.5 更高效且质量更好”的版本升级判断,尤其是在编码、ML 研究、电脑使用和知识工作上;但它只告诉我们 3.5 的相对基线,不足以判断 3.5 是否适合某个具体生产任务。

局限

  • 所有数字来自 Google 官方发布,第三方链接被引用但页面没有给出完整原始实验记录。

  • 不同 benchmark 的输入、工具、推理档位、运行次数和评分实现未在文章中完整公开。

  • 3.5 与 3.6 的价格、模型 ID、上下文和工具可用性可能随时间或套餐改变;应以目标 API 的当前模型页为准。

  • 3.6 的优势不能反向推导 3.5 与其他厂商模型的绝对排名。

复现步骤

  1. 固定 gemini-3.5-flash 模型版本、thinking level、上下文、工具和输出上限。

  2. 在同一代码仓库/电脑环境上运行 DeepSWE、MLE Bench、OSWorld 类任务,至少重复多次并记录成功率、token、工具调用和总耗时。

  3. 用与 3.6 相同的 harness 复测,避免把版本升级和测试框架升级混在一起。

  4. 将官方差值作为参考区间,另报告自己的置信区间、失败类型和成本。

来源摘录或观察(仅做合规短引)

Google 将 3.5 Flash 描述为 3.6 Flash 的直接反馈基线,并指出 3.6 “takes fewer reasoning steps and tool calls”。这能指导版本迁移评估,但不是 3.5 单独的端到端验收。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.5 Flash

在 Tabbit 中使用并对比模型

Gemini 3.5 Flash

相关测评

媒体Appwrite Blog / Appwrite Arena2026-05-20

Gemini 3.5 Flash:Appwrite Arena 技能上下文与 Agent 任务对照

社区Reddit / r/GeminiAI

Gemini 3.5 Flash:十组保存任务与五次重复的社区现场报告

Gemini 3.5 Flash

相关提示词

官方Google AI for Developers

Gemini 3.5 Flash:结构化提示、接地和 Agent 系统指令

官方Google AI for Developers2026-07-30

Gemini 3.5 Flash:思考等级与 Gemini API 配置