Gemini 3.5 Flash

Gemini 3.5 Flash · 测评与证据

Gemini 3.5 Flash,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

Google 后续发布把 Gemini 3.5 Flash 作为 Gemini 3.6 Flash 的对照基线;DeepSWE、MLE Bench、OSWorld-Verified 与 GDPval-AA v2 的差异属于官方 harness 结果。

Google Blog · 查看证据

Reddit 用户在约 10 组保存任务上重复 Gemini 3.5 Flash 五次,报告真实任务均值低于旧版本;这是个人现场报告而非受控 benchmark。

Reddit / r/GeminiAI · 查看证据

完整测评与相关内容

模型深度阅读

总览 · 简体中文

Gemini 3.5 Flash 是什么:价格、生命周期与获取方式

说明 Gemini 3.5 Flash 的 1M 上下文、多模态工具、API 价格、legacy 状态、证据边界与迁移选择。

精选证据

官方厂商自报

Gemini 3.5 Flash:Google 官方后续发布中的效率与能力对照

Google 后续发布把 Gemini 3.5 Flash 作为 Gemini 3.6 Flash 的对照基线;DeepSWE、MLE Bench、OSWorld-Verified 与 GDPval-AA v2 的差异属于官方 harness 结果。

来源Google Blog
原文日期2026-07-21
采集2026-09-20
来源具体观察
2026-07-21 Google 发布;比较 Gemini 3.6 Flash 与 3.5 Flash 的官方任务结果。
已公布条件
页面报告 3.6 在 DeepSWE、MLE Bench、OSWorld-Verified 和 GDPval-AA v2 上超过 3.5,但未提供 3.5 独立复测 harness。
能力
媒体 / 基准方独立测量

Gemini 3.5 Flash:Appwrite Arena 技能上下文与 Agent 任务对照

Appwrite Arena 的 2026-05-20 运行记录显示,加载 Appwrite Skill 后 freeform 得分从 77.5% 升到 91.9%,说明上下文文档会改变 Agent 结果。

来源Appwrite Blog / Appwrite Arena
原文日期2026-05-20
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
Appwrite Arena,2026-05-20 运行;报告 freeform、MCP/工具、多模态和速度维度。
已公布条件
Skill 上下文使 freeform 从 77.5% 提升至 91.9%;任务集与运行配置属于 Appwrite Arena。
编程Agent
社区个人体验

Gemini 3.5 Flash:十组保存任务与五次重复的社区现场报告

Reddit 用户在约 10 组保存任务上重复 Gemini 3.5 Flash 五次,报告真实任务均值低于旧版本;这是个人现场报告而非受控 benchmark。

来源Reddit / r/GeminiAI
原文日期未知
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
采集于 2026-08-18;作者约 10 组保存任务,每组运行 5 次,未公开完整任务、prompt、snapshot 或评分脚本。
已公布条件
运行入口为 Reddit 用户自己的 GeminiAI 工作流;重复次数和模型版本由作者描述,未独立复测。
能力

全部来源

全部来源

3 / 3
官方厂商自报

Gemini 3.5 Flash:Google 官方后续发布中的效率与能力对照

Google 后续发布把 Gemini 3.5 Flash 作为 Gemini 3.6 Flash 的对照基线;DeepSWE、MLE Bench、OSWorld-Verified 与 GDPval-AA v2 的差异属于官方 harness 结果。

来源Google Blog
原文日期2026-07-21
采集2026-09-20
来源具体观察
2026-07-21 Google 发布;比较 Gemini 3.6 Flash 与 3.5 Flash 的官方任务结果。
已公布条件
页面报告 3.6 在 DeepSWE、MLE Bench、OSWorld-Verified 和 GDPval-AA v2 上超过 3.5,但未提供 3.5 独立复测 harness。
能力
媒体 / 基准方独立测量

Gemini 3.5 Flash:Appwrite Arena 技能上下文与 Agent 任务对照

Appwrite Arena 的 2026-05-20 运行记录显示,加载 Appwrite Skill 后 freeform 得分从 77.5% 升到 91.9%,说明上下文文档会改变 Agent 结果。

来源Appwrite Blog / Appwrite Arena
原文日期2026-05-20
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
Appwrite Arena,2026-05-20 运行;报告 freeform、MCP/工具、多模态和速度维度。
已公布条件
Skill 上下文使 freeform 从 77.5% 提升至 91.9%;任务集与运行配置属于 Appwrite Arena。
编程Agent
社区个人体验

Gemini 3.5 Flash:十组保存任务与五次重复的社区现场报告

Reddit 用户在约 10 组保存任务上重复 Gemini 3.5 Flash 五次,报告真实任务均值低于旧版本;这是个人现场报告而非受控 benchmark。

来源Reddit / r/GeminiAI
原文日期未知
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
采集于 2026-08-18;作者约 10 组保存任务,每组运行 5 次,未公开完整任务、prompt、snapshot 或评分脚本。
已公布条件
运行入口为 Reddit 用户自己的 GeminiAI 工作流;重复次数和模型版本由作者描述,未独立复测。
能力

Gemini 3.5 Flash

在 Tabbit 中比较 Gemini 3.5 Flash

客户端中的模型、功能和权限以当前账户为准。