Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Gemini 3.5 Flash · 社区来源 · 个人体验

Gemini 3.5 Flash:十组保存任务与五次重复的社区现场报告

Reddit 用户在约 10 组保存任务上重复 Gemini 3.5 Flash 五次,报告真实任务均值低于旧版本;这是个人现场报告而非受控 benchmark。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源个人体验编辑日期 2026-09-20

测试条件速查

来源具体观察
采集于 2026-08-18;作者约 10 组保存任务,每组运行 5 次,未公开完整任务、prompt、snapshot 或评分脚本。
已公布条件
运行入口为 Reddit 用户自己的 GeminiAI 工作流;重复次数和模型版本由作者描述,未独立复测。

关键数据与适用场景

一句话结论

一位用户在自己的约 10 组保存评测上把 Gemini 3.5 Flash 平均运行 5 次,报告它在真实任务中常低于旧 Gemini 版本;这提醒迁移前要用自己的任务集复测,而不能只看官方榜单。

适用场景

  • 适合的任务:作为迁移前的风险提示、视觉任务和 Agent 任务的本地 A/B 评测参考。

  • 不适合的任务:直接把“第 13 名”外推为通用排名,或用帖子替代可审计的原始 benchmark。

  • 适用的模型版本:作者测试的 Gemini 3.5 Flash;具体 API 版本和 thinking 配置未公开。

  • 适用的客户端、Agent 或 API:作者使用自己的 OpenMark benchmarking tool;OpenMark 的公开服务说明支持自定义任务和多模型比较。

  • 推荐的推理档位和参数:未公开/无法核实。

测试环境

  • 任务集:作者保存的约 10 个评测,其中帖子强调一个视觉测试。

  • 重复次数:帖子称该视觉评测结果为 5 次运行的平均值,并表示类似结果出现在约 10 个 benchmark 中。

  • 对照:Gemini 3.1 Pro、Gemini 3.1 Flash Lite、Gemini 3 Flash 和 Gemini 3.5 Flash。

  • 工具:OpenMark;帖子没有公开任务 YAML、评分器、完整响应或费用日志。

输入/配置

  • 任务输入、系统提示、图像、模型路由、temperature、token 上限和评分规则未公开/无法核实。

  • 作者强调测试是自己的任务,并提醒 Gemini 版本可能高度依赖 prompt shape。

结果数据

  • 帖子称 Gemini 3.5 Flash 在一个视觉评测中排到第 13,而 Gemini 3.1 Pro 与 Gemini 3.1 Flash Lite 位列第 1、2,Gemini 3 Flash 也高于它。

  • 帖子称该视觉结果为 5 次运行平均值,并表示约 10 个保存评测出现类似旧版本更好的趋势。

  • 帖子没有给出每个模型的原始分数、样本数、置信区间、任务文本或完整排行榜,因此只能作为方向性现场报告。

结论

该报告与官方/专项 benchmark 的“3.5 Flash 在速度和工具任务有优势”并不矛盾:它测量的是单个用户的真实任务集,尤其包含视觉任务。可操作结论是迁移前固定同一提示、输入和评分器进行多次 A/B,先确认模型在自己的工作流里是否真的更好。

局限

  • 单一用户、未公开任务集和未公开评分器,无法独立复现。

  • “第 13 名”没有上下文样本、分数或统计显著性;不能当作全局模型排名。

  • 作者自称“约 10 个评测”但未给清单;视觉任务占比和难度未知。

  • OpenMark 公开主页主要展示平台条款和功能描述,未在本次采集到该用户的具体评测数据。

复现步骤

  1. 导出自己的 10 组真实任务,固定文本、图片、工具、模型版本、路由和评分器。

  2. 至少比较 Gemini 3.5 Flash、Gemini 3.1 Pro、Gemini 3.1 Flash Lite 和 Gemini 3 Flash,各运行 5 次。

  3. 保存逐次输出、成功标准、分数、token、耗时和失败原因,报告均值、标准差和任务分层结果。

  4. 对视觉、工具、代码和知识任务分别统计,避免一个极端视觉任务淹没总体均值。

来源摘录或观察(仅做合规短引)

作者的核心提醒是“benchmark first rather than assume newer = better”。这句话是个人经验而非定量结论,但很适合作为版本升级的验收门槛。

能支持的判断

  • 支持提醒迁移前用自己的任务集复测

不能支持的判断

  • 支持提醒迁移前用自己的任务集复测;不支持把个人均值变成 Gemini 3.5 Flash 的一般性排名或回归结论。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Reddit / r/GeminiAI · u/igoontotomboys · 原文发布日期 Unknown · 本站编辑日期 2026-09-20

打开原始来源

Gemini 3.5 Flash

在 Tabbit 中比较 Gemini 3.5 Flash

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Gemini 3.5 Flash 是什么:价格、生命周期与获取方式

说明 Gemini 3.5 Flash 的 1M 上下文、多模态工具、API 价格、legacy 状态、证据边界与迁移选择。

相关评测

Gemini 3.5 Flash:Google 官方后续发布中的效率与能力对照Google 后续发布把 Gemini 3.5 Flash 作为 Gemini 3.6 Flash 的对照基线;DeepSWE、MLE Bench、OSWorld-Verified 与 GDPval-AA v2 的差异属于官方 harness 结果。Gemini 3.5 Flash:Appwrite Arena 技能上下文与 Agent 任务对照Appwrite Arena 的 2026-05-20 运行记录显示,加载 Appwrite Skill 后 freeform 得分从 77.5% 升到 91.9%,说明上下文文档会改变 Agent 结果。Gemini 3.5 Flash:结构化提示、接地和 Agent 系统指令Google 官方建议把 Gemini 3.5 Flash 的目标、上下文、任务边界、输出格式和接地工具写成结构化提示,再用代表样本迭代。Gemini 3.5 Flash:思考等级与 Gemini API 配置官方 Thinking 文档说明 Gemini 3.5 Flash 的 effort 档位、多轮 parts/思维签名保留和 API 参数边界。