Gemini 3.5 Flash · 社区来源 · 个人体验
Reddit 用户在约 10 组保存任务上重复 Gemini 3.5 Flash 五次,报告真实任务均值低于旧版本;这是个人现场报告而非受控 benchmark。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
一位用户在自己的约 10 组保存评测上把 Gemini 3.5 Flash 平均运行 5 次,报告它在真实任务中常低于旧 Gemini 版本;这提醒迁移前要用自己的任务集复测,而不能只看官方榜单。
适合的任务:作为迁移前的风险提示、视觉任务和 Agent 任务的本地 A/B 评测参考。
不适合的任务:直接把“第 13 名”外推为通用排名,或用帖子替代可审计的原始 benchmark。
适用的模型版本:作者测试的 Gemini 3.5 Flash;具体 API 版本和 thinking 配置未公开。
适用的客户端、Agent 或 API:作者使用自己的 OpenMark benchmarking tool;OpenMark 的公开服务说明支持自定义任务和多模型比较。
推荐的推理档位和参数:未公开/无法核实。
任务集:作者保存的约 10 个评测,其中帖子强调一个视觉测试。
重复次数:帖子称该视觉评测结果为 5 次运行的平均值,并表示类似结果出现在约 10 个 benchmark 中。
对照:Gemini 3.1 Pro、Gemini 3.1 Flash Lite、Gemini 3 Flash 和 Gemini 3.5 Flash。
工具:OpenMark;帖子没有公开任务 YAML、评分器、完整响应或费用日志。
任务输入、系统提示、图像、模型路由、temperature、token 上限和评分规则未公开/无法核实。
作者强调测试是自己的任务,并提醒 Gemini 版本可能高度依赖 prompt shape。
帖子称 Gemini 3.5 Flash 在一个视觉评测中排到第 13,而 Gemini 3.1 Pro 与 Gemini 3.1 Flash Lite 位列第 1、2,Gemini 3 Flash 也高于它。
帖子称该视觉结果为 5 次运行平均值,并表示约 10 个保存评测出现类似旧版本更好的趋势。
帖子没有给出每个模型的原始分数、样本数、置信区间、任务文本或完整排行榜,因此只能作为方向性现场报告。
该报告与官方/专项 benchmark 的“3.5 Flash 在速度和工具任务有优势”并不矛盾:它测量的是单个用户的真实任务集,尤其包含视觉任务。可操作结论是迁移前固定同一提示、输入和评分器进行多次 A/B,先确认模型在自己的工作流里是否真的更好。
单一用户、未公开任务集和未公开评分器,无法独立复现。
“第 13 名”没有上下文样本、分数或统计显著性;不能当作全局模型排名。
作者自称“约 10 个评测”但未给清单;视觉任务占比和难度未知。
OpenMark 公开主页主要展示平台条款和功能描述,未在本次采集到该用户的具体评测数据。
导出自己的 10 组真实任务,固定文本、图片、工具、模型版本、路由和评分器。
至少比较 Gemini 3.5 Flash、Gemini 3.1 Pro、Gemini 3.1 Flash Lite 和 Gemini 3 Flash,各运行 5 次。
保存逐次输出、成功标准、分数、token、耗时和失败原因,报告均值、标准差和任务分层结果。
对视觉、工具、代码和知识任务分别统计,避免一个极端视觉任务淹没总体均值。
作者的核心提醒是“benchmark first rather than assume newer = better”。这句话是个人经验而非定量结论,但很适合作为版本升级的验收门槛。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Reddit / r/GeminiAI · u/igoontotomboys · 原文发布日期 Unknown · 本站编辑日期 2026-09-20
打开原始来源Gemini 3.5 Flash
下载 Tabbit 客户端后检查模型可用性