一位用户在自己的约 10 组保存评测上把 Gemini 3.5 Flash 平均运行 5 次,报告它在真实任务中常低于旧 Gemini 版本;这提醒迁移前要用自己的任务集复测,而不能只看官方榜单。
适合的任务:作为迁移前的风险提示、视觉任务和 Agent 任务的本地 A/B 评测参考。
不适合的任务:直接把“第 13 名”外推为通用排名,或用帖子替代可审计的原始 benchmark。
适用的模型版本:作者测试的 Gemini 3.5 Flash;具体 API 版本和 thinking 配置未公开。
适用的客户端、Agent 或 API:作者使用自己的 OpenMark benchmarking tool;OpenMark 的公开服务说明支持自定义任务和多模型比较。
推荐的推理档位和参数:未公开/无法核实。
任务集:作者保存的约 10 个评测,其中帖子强调一个视觉测试。
重复次数:帖子称该视觉评测结果为 5 次运行的平均值,并表示类似结果出现在约 10 个 benchmark 中。
对照:Gemini 3.1 Pro、Gemini 3.1 Flash Lite、Gemini 3 Flash 和 Gemini 3.5 Flash。
工具:OpenMark;帖子没有公开任务 YAML、评分器、完整响应或费用日志。
任务输入、系统提示、图像、模型路由、temperature、token 上限和评分规则未公开/无法核实。
作者强调测试是自己的任务,并提醒 Gemini 版本可能高度依赖 prompt shape。
帖子称 Gemini 3.5 Flash 在一个视觉评测中排到第 13,而 Gemini 3.1 Pro 与 Gemini 3.1 Flash Lite 位列第 1、2,Gemini 3 Flash 也高于它。
帖子称该视觉结果为 5 次运行平均值,并表示约 10 个保存评测出现类似旧版本更好的趋势。
帖子没有给出每个模型的原始分数、样本数、置信区间、任务文本或完整排行榜,因此只能作为方向性现场报告。
该报告与官方/专项 benchmark 的“3.5 Flash 在速度和工具任务有优势”并不矛盾:它测量的是单个用户的真实任务集,尤其包含视觉任务。可操作结论是迁移前固定同一提示、输入和评分器进行多次 A/B,先确认模型在自己的工作流里是否真的更好。
单一用户、未公开任务集和未公开评分器,无法独立复现。
“第 13 名”没有上下文样本、分数或统计显著性;不能当作全局模型排名。
作者自称“约 10 个评测”但未给清单;视觉任务占比和难度未知。
OpenMark 公开主页主要展示平台条款和功能描述,未在本次采集到该用户的具体评测数据。
导出自己的 10 组真实任务,固定文本、图片、工具、模型版本、路由和评分器。
至少比较 Gemini 3.5 Flash、Gemini 3.1 Pro、Gemini 3.1 Flash Lite 和 Gemini 3 Flash,各运行 5 次。
保存逐次输出、成功标准、分数、token、耗时和失败原因,报告均值、标准差和任务分层结果。
对视觉、工具、代码和知识任务分别统计,避免一个极端视觉任务淹没总体均值。
作者的核心提醒是“benchmark first rather than assume newer = better”。这句话是个人经验而非定量结论,但很适合作为版本升级的验收门槛。
Gemini 3.5 Flash