Gemini 3.8 Flash

Gemini 3.8 Flash 模型测评导航

汇总 Gemini 3.8 Flash 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。

11 条已核对来源的资料官方 · 媒体 · 社区

官方

1 条已核对来源的资料

媒体

6 条已核对来源的资料
媒体Artificial Analysis(官网模型页、方法论与发布文章;X 官方账号用于发现并核对发布帖)

Gemini 3.8 Flash:Artificial Analysis 智能、速度、价格与延迟

Gemini 3.8 Flash 的速度/延迟随推理档位明显变化:Artificial Analysis 当前 v4.3 页面记录 high 为 285.9 tok/s、首个答案 token 延迟 17.36 秒,medium 为 246.3 tok/s、8.29 秒,low 为 265.3 tok/s、0.78 秒;但 Intelligence Index 也从 2026-09-02 发布时的 v4.2 口径 59/57/52,变为当前 v4.3 快照的 41/40/34。两组数字不是同一版测试,不能直接比较成“。

媒体AI IQ(AIIQ,Liberated Software LLC)

Gemini 3.8 Flash:AI IQ 能力基准与任务边界

AIIQ 当前模型页给 Gemini 3.8 Flash AI IQ 125、排名 14/131,并列出 8 个源基准分数;其中学术推理覆盖 5/6、程序推理仅 1/6、可靠性 2/7,而抽象、数学和计算机使用分别是 0/3、0/5、0/6。因此,这个页面支持“在少数公开基准上表现强”的判断,不支持把综合 IQ 或缺失维度的估算当成完整能力实测。

媒体Vals AI

Vals AI Finance Agent v2:Gemini 3.8 Flash 的专业金融 Agent 基准

在 Vals AI Finance Agent v2 的整体任务上,Gemini 3.8 Flash 的 Partial Credit 为 61.44% ± 0.13,在页面列出的 58 个系统中排名第 1;严格 All-Pass 为 49.69% ± 0.42,排名第 2。它适合评估“从公开公司文件中检索、核对并完成多步金融分析”的 Agent,不应解读为通用智能或生产投研准确率。

媒体SimpleBench 官方榜单与项目

SimpleBench:Gemini 3.8 Flash 的日常推理与语言陷阱基准

SimpleBench 当前榜单把 Gemini 3.8 Flash 列为 第 4 名、82.4%(AVG@5);它低于最高人类分数 95.4% 和 Claude Fable 5.1 的 86.6%,也低于人类基线 83.7%(低 1.3 个百分点)。这说明它在该基准的日常物理、时间、社会常识和语言陷阱题上接近但尚未达到该样本的人类平均水平,不能外推为通用推理能力排名。

媒体Vals AI

Gemini 3.8 Flash:Vals AI Harvey 法律 Agent 基准复测

在 Vals AI 的 Harvey's Legal Agent Benchmark v1 held-out test set 上,Gemini 3.8 Flash 的严格 Task Pass Rate 为 10.00% ± 2.42%,59 个系统中排名第 11;页面同时显示 Criteria Pass Rate 为 90.19% ± 0.36%。它能通过大部分单项标准,但只有少数任务做到全部标准通过,不能把 10% 解读为通用法律能力或可直接交付的法律准确率。

媒体Cursor / Anysphere(CursorBench 3.2)

Gemini 3.8 Flash:CursorBench 3.2 多文件 Agent 任务与成本边界

在 CursorBench 3.2 的当前榜单中,Gemini 3.8 Flash High 为 69.2%(列出的 60 个配置中第 9),平均每题 $2.38、81,524 tokens、161 steps;Medium 为 67.0%(第 14),每题 $1.93、61,603 tokens、136 steps。相较同页 Gemini 3.7 Flash,3.8 在 High/Medium 分别高 7.6/8.0 个百分点,但也几乎消耗两倍 token 和成本;这只说明其在 Cursor 的模糊多文件 Age。

社区

4 条已核对来源的资料
社区X.com(Twitter),@arena(Arena.ai 官方账号)

Arena.ai:Gemini 3.8 Flash (High) 的 Agent、文本与 WebDev 排名

Arena.ai 的 2026-09-03 发布快照中,Gemini 3.8 Flash (High) 在 Agent Arena 排名第 14(净改进 +5.94%)、Text Arena 排名第 7(1494 分)、Code Arena: WebDev 排名第 18(1567 分);它在 Agent 任务的成本/效果前沿具有竞争力,但这些是 Arena 特定任务和投票窗口的结果,不能外推为所有任务的综合排名。

社区Reddit,r/googleantigravity

Gemini 3.8 Flash:Reddit 严肃代码仓库短任务与自主边界

作者在 Antigravity 中用 Gemini 3.8 Flash 的 high 档处理严肃代码仓库里的刻意模糊短任务约一小时,认为它比 3.7 Flash 更会规划、更能根据真实代码工作,也更少自动产生幻觉;但作者不信发布基准,认为它不适合长时段、完全自主的复杂任务,且在理解模糊意图和遵守边界方面仍落后于 Sol、Luna 和 GLM 5.3 系列。

社区X.com(Twitter)

Gemini 3.8 Flash:四模型 3D 火箭发射对比与生成边界

作者把 Gemini 3.8 Flash、GPT 5.6 Sol、Claude Opus 5 和 Kimi K3 放在同一份简述下,各生成一次 3D 火箭发射场景。作者认为 Flash 确实做出了可运行的场景,但在画面几何、烟雾表现和帧稳定性上输掉了这次对比;帖子还记录了 $2.30 和 Goal Mode 30 分钟的投入并未挽救结果。

社区Reddit / r/GeminiAI

Gemini 3.8 Flash:同一创作提示的跨版本游戏生成对比

一位用户在 Google Antigravity 中用同一个零样本创作提示,让 Gemini 3.1 Pro、3.6 Flash、3.7 Flash 和 3.8 Flash 制作融合 Y City 与 Minecraft 的简单游戏。作者感觉 3.7 和 3.8 Flash 工作时间更长、更加自主,但在这种宽松创意提示下,3.6 Flash 反而更准确地抓住意图;因此 3.8 Flash 的自主性提升不等于创作意图命中率提升。

Gemini 3.8 Flash

在 Tabbit 中使用并对比模型

汇总 Gemini 3.8 Flash 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。