Arena.ai 的 2026-09-03 发布快照中,Gemini 3.8 Flash (High) 在 Agent Arena 排名第 14(净改进 +5.94%)、Text Arena 排名第 7(1494 分)、Code Arena: WebDev 排名第 18(1567 分);它在 Agent 任务的成本/效果前沿具有竞争力,但这些是 Arena 特定任务和投票窗口的结果,不能外推为所有任务的综合排名。
适合观察的任务:调用网页、文件系统和终端工具的真实世界长程 Agent;文本到文本的开放任务;需要多步推理和工具使用的 WebDev/前端开发工作流。
不适合直接推断的任务:通用知识、非 WebDev 的软件工程、生产系统稳定性、延迟和端到端成功率;Arena 页面没有给出这些任务的统一结论。
适用的模型版本:Gemini 3.8 Flash (High)。不要把结论延伸到 Gemini 3.8 Flash Cyber、其他推理档位或未标注快照。
适用的客户端、Agent 或 API:Arena 的 Agent Arena、Text Arena 与 Code Arena: WebDev 评测环境;不是 Gemini App、Claude Code 或某个自建 harness 的端到端分数。
推荐参数:原帖未公开 temperature、system prompt、工具 schema、重试策略或完整采样配置;复测时应固定这些变量,不能自行补齐为“默认配置”。
Agent Arena:平台描述为衡量模型如何编排工具完成真实世界 Agent 任务,使用网页、文件系统和终端工具;核心信号包括 Confirmed Success、Praise vs. Complaint、Steerability、Bash Recovery 和 Tool Hallucination。
Text Arena:平台描述为文本到文本任务,覆盖数学、编码、创意写作等开放领域;X 首发帖报告 Gemini 3.8 Flash (High) 1494 分、排名第 7。
Code Arena: WebDev:平台描述为前端 Web 开发任务,包含需要多步推理和工具使用的 Agent 编码工作流;X 首发帖报告 1567 分、排名第 18。
版本与价格:Arena 将模型标为 Google · Proprietary;输入/输出价格为每百万 token $0.75 / $3.75。
X 帖子没有公开 Agent Arena 的题目、原始 prompt、模型调用次数、随机种子或完整 harness 配置。
2026-09-03 的 Agent 帖子给出每任务中位成本 $0.22;同一帖将 Gemini 3.8 Flash (High) 的 +5.94% 与 Grok 4.5 的 +6.17% / $0.39、GLM 5.2 (Max) 的 +6.23% / $0.44 并列比较。
价格是 Arena 页面记录的模型单价与平台成本估计,不是对所有 Provider、缓存命中率或用户账单的承诺。
| 评测 | Gemini 3.8 Flash (High) | 帖子中的对照 | 口径 |
|---|---|---|---|
| Agent Arena | #14;净改进 +5.94% | Gemini 3.7 Flash (High):#32;+0.84% | X 首发帖 |
| Text Arena | #7;1494 分 | Claude Opus 5 (High):#8;1492 分;Gemini 3.7:#10;1491 分 | X 首发帖 |
| Code Arena: WebDev | #18;1567 分 | X 帖子未给出相邻模型的完整表格 | X 首发帖 |
| Agent 成本/效果 | +5.94% / $0.22 每任务 | Grok 4.5:+6.17% / $0.39;GLM 5.2 (Max):+6.23% / $0.44 | X 帕累托帖 |
Agent 的五项信号对比(X 的 3.8 对 3.7):
Praise vs. Complaint:+14.78% vs -1.60%;
Confirmed Success:+11.12% vs +9.80%;
Bash Recovery:+4.46% vs +0.61%;
Steerability:-1.43% vs -5.38%;
Tool Hallucination:帖子称两者均未显示问题。
排行榜是动态页面,采集日显示的时间窗口已不同于首发帖:
| 页面快照 | 页面总样本 | Gemini 3.8 Flash (High) | Gemini 3.7 Flash (High) |
|---|---|---|---|
| Agent Arena(页面标注 Sep 6, 2026) | 2,285,256 sessions;59 models | #17;净改进 +5.47% ±1.92%;10,104 sessions;P50 成本 $0.22;P50 输出 19.3K | #35;+0.43% ±0.92%;24,413 sessions |
| Text Arena(页面标注 Sep 3, 2026) | 7,999,020 votes;400 models | #8;1494 ±9;5,125 votes;标注 Preliminary | #11;1491 ±8;5,682 votes;标注 Preliminary |
| Code Arena: WebDev(页面标注 Sep 5, 2026) | 650,961 votes;126 models | #21;1567;±12 rank spread;2,727 votes;标注 Preliminary | #17;1587;±12 rank spread;3,008 votes;标注 Preliminary |
因此,X 帖子中的 #14 / #7 / #18 是发布时点快照;当前页的 #17 / #8 / #21 是后续刷新结果,不能混写成同一时刻的排名。排名变化本身也说明该评测会随新增会话和投票移动。
Arena 的发布快照支持三个有限判断:
在平台的长程 Agent 任务中,Gemini 3.8 Flash (High) 相比 Gemini 3.7 Flash (High) 有明显跃升,且以 $0.22 的任务中位成本进入 Arena 标注的成本/效果前沿。
Text Arena 的 1494 分在首发时进入前十,并高于当时帖子列出的 Claude Opus 5 (High) 与 Gemini 3.7 Flash (High);这只表示文本 Arena 的该窗口结果。
WebDev 的 1567 分属于可用的中上位置,但不是前列;刷新后的页面中 Gemini 3.7 Flash 反而位于其上,不能把“Agent 提升”改写成“所有编码任务都提升”。
Arena 是社区投票与真实用户任务信号,不是受控实验室基准;X 帖子没有公开完整题集、配对随机化、是否严格盲法、提示词、温度、重试和评分原始日志。文件名中的“盲测”不应被理解为已验证的双盲实验设计。
三个榜单的样本单位和时间窗口不同:Agent 使用 sessions,Text/WebDev 使用 votes;页面日期分别为 9 月 6 日、9 月 3 日和 9 月 5 日。
X 首发排名与采集日页面已出现漂移,说明排名会随样本变化;应把它当作带日期的快照,而非永久名次。
Agent 的净改进、信号百分比和成本是 Arena 的平台口径,不等于某个团队使用相同模型、工具和上下文时的成功率或账单。
Text/WebDev 行中部分模型标注 Preliminary,且页面展示置信区间或 rank spread;相邻名次的微小差异不应解读为稳定胜负。
结果只覆盖 Agent、文本和 WebDev 三类 Arena 任务;不能据此评价视觉理解、视频、多语言、安全性或所有软件工程工作。
保存三条 X 原帖和三个排行榜的访问日期,分别记录页面标注日期、总 sessions/votes、模型行、价格和置信区间;不要把刷新后的名次替换首发名次。
若做独立复测,固定 Gemini 3.8 Flash (High) 的模型快照、system prompt、工具 schema、上下文上限、temperature、重试/停止条件与成本计算方式。
按 Agent、文本、WebDev 分开建立任务集;Agent 任务至少覆盖网页、文件系统、终端和错误恢复,WebDev 任务单独做功能验收与视觉回归。
每项任务保存原始输入、工具轨迹、最终产物、人工判定和 token/成本;报告成功率与置信区间,不只复述 Arena 名次。
对 Gemini 3.7 Flash (High) 做同条件对照,并将结果限制在对应任务集;不要将 Arena 的排名当作所有任务的模型总分。
@arena 首发帖直接写明 Gemini 3.8 Flash (High) 首次进入 Agent Arena、Text Arena 和 Code Arena: WebDev,并给出 #14 / +5.94%、1494 / #7、1567 / #18。
@arena 的 Agent 指标帖给出与 Gemini 3.7 Flash (High) 的五项信号差异,并解释 Agent Arena 使用网页、文件系统和终端工具衡量真实世界长时程任务。
@arena 的帕累托帖给出 $0.22 每任务及与 Grok 4.5、GLM 5.2 (Max) 的成本/净改进对比。
采集日直接打开的 Arena 页面提供了后续动态快照:Agent 2,285,256 sessions/59 models;Text 7,999,020 votes/400 models;WebDev 650,961 votes/126 models,以及 Gemini 3.8 Flash (High) 的当前行数据。
X 首发帖将其概括为 “+5.94% net improvement”,帕累托帖称其进入 Agent Arena 的成本/效果前沿;这两句话只能支持对应 Arena 窗口的结论,不能替代跨任务复测。
Gemini 3.8 Flash