Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区Gemini 3.8 Flash

Arena.ai:Gemini 3.8 Flash (High) 的 Agent、文本与 WebDev 排名

原始来源

X.com(Twitter),@arena(Arena.ai 官方账号)

作者Arena.ai

原文日期2026-09-03

Tabbit 整理2026-09-08

查看原文

一句话结论

Arena.ai 的 2026-09-03 发布快照中,Gemini 3.8 Flash (High) 在 Agent Arena 排名第 14(净改进 +5.94%)、Text Arena 排名第 7(1494 分)、Code Arena: WebDev 排名第 18(1567 分);它在 Agent 任务的成本/效果前沿具有竞争力,但这些是 Arena 特定任务和投票窗口的结果,不能外推为所有任务的综合排名。

适用场景

  • 适合观察的任务:调用网页、文件系统和终端工具的真实世界长程 Agent;文本到文本的开放任务;需要多步推理和工具使用的 WebDev/前端开发工作流。

  • 不适合直接推断的任务:通用知识、非 WebDev 的软件工程、生产系统稳定性、延迟和端到端成功率;Arena 页面没有给出这些任务的统一结论。

  • 适用的模型版本:Gemini 3.8 Flash (High)。不要把结论延伸到 Gemini 3.8 Flash Cyber、其他推理档位或未标注快照。

  • 适用的客户端、Agent 或 API:Arena 的 Agent Arena、Text Arena 与 Code Arena: WebDev 评测环境;不是 Gemini App、Claude Code 或某个自建 harness 的端到端分数。

  • 推荐参数:原帖未公开 temperature、system prompt、工具 schema、重试策略或完整采样配置;复测时应固定这些变量,不能自行补齐为“默认配置”。

测试环境

  • Agent Arena:平台描述为衡量模型如何编排工具完成真实世界 Agent 任务,使用网页、文件系统和终端工具;核心信号包括 Confirmed Success、Praise vs. Complaint、Steerability、Bash Recovery 和 Tool Hallucination。

  • Text Arena:平台描述为文本到文本任务,覆盖数学、编码、创意写作等开放领域;X 首发帖报告 Gemini 3.8 Flash (High) 1494 分、排名第 7。

  • Code Arena: WebDev:平台描述为前端 Web 开发任务,包含需要多步推理和工具使用的 Agent 编码工作流;X 首发帖报告 1567 分、排名第 18。

  • 版本与价格:Arena 将模型标为 Google · Proprietary;输入/输出价格为每百万 token $0.75 / $3.75。

输入/配置

  • X 帖子没有公开 Agent Arena 的题目、原始 prompt、模型调用次数、随机种子或完整 harness 配置。

  • 2026-09-03 的 Agent 帖子给出每任务中位成本 $0.22;同一帖将 Gemini 3.8 Flash (High) 的 +5.94% 与 Grok 4.5 的 +6.17% / $0.39、GLM 5.2 (Max) 的 +6.23% / $0.44 并列比较。

  • 价格是 Arena 页面记录的模型单价与平台成本估计,不是对所有 Provider、缓存命中率或用户账单的承诺。

结果数据

X 首发快照(2026-09-03)

评测Gemini 3.8 Flash (High)帖子中的对照口径
Agent Arena#14;净改进 +5.94%Gemini 3.7 Flash (High):#32;+0.84%X 首发帖
Text Arena#7;1494 分Claude Opus 5 (High):#8;1492 分;Gemini 3.7:#10;1491 分X 首发帖
Code Arena: WebDev#18;1567 分X 帖子未给出相邻模型的完整表格X 首发帖
Agent 成本/效果+5.94% / $0.22 每任务Grok 4.5:+6.17% / $0.39;GLM 5.2 (Max):+6.23% / $0.44X 帕累托帖

Agent 的五项信号对比(X 的 3.8 对 3.7):

  • Praise vs. Complaint:+14.78% vs -1.60%;

  • Confirmed Success:+11.12% vs +9.80%;

  • Bash Recovery:+4.46% vs +0.61%;

  • Steerability:-1.43% vs -5.38%;

  • Tool Hallucination:帖子称两者均未显示问题。

采集日可见的排行榜刷新快照

排行榜是动态页面,采集日显示的时间窗口已不同于首发帖:

页面快照页面总样本Gemini 3.8 Flash (High)Gemini 3.7 Flash (High)
Agent Arena(页面标注 Sep 6, 2026)2,285,256 sessions;59 models#17;净改进 +5.47% ±1.92%;10,104 sessions;P50 成本 $0.22;P50 输出 19.3K#35;+0.43% ±0.92%;24,413 sessions
Text Arena(页面标注 Sep 3, 2026)7,999,020 votes;400 models#8;1494 ±9;5,125 votes;标注 Preliminary#11;1491 ±8;5,682 votes;标注 Preliminary
Code Arena: WebDev(页面标注 Sep 5, 2026)650,961 votes;126 models#21;1567;±12 rank spread;2,727 votes;标注 Preliminary#17;1587;±12 rank spread;3,008 votes;标注 Preliminary

因此,X 帖子中的 #14 / #7 / #18 是发布时点快照;当前页的 #17 / #8 / #21 是后续刷新结果,不能混写成同一时刻的排名。排名变化本身也说明该评测会随新增会话和投票移动。

结论

Arena 的发布快照支持三个有限判断:

  1. 在平台的长程 Agent 任务中,Gemini 3.8 Flash (High) 相比 Gemini 3.7 Flash (High) 有明显跃升,且以 $0.22 的任务中位成本进入 Arena 标注的成本/效果前沿。

  2. Text Arena 的 1494 分在首发时进入前十,并高于当时帖子列出的 Claude Opus 5 (High) 与 Gemini 3.7 Flash (High);这只表示文本 Arena 的该窗口结果。

  3. WebDev 的 1567 分属于可用的中上位置,但不是前列;刷新后的页面中 Gemini 3.7 Flash 反而位于其上,不能把“Agent 提升”改写成“所有编码任务都提升”。

局限

  • Arena 是社区投票与真实用户任务信号,不是受控实验室基准;X 帖子没有公开完整题集、配对随机化、是否严格盲法、提示词、温度、重试和评分原始日志。文件名中的“盲测”不应被理解为已验证的双盲实验设计。

  • 三个榜单的样本单位和时间窗口不同:Agent 使用 sessions,Text/WebDev 使用 votes;页面日期分别为 9 月 6 日、9 月 3 日和 9 月 5 日。

  • X 首发排名与采集日页面已出现漂移,说明排名会随样本变化;应把它当作带日期的快照,而非永久名次。

  • Agent 的净改进、信号百分比和成本是 Arena 的平台口径,不等于某个团队使用相同模型、工具和上下文时的成功率或账单。

  • Text/WebDev 行中部分模型标注 Preliminary,且页面展示置信区间或 rank spread;相邻名次的微小差异不应解读为稳定胜负。

  • 结果只覆盖 Agent、文本和 WebDev 三类 Arena 任务;不能据此评价视觉理解、视频、多语言、安全性或所有软件工程工作。

复现步骤

  1. 保存三条 X 原帖和三个排行榜的访问日期,分别记录页面标注日期、总 sessions/votes、模型行、价格和置信区间;不要把刷新后的名次替换首发名次。

  2. 若做独立复测,固定 Gemini 3.8 Flash (High) 的模型快照、system prompt、工具 schema、上下文上限、temperature、重试/停止条件与成本计算方式。

  3. 按 Agent、文本、WebDev 分开建立任务集;Agent 任务至少覆盖网页、文件系统、终端和错误恢复,WebDev 任务单独做功能验收与视觉回归。

  4. 每项任务保存原始输入、工具轨迹、最终产物、人工判定和 token/成本;报告成功率与置信区间,不只复述 Arena 名次。

  5. 对 Gemini 3.7 Flash (High) 做同条件对照,并将结果限制在对应任务集;不要将 Arena 的排名当作所有任务的模型总分。

原始证据与数据

  • @arena 首发帖直接写明 Gemini 3.8 Flash (High) 首次进入 Agent Arena、Text Arena 和 Code Arena: WebDev,并给出 #14 / +5.94%、1494 / #7、1567 / #18。

  • @arena 的 Agent 指标帖给出与 Gemini 3.7 Flash (High) 的五项信号差异,并解释 Agent Arena 使用网页、文件系统和终端工具衡量真实世界长时程任务。

  • @arena 的帕累托帖给出 $0.22 每任务及与 Grok 4.5、GLM 5.2 (Max) 的成本/净改进对比。

  • 采集日直接打开的 Arena 页面提供了后续动态快照:Agent 2,285,256 sessions/59 models;Text 7,999,020 votes/400 models;WebDev 650,961 votes/126 models,以及 Gemini 3.8 Flash (High) 的当前行数据。

来源摘录或观察(仅做合规短引)

X 首发帖将其概括为 “+5.94% net improvement”,帕累托帖称其进入 Agent Arena 的成本/效果前沿;这两句话只能支持对应 Arena 窗口的结论,不能替代跨任务复测。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.8 Flash

在 Tabbit 中使用并对比模型

Gemini 3.8 Flash

相关测评

官方Google Blog(The Keyword)2026-09-02

Gemini 3.8 Flash:Google 官方发布基准与复现边界

媒体Artificial Analysis(官网模型页、方法论与发布文章;X 官方账号用于发现并核对发布帖)2026-09-02

Gemini 3.8 Flash:Artificial Analysis 智能、速度、价格与延迟

媒体AI IQ(AIIQ,Liberated Software LLC)2026-09-02

Gemini 3.8 Flash:AI IQ 能力基准与任务边界

媒体Vals AI2026-09-05

Vals AI Finance Agent v2:Gemini 3.8 Flash 的专业金融 Agent 基准

Gemini 3.8 Flash

相关提示词

官方Google AI for Developers / Google DeepMind2026-09-02

Gemini 3.8 Flash:Google 官方模型参数与 API 配置

官方Google AI for Developers2026-06-10

Gemini 3.8 Flash:Google 官方结构化提示与 Agent 工作流

官方Google AI for Developers

Gemini 3.8 Flash:Google 官方函数调用配置与工具工作流

官方Google AI for Developers2026-09-02

Gemini 3.8 Flash:Google 官方结构化输出配置