Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区Gemini 3.8 Flash

Gemini 3.8 Flash:同一创作提示的跨版本游戏生成对比

原始来源

Reddit / r/GeminiAI

作者u/UncleSrooge

原文日期2026-09-08

Tabbit 整理2026-09-08

查看原文

一句话结论

一位用户在 Google Antigravity 中用同一个零样本创作提示,让 Gemini 3.1 Pro、3.6 Flash、3.7 Flash 和 3.8 Flash 制作融合 Y City 与 Minecraft 的简单游戏。作者感觉 3.7 和 3.8 Flash 工作时间更长、更加自主,但在这种宽松创意提示下,3.6 Flash 反而更准确地抓住意图;因此 3.8 Flash 的自主性提升不等于创作意图命中率提升。

适用场景

  • 适合观察的任务:需要模型把宽松、开放式需求转成可运行原型的创作型 Agent 任务,以及同一提示下的版本对比。

  • 不适合直接推断的任务:通用游戏开发能力、代码质量、长上下文能力、速度或生产级成功率;原帖没有公开详细产物、运行日志或评分表。

  • 适用的模型版本:作者明确比较 Gemini 3.8 Flash 与 Gemini 3.7 Flash、3.6 Flash、3.1 Pro;不能延伸到其他 Gemini 版本、推理档位或 provider。

  • 适用的客户端、Agent 或 API:Google Antigravity;没有公开 API 模型 ID、工具配置、权限、上下文限制或采样参数。

  • 推荐的推理档位和参数:未提供;“工作更长”是作者对会话行为的描述,不能当成可复用的时间预算或 effort 配置。

测试环境、输入与观察

  • 环境:Google Antigravity;作者称这是一次 empirical test,并比较了四个当时可用的模型。

  • 输入:同一个 zero-shot prompt,要求创建一个融合 Y City 与 Minecraft 的简单游戏。完整 prompt 未公开,作者也说明无法分享详细结果。

  • 对比:Gemini 3.1 Pro、Gemini 3.6 Flash、Gemini 3.7 Flash、Gemini 3.8 Flash 使用同一任务描述;原帖没有给出每个模型的单独运行次数或完整输出。

  • 观察:作者认为 Gemini 3.7 和 3.8 Flash “remain working longer and autonomously”;但在宽松创意需求的理解和准确性上,作者更认可 Gemini 3.6 Flash,且认为 3.1 Pro 表现令人失望。

  • 旁证:唯一一条评论认为,更强的自主性有时会让模型偏离用户真正要求;这只是评论者观点,不计入主帖结果。

原始数据

观察维度原帖主帖公开内容可支持的有限判断
客户端Google Antigravity结论只适用于该客户端会话,不能直接等同于 API 行为
任务用同一个 zero-shot prompt 创建 Y City + Minecraft 简单游戏存在一次同任务跨版本创作对比
Gemini 3.7 Flash与 3.8 Flash 一样,作者感觉工作更久、更自主只支持方向性的会话行为观察,不支持时长或完成率差异
Gemini 3.8 Flash工作更久、更自主,但作者未认为它最准确地抓住宽松创意提示自主执行和创作意图命中是两个不同维度
Gemini 3.6 Flash作者认为它对松散创意提示的理解和准确性更好支持该作者在该任务上的主观偏好,不支持通用排名
量化数据无 token、耗时、分数、重试、完整输出或代码 diff不能计算速度、成本、代码质量或成功率

结论

  1. 这条体验提供了与既有代码仓库报告不同的信号:任务不是修复真实仓库,而是把模糊的创作意图转成游戏原型。

  2. 在作者的同任务比较中,Gemini 3.8 Flash 与 3.7 Flash 的优势是更长时间、更加自主地工作;但作者把“是否准确理解宽松创意提示”判给了 3.6 Flash。

  3. 因此,对开放式创作 Agent,不能只用运行轮数、自主工具调用或持续工作时间衡量升级效果;还要单独评价目标意图、主题融合和产物是否符合用户预期。

  4. 这不是受控评测:原帖没有详细 prompt、四个模型的独立结果、评分标准或日志,“3.6 更懂需求”只能作为复测假设。

自报边界与局限

  • 作者没有公开游戏的详细结果,只给出关键 takeaway;无法从文字判断四个版本的代码是否可运行、功能是否完整或画面质量如何。

  • 没有公开模型快照、推理档位、系统提示、工具权限、上下文长度、temperature、运行次数、耗时或 token,因此不能把“工作更久”解释成更高的服务端延迟或更大的预算。

  • “同一个 zero-shot prompt”是作者的声明,但 prompt 正文和各模型上下文状态不可见,无法完全核验条件一致性。

  • 3.7 与 3.8 的对比只有作者的合并描述,没有逐模型输出;不能据此断言 3.8 比 3.7 更差或更好,只能说作者未报告 3.8 在意图理解上的额外优势。

  • 作者把视频链接作为 walkthrough,但本文不从视频画面推导额外结论;若要复测,应同时保存视频、代码和每个模型的原始会话。

  • 结论来自一个用户、一次任务和主观判断,不能外推为 Gemini 3.8 Flash 的通用创作能力或与 3.6/3.7 的统计显著差异。

复现建议

  1. 固定同一份 Y City + Minecraft 创作 brief、系统提示、Antigravity 版本、模型快照、工具权限和工作时间上限。

  2. 至少对 Gemini 3.6 Flash、3.7 Flash、3.8 Flash 各运行多次;保存完整提示词、规划、工具调用、代码、可运行构建和最终截图/视频。

  3. 将“自主性”和“创作命中”分开计分:前者记录有效工作时长、工具调用和中途停止;后者按主题融合、核心玩法覆盖、用户意图命中、可运行性和人工返工时间评分。

  4. 预先定义“偏离需求”的判定,例如模型自行替换主题、删除关键玩法或在未澄清时擅自扩大范围;不要用输出长度替代意图命中。

  5. 复测 3.7 与 3.8 时报告逐次结果和失败样本;若只保留作者的体验性结论,应明确标记为 community-opinion,而不是 benchmark 分数。

原始证据与数据

  • 原帖正文明确写出作者在 Google Antigravity 中使用同一个 zero-shot prompt,对比 Gemini 3.1 Pro、3.6 Flash、3.7 Flash 和 3.8 Flash:https://www.reddit.com/r/GeminiAI/comments/1wa2xwf/i_raised_all_four_models_currently_present_in/。

  • 原帖把任务限定为创建融合 Y City 与 Minecraft 的简单游戏,并说明无法分享详细结果,只给出关键 takeaway。

  • 作者的关键观察是:3.7 和 3.8 Flash 工作更久、更自主;3.6 Flash 对宽松创意提示的理解和准确性更好;3.1 Pro 令人失望。

来源摘录或观察(仅做合规短引)

作者将任务描述为“the exact same zero-shot prompt”,并明确表示 3.6 Flash 对“a loose, creative prompt”抓得更准。两处都只代表这次个人对比,不能替代统一题集的独立复测。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.8 Flash

在 Tabbit 中使用并对比模型

Gemini 3.8 Flash

相关测评

官方Google Blog(The Keyword)2026-09-02

Gemini 3.8 Flash:Google 官方发布基准与复现边界

媒体Artificial Analysis(官网模型页、方法论与发布文章;X 官方账号用于发现并核对发布帖)2026-09-02

Gemini 3.8 Flash:Artificial Analysis 智能、速度、价格与延迟

媒体AI IQ(AIIQ,Liberated Software LLC)2026-09-02

Gemini 3.8 Flash:AI IQ 能力基准与任务边界

媒体Vals AI2026-09-05

Vals AI Finance Agent v2:Gemini 3.8 Flash 的专业金融 Agent 基准

Gemini 3.8 Flash

相关提示词

官方Google AI for Developers / Google DeepMind2026-09-02

Gemini 3.8 Flash:Google 官方模型参数与 API 配置

官方Google AI for Developers2026-06-10

Gemini 3.8 Flash:Google 官方结构化提示与 Agent 工作流

官方Google AI for Developers

Gemini 3.8 Flash:Google 官方函数调用配置与工具工作流

官方Google AI for Developers2026-09-02

Gemini 3.8 Flash:Google 官方结构化输出配置