一位用户在 Google Antigravity 中用同一个零样本创作提示,让 Gemini 3.1 Pro、3.6 Flash、3.7 Flash 和 3.8 Flash 制作融合 Y City 与 Minecraft 的简单游戏。作者感觉 3.7 和 3.8 Flash 工作时间更长、更加自主,但在这种宽松创意提示下,3.6 Flash 反而更准确地抓住意图;因此 3.8 Flash 的自主性提升不等于创作意图命中率提升。
适合观察的任务:需要模型把宽松、开放式需求转成可运行原型的创作型 Agent 任务,以及同一提示下的版本对比。
不适合直接推断的任务:通用游戏开发能力、代码质量、长上下文能力、速度或生产级成功率;原帖没有公开详细产物、运行日志或评分表。
适用的模型版本:作者明确比较 Gemini 3.8 Flash 与 Gemini 3.7 Flash、3.6 Flash、3.1 Pro;不能延伸到其他 Gemini 版本、推理档位或 provider。
适用的客户端、Agent 或 API:Google Antigravity;没有公开 API 模型 ID、工具配置、权限、上下文限制或采样参数。
推荐的推理档位和参数:未提供;“工作更长”是作者对会话行为的描述,不能当成可复用的时间预算或 effort 配置。
环境:Google Antigravity;作者称这是一次 empirical test,并比较了四个当时可用的模型。
输入:同一个 zero-shot prompt,要求创建一个融合 Y City 与 Minecraft 的简单游戏。完整 prompt 未公开,作者也说明无法分享详细结果。
对比:Gemini 3.1 Pro、Gemini 3.6 Flash、Gemini 3.7 Flash、Gemini 3.8 Flash 使用同一任务描述;原帖没有给出每个模型的单独运行次数或完整输出。
观察:作者认为 Gemini 3.7 和 3.8 Flash “remain working longer and autonomously”;但在宽松创意需求的理解和准确性上,作者更认可 Gemini 3.6 Flash,且认为 3.1 Pro 表现令人失望。
旁证:唯一一条评论认为,更强的自主性有时会让模型偏离用户真正要求;这只是评论者观点,不计入主帖结果。
| 观察维度 | 原帖主帖公开内容 | 可支持的有限判断 |
|---|---|---|
| 客户端 | Google Antigravity | 结论只适用于该客户端会话,不能直接等同于 API 行为 |
| 任务 | 用同一个 zero-shot prompt 创建 Y City + Minecraft 简单游戏 | 存在一次同任务跨版本创作对比 |
| Gemini 3.7 Flash | 与 3.8 Flash 一样,作者感觉工作更久、更自主 | 只支持方向性的会话行为观察,不支持时长或完成率差异 |
| Gemini 3.8 Flash | 工作更久、更自主,但作者未认为它最准确地抓住宽松创意提示 | 自主执行和创作意图命中是两个不同维度 |
| Gemini 3.6 Flash | 作者认为它对松散创意提示的理解和准确性更好 | 支持该作者在该任务上的主观偏好,不支持通用排名 |
| 量化数据 | 无 token、耗时、分数、重试、完整输出或代码 diff | 不能计算速度、成本、代码质量或成功率 |
这条体验提供了与既有代码仓库报告不同的信号:任务不是修复真实仓库,而是把模糊的创作意图转成游戏原型。
在作者的同任务比较中,Gemini 3.8 Flash 与 3.7 Flash 的优势是更长时间、更加自主地工作;但作者把“是否准确理解宽松创意提示”判给了 3.6 Flash。
因此,对开放式创作 Agent,不能只用运行轮数、自主工具调用或持续工作时间衡量升级效果;还要单独评价目标意图、主题融合和产物是否符合用户预期。
这不是受控评测:原帖没有详细 prompt、四个模型的独立结果、评分标准或日志,“3.6 更懂需求”只能作为复测假设。
作者没有公开游戏的详细结果,只给出关键 takeaway;无法从文字判断四个版本的代码是否可运行、功能是否完整或画面质量如何。
没有公开模型快照、推理档位、系统提示、工具权限、上下文长度、temperature、运行次数、耗时或 token,因此不能把“工作更久”解释成更高的服务端延迟或更大的预算。
“同一个 zero-shot prompt”是作者的声明,但 prompt 正文和各模型上下文状态不可见,无法完全核验条件一致性。
3.7 与 3.8 的对比只有作者的合并描述,没有逐模型输出;不能据此断言 3.8 比 3.7 更差或更好,只能说作者未报告 3.8 在意图理解上的额外优势。
作者把视频链接作为 walkthrough,但本文不从视频画面推导额外结论;若要复测,应同时保存视频、代码和每个模型的原始会话。
结论来自一个用户、一次任务和主观判断,不能外推为 Gemini 3.8 Flash 的通用创作能力或与 3.6/3.7 的统计显著差异。
固定同一份 Y City + Minecraft 创作 brief、系统提示、Antigravity 版本、模型快照、工具权限和工作时间上限。
至少对 Gemini 3.6 Flash、3.7 Flash、3.8 Flash 各运行多次;保存完整提示词、规划、工具调用、代码、可运行构建和最终截图/视频。
将“自主性”和“创作命中”分开计分:前者记录有效工作时长、工具调用和中途停止;后者按主题融合、核心玩法覆盖、用户意图命中、可运行性和人工返工时间评分。
预先定义“偏离需求”的判定,例如模型自行替换主题、删除关键玩法或在未澄清时擅自扩大范围;不要用输出长度替代意图命中。
复测 3.7 与 3.8 时报告逐次结果和失败样本;若只保留作者的体验性结论,应明确标记为 community-opinion,而不是 benchmark 分数。
原帖正文明确写出作者在 Google Antigravity 中使用同一个 zero-shot prompt,对比 Gemini 3.1 Pro、3.6 Flash、3.7 Flash 和 3.8 Flash:https://www.reddit.com/r/GeminiAI/comments/1wa2xwf/i_raised_all_four_models_currently_present_in/。
原帖把任务限定为创建融合 Y City 与 Minecraft 的简单游戏,并说明无法分享详细结果,只给出关键 takeaway。
作者的关键观察是:3.7 和 3.8 Flash 工作更久、更自主;3.6 Flash 对宽松创意提示的理解和准确性更好;3.1 Pro 令人失望。
作者将任务描述为“the exact same zero-shot prompt”,并明确表示 3.6 Flash 对“a loose, creative prompt”抓得更准。两处都只代表这次个人对比,不能替代统一题集的独立复测。
Gemini 3.8 Flash