Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Gemini 3.1 Pro · 官方来源 · 个人体验

Google AI 开发者论坛:4000 词复杂系统提示词下 Gemini 3.1 Pro 的指令遵循实测

一名 Antigravity Ultra 用户报告:约 4,000 词、含多阶段流程与负向约束的工程指令下,Gemini 3.1 Pro High 会跳过规划、缩短输出、长会话漂移或越权重构。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

官方来源个人体验编辑日期 2026-09-20

测试条件速查

模型/版本
Gemini 3.1 Pro;来源日期 2026-04-07;不混用其他快照或推理档位。
平台/评测环境
Google AI Developers Forum;以该来源公布的平台与 harness 为观察单位。
样本/日期边界
采集日期 2026-08-20;“Google AI 开发者论坛:4000 词复杂系统提示词下 Gemini 3.1 Pro 的指令遵循实测”不能在其公开样本之外推出统一通过率。

关键数据与适用场景

一句话结论

在注入包含 4,000 词严格代码规范、强制规划流程与负向约束的“上下文宪法”时,Gemini 3.1 Pro 表现出明显的指令遵循衰减(复杂约束通过率降至 ~78%),主要表现为跳过规划步骤、短视截断输出、长会话前置规则遗忘以及越权重构非目标代码。

测试环境

  • 运行环境:Google Antigravity(Ultra Tier 订阅)。

  • 测试模型:Gemini 3.1 Pro High vs Claude Opus 4.6。

  • 系统提示词设定:约 4,000 词的高密度 System Prompt(包含严格代码编写规范、必须先读后写的规划流水线、负向约束如禁止重构无关文件)。

  • 任务形式:真实大型 Web 应用日常功能开发与多步工程重构。

输入/配置

  • 固定系统提示词,交替使用 Gemini 3.1 Pro High 和 Claude Opus 4.6 执行相同的工程编码任务。

  • Gemini 端启用 thinking_level=high 深度推理。

结果数据

实测归纳出 Gemini 3.1 Pro 在复杂提示词下的四大典型失效模式(Failure Modes):

失效模式具体表现与机制对照模型 (Claude Opus 4.6) 表现
1. 跳过前置工作流 (Skip Workflow Steps)忽略强制的“调研-架构设计-伪代码”规划阶段,直接跳步输出具体代码实现严格按步骤完成调研分析与多阶段 Planning,确认后才编码
2. 贪婪压缩输出 (Write Shorter Output)倾向于极速完成,即便在 Prompt 中明确要求提供全面详细的方案,仍输出极度精炼/简短的概括遵循详尽度要求,输出结构完整的大型规划文档
3. 长会话上下文遗忘 (Context Drift in Long Sessions)会话初期能够遵守规则,但随着轮次推进(对话变长),逐渐遗忘前置 System Instructions在上下文窗口内对初始 System Instructions 保持高度长程粘性
4. 擅自越权优化 (Helpful Overrides)违反“严禁改动非目标代码”的显式负向约束,模型自作主张对上下文中的其它文件进行自以为优的重构严格恪守修改边界,仅聚焦于明确授权的代码行与文件
复杂嵌套约束通过率 (Nested IFEval)实测通过率约 ~78%(标准独立 IFEval 分数)复杂嵌套规则依从率显著高于 90%

结论

Gemini 3.1 Pro 虽然具备超快生成速度和强大的单点逻辑能力,但当系统提示词过于庞大且包含大量嵌套规则、负向约束和多阶段执行流程时,模型容易出现指令漂移。对于此类工程场景,不能直接套用长篇大段的“上下文宪法”,而必须将大任务拆分为单一步骤并在全新会话中独立执行。

局限

  • 该实测基于 Antigravity IDE 内部集成的 Gemini 3.1 Pro 表现,IDE 自身的上下文切片机制可能对 System Prompt 权重产生一定影响。

  • 属于高强度一线工程开发者的真实场景报告,非合成学术基准,但提供了具有高度实操价值的定性与定量证据。

复现步骤

  1. 编写包含 10 条以上嵌套规则(含 3 条以上“严禁做某事”的负向约束)的 3,000~4,000 词 System Prompt。

  2. 在 Antigravity 或 Gemini API 中注入该 System Prompt。

  3. 派发一个需要先分析 3 个文件再编写代码的任务。

  4. 检查 Gemini 是否输出了完整的调研步骤、是否修改了未授权的代码、以及在多轮交互后是否仍保留最初的格式约束。

能支持的判断

  • 该报告支持在长篇嵌套工程约束下单独测试工作流步骤、禁止项和长会话规则保持,而不是只检查最终代码能否运行。

不能支持的判断

  • 这是单个开发者在 Antigravity IDE 中的项目报告;IDE 的上下文切片、任务选择、重复次数和约 78% 的计算方法未完整公开,不能视为 Gemini API 的通用指令遵循率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Google AI Developers Forum · MohamedEldegla(Google Antigravity Ultra 深度用户) · 原文发布日期 2026-04-07 · 本站编辑日期 2026-09-20

打开原始来源

Gemini 3.1 Pro

在 Tabbit 中比较 Gemini 3.1 Pro

下载 Tabbit 客户端后检查模型可用性

相关评测

Gemini 3.1 Pro 官方发布:ARC-AGI-2 与产品定位基线Google 发布页以 2026-02-19 的 Gemini 3.1 Pro preview 和 ARC-AGI-2 verified 77.1% 作为产品基线,但没有公开完整 ARC harness。LayerLens Stratix 对 Gemini 3.1 Pro Preview 的六类基准实测LayerLens Stratix 用 14,549 个样本覆盖六类基准,显示 Gemini 3.1 Pro 在 ARC 与 BIRD-CRITIC 等任务间差异很大。Artificial Analysis 对 Gemini 3.1 Pro Preview 的 182 模型综合基准与端到端延迟实测Artificial Analysis 在第一方 API 上比较 182 个同价位模型,给 Gemini 3.1 Pro Preview 48 的 Intelligence Index、121.4 t/s 和 32.45 秒 TTFT,呈现高吞吐但高前置延迟。MindStudio 对 GPT-5.4、Claude Opus 4.6 与 Gemini 3.1 Pro 的三旗舰全任务实测MindStudio 用 HumanEval、SWE-bench、MATH、GPQA、MMLU Pro 及定制长文档任务比较三款旗舰;Gemini 的长上下文优势不能外推到所有代码修复。Gemini 3.1 Pro 的简洁指令与长上下文定位提示Google 的 Gemini 3 指南建议保持直接简洁,并把长上下文中的具体问题放在资料末尾,用短语锚定回答范围。Gemini 3.1 Pro 的思考级别、结构化输出与工具配置Google 的官方文档将 thinking_level、默认 temperature、工具调用和 JSON schema 放在同一配置检查中,并区分 customtools 端点。Claude 主导规划、Gemini 隔离执行的 Spec 驱动编程工作流开发者论坛案例让 Claude 负责规格拆解与审计、Gemini 3.1 Pro 在新会话中隔离执行,再回到审计环节核对改动。Gemini 3.1 Pro 开源项目架构对齐与多模型结对编程工作流该 Antigravity 社区案例把成熟开源项目的架构资料注入 Gemini 3.1 Pro,再用第二模型做交叉评审和架构对齐。