Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
官方Gemini 3.1 Pro

Google AI 开发者论坛:4000 词复杂系统提示词下 Gemini 3.1 Pro 的指令遵循实测

原始来源

Google AI Developers Forum

作者MohamedEldegla(Google Antigravity Ultra 深度用户)

原文日期2026-04-07

Tabbit 整理2026-08-20

查看原文

一句话结论

在注入包含 4,000 词严格代码规范、强制规划流程与负向约束的“上下文宪法”时,Gemini 3.1 Pro 表现出明显的指令遵循衰减(复杂约束通过率降至 ~78%),主要表现为跳过规划步骤、短视截断输出、长会话前置规则遗忘以及越权重构非目标代码。

测试环境

  • 运行环境:Google Antigravity(Ultra Tier 订阅)。

  • 测试模型:Gemini 3.1 Pro High vs Claude Opus 4.6。

  • 系统提示词设定:约 4,000 词的高密度 System Prompt(包含严格代码编写规范、必须先读后写的规划流水线、负向约束如禁止重构无关文件)。

  • 任务形式:真实大型 Web 应用日常功能开发与多步工程重构。

输入/配置

  • 固定系统提示词,交替使用 Gemini 3.1 Pro High 和 Claude Opus 4.6 执行相同的工程编码任务。

  • Gemini 端启用 thinking_level=high 深度推理。

结果数据

实测归纳出 Gemini 3.1 Pro 在复杂提示词下的四大典型失效模式(Failure Modes):

失效模式具体表现与机制对照模型 (Claude Opus 4.6) 表现
1. 跳过前置工作流 (Skip Workflow Steps)忽略强制的“调研-架构设计-伪代码”规划阶段,直接跳步输出具体代码实现严格按步骤完成调研分析与多阶段 Planning,确认后才编码
2. 贪婪压缩输出 (Write Shorter Output)倾向于极速完成,即便在 Prompt 中明确要求提供全面详细的方案,仍输出极度精炼/简短的概括遵循详尽度要求,输出结构完整的大型规划文档
3. 长会话上下文遗忘 (Context Drift in Long Sessions)会话初期能够遵守规则,但随着轮次推进(对话变长),逐渐遗忘前置 System Instructions在上下文窗口内对初始 System Instructions 保持高度长程粘性
4. 擅自越权优化 (Helpful Overrides)违反“严禁改动非目标代码”的显式负向约束,模型自作主张对上下文中的其它文件进行自以为优的重构严格恪守修改边界,仅聚焦于明确授权的代码行与文件
复杂嵌套约束通过率 (Nested IFEval)实测通过率约 ~78%(标准独立 IFEval 分数)复杂嵌套规则依从率显著高于 90%

结论

Gemini 3.1 Pro 虽然具备超快生成速度和强大的单点逻辑能力,但当系统提示词过于庞大且包含大量嵌套规则、负向约束和多阶段执行流程时,模型容易出现指令漂移。对于此类工程场景,不能直接套用长篇大段的“上下文宪法”,而必须将大任务拆分为单一步骤并在全新会话中独立执行。

局限

  • 该实测基于 Antigravity IDE 内部集成的 Gemini 3.1 Pro 表现,IDE 自身的上下文切片机制可能对 System Prompt 权重产生一定影响。

  • 属于高强度一线工程开发者的真实场景报告,非合成学术基准,但提供了具有高度实操价值的定性与定量证据。

复现步骤

  1. 编写包含 10 条以上嵌套规则(含 3 条以上“严禁做某事”的负向约束)的 3,000~4,000 词 System Prompt。

  2. 在 Antigravity 或 Gemini API 中注入该 System Prompt。

  3. 派发一个需要先分析 3 个文件再编写代码的任务。

  4. 检查 Gemini 是否输出了完整的调研步骤、是否修改了未授权的代码、以及在多轮交互后是否仍保留最初的格式约束。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.1 Pro

在 Tabbit 中使用并对比模型

Gemini 3.1 Pro

相关测评

官方Google Blog / Gemini models2026-02-19

Gemini 3.1 Pro 官方发布:ARC-AGI-2 与产品定位基线

媒体LayerLens / Stratix2026-02-19

LayerLens Stratix 对 Gemini 3.1 Pro Preview 的六类基准实测

媒体Artificial Analysis2026-02-19

Artificial Analysis 对 Gemini 3.1 Pro Preview 的 182 模型综合基准与端到端延迟实测

媒体MindStudio Blog2026-03-15

MindStudio 对 GPT-5.4、Claude Opus 4.6 与 Gemini 3.1 Pro 的三旗舰全任务实测

Gemini 3.1 Pro

相关提示词

官方Google AI for Developers / Gemini 3 Developer Guide2026-08-04

Gemini 3.1 Pro 的简洁指令与长上下文定位提示

官方Google AI for Developers / Gemini 3 Developer Guide 与 Gemini 3.1 Pro Preview 模型页2026-02

Gemini 3.1 Pro 的思考级别、结构化输出与工具配置

官方Google AI Developers Forum2026-04-07

Claude 主导规划、Gemini 隔离执行的 Spec 驱动编程工作流

社区GitHub / asgeirtj/systempromptsleaks2026-05-18

Gemini 3.1 Pro Web 端官方系统提示词与交互组件规范