在注入包含 4,000 词严格代码规范、强制规划流程与负向约束的“上下文宪法”时,Gemini 3.1 Pro 表现出明显的指令遵循衰减(复杂约束通过率降至 ~78%),主要表现为跳过规划步骤、短视截断输出、长会话前置规则遗忘以及越权重构非目标代码。
运行环境:Google Antigravity(Ultra Tier 订阅)。
测试模型:Gemini 3.1 Pro High vs Claude Opus 4.6。
系统提示词设定:约 4,000 词的高密度 System Prompt(包含严格代码编写规范、必须先读后写的规划流水线、负向约束如禁止重构无关文件)。
任务形式:真实大型 Web 应用日常功能开发与多步工程重构。
固定系统提示词,交替使用 Gemini 3.1 Pro High 和 Claude Opus 4.6 执行相同的工程编码任务。
Gemini 端启用 thinking_level=high 深度推理。
实测归纳出 Gemini 3.1 Pro 在复杂提示词下的四大典型失效模式(Failure Modes):
| 失效模式 | 具体表现与机制 | 对照模型 (Claude Opus 4.6) 表现 |
|---|---|---|
| 1. 跳过前置工作流 (Skip Workflow Steps) | 忽略强制的“调研-架构设计-伪代码”规划阶段,直接跳步输出具体代码实现 | 严格按步骤完成调研分析与多阶段 Planning,确认后才编码 |
| 2. 贪婪压缩输出 (Write Shorter Output) | 倾向于极速完成,即便在 Prompt 中明确要求提供全面详细的方案,仍输出极度精炼/简短的概括 | 遵循详尽度要求,输出结构完整的大型规划文档 |
| 3. 长会话上下文遗忘 (Context Drift in Long Sessions) | 会话初期能够遵守规则,但随着轮次推进(对话变长),逐渐遗忘前置 System Instructions | 在上下文窗口内对初始 System Instructions 保持高度长程粘性 |
| 4. 擅自越权优化 (Helpful Overrides) | 违反“严禁改动非目标代码”的显式负向约束,模型自作主张对上下文中的其它文件进行自以为优的重构 | 严格恪守修改边界,仅聚焦于明确授权的代码行与文件 |
| 复杂嵌套约束通过率 (Nested IFEval) | 实测通过率约 ~78%(标准独立 IFEval 分数) | 复杂嵌套规则依从率显著高于 90% |
Gemini 3.1 Pro 虽然具备超快生成速度和强大的单点逻辑能力,但当系统提示词过于庞大且包含大量嵌套规则、负向约束和多阶段执行流程时,模型容易出现指令漂移。对于此类工程场景,不能直接套用长篇大段的“上下文宪法”,而必须将大任务拆分为单一步骤并在全新会话中独立执行。
该实测基于 Antigravity IDE 内部集成的 Gemini 3.1 Pro 表现,IDE 自身的上下文切片机制可能对 System Prompt 权重产生一定影响。
属于高强度一线工程开发者的真实场景报告,非合成学术基准,但提供了具有高度实操价值的定性与定量证据。
编写包含 10 条以上嵌套规则(含 3 条以上“严禁做某事”的负向约束)的 3,000~4,000 词 System Prompt。
在 Antigravity 或 Gemini API 中注入该 System Prompt。
派发一个需要先分析 3 个文件再编写代码的任务。
检查 Gemini 是否输出了完整的调研步骤、是否修改了未授权的代码、以及在多轮交互后是否仍保留最初的格式约束。
Gemini 3.1 Pro