社区多位深度用户实测证实,Gemini 3.1 Pro 在启用 Extended Thinking / thinking_level=high 档位时,在 100 万 token 规模的长文档综合分析与多轮记忆上表现优异,但 Web 网页端与 API/AI Studio 存在显著行为差异,且模型权重与思考机制在 2026 年 7~8 月间经历过多次静默调整。
测试环境:Google AI Studio(直连 API 模式)与 Gemini Consumer Web/App(订阅版)。
参数控制:
AI Studio 端:固定 thinking_level=high,Temperature 默认 1.0。
Consumer Web 端:手动开启 Extended Thinking 开关。
任务类型:100 万 Token 级别大文档多维合成(Synthesis)、跨多轮复杂电子表格生成与状态维护、高难度多约束 Prompt 日常压力测试。
在 AI Studio 中构建包含数十万至百万 Token 的多源资料上下文,运行日常固定 Benchmark 提示词。
对比开启与关闭 Extended Thinking(思考模式)下的长会话上下文保持能力。
| 评估维度 | 未启用 Extended Thinking / 低档位 | 启用 Extended Thinking / high 档位 |
|---|---|---|
| 百万上下文综合能力 (1M Context Synthesis) | 容易仅关注局部段落,跨文档综合粗糙,输出偏向通用套话 | 能够深度贯通 1M Token 上下文,输出具备丰富细节与深层归纳 |
| 长程状态维护 (Long-session Maintenance) | 容易在多轮交互后丢失上下文,无法完成复杂多阶段连续修改 | 能够单会话端到端完成复杂全量表格与数据流的连续修改而无需重启新对话 |
| API / AI Studio vs Web 网页端表现 | Web 网页端包含较多包装层与隐式 Prompt,稳定性较差 | AI Studio / API 直接透传参数,输出确定性与遵循度明显优于 Web 端 |
| 模型稳定性与版本波动 | 7 月下旬经历过严重的输出质量退化(社区反馈出现退行) | 8 月初更新后,Extended Thinking 的思考链结构发生改进,质量显著反弹 |
AI Studio 优先:深度开发者一致建议在 AI Studio 或直接通过 API 使用 thinking_level=high,避免使用普通 Web 聊天界面的黑盒干预。
思维链演进:8 月份更新后,Gemini 3.1 Pro 的 CoT(Chain of Thought)结构更偏向深度自我检验,多步推理的准确性大幅跃升。
Gemini 3.1 Pro 必须在开启 Extended Thinking(API 端设置 thinking_level=high)的前提下才能完全释放其在百万上下文长文档阅读与复杂逻辑推演上的潜力;对于专业工程和严肃分析,首选 AI Studio 或 API 调用,不要以普通 Web 端的免费/基础交互体验作为模型能力上限的评估依据。
属于社区高频用户的定性感知与长期使用日志汇总,缺乏实验室级的双盲统计数据。
Google 对线上模型权重的灰度发布与静默迭代较为频繁,不同时间段与不同地区节点的体验可能存在短期差异。
打开 Google AI Studio,选择 gemini-3.1-pro-preview 模型。
注入 50 万~100 万 Token 的真实业务文档或代码库。
分别设置 thinking_level="low" 和 thinking_level="high",输入相同的跨章节综合提取问题。
对比两个回复在细节引用准确率、长程逻辑因果关系推导以及幻觉率上的差异。
Gemini 3.1 Pro