Gemini 3.1 Pro 模型测评导航
汇总 Gemini 3.1 Pro 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。
官方
2 条已核对来源的资料Gemini 3.1 Pro 官方发布:ARC-AGI-2 与产品定位基线
Google 将 Gemini 3.1 Pro 定位为复杂问题、多模态推理和 agentic workflow 的核心模型,并报告 ARC-AGI-2 verified 77.1%,但发布页只给出有限基准上下文。
Google AI 开发者论坛:4000 词复杂系统提示词下 Gemini 3.1 Pro 的指令遵循实测
在注入包含 4,000 词严格代码规范、强制规划流程与负向约束的“上下文宪法”时,Gemini 3.1 Pro 表现出明显的指令遵循衰减(复杂约束通过率降至 ~78%),主要表现为跳过规划步骤、短视截断输出、长会话前置规则遗忘以及越权重构非目标代码。
媒体
3 条已核对来源的资料LayerLens Stratix 对 Gemini 3.1 Pro Preview 的六类基准实测
LayerLens 在 Stratix 的 14,549 个测试用例上测得 Gemini 3.1 Pro Preview 从 ARC-AGI-2 92.3% 到 BIRD-CRITIC 32.5% 的大幅任务差异,说明它更适合抽象推理,SQL 与仓库级工程需要路由或补充工具。
Artificial Analysis 对 Gemini 3.1 Pro Preview 的 182 模型综合基准与端到端延迟实测
Artificial Analysis 独立实测显示,Gemini 3.1 Pro Preview 综合智能指数得分 48(同价位中位数 35),生成速率高达 121.4 t/s(同价位中位数 76.2 t/s),但受长推理链影响首 token 响应延迟(TTFT)达 32.45s,属于典型的高智力、高速率、高前置推理耗时的推理模型。
MindStudio 对 GPT-5.4、Claude Opus 4.6 与 Gemini 3.1 Pro 的三旗舰全任务实测
在涵盖代码、长篇创意写作、研究生级推理、数学与长文档综合的统一多模型横评中,Gemini 3.1 Pro 在 200 万 token 超长上下文和输出成本(比 Claude 便宜 60%)上占据压倒性优势,但在复杂多文件代码修复与文学级主观写作上略逊于 GPT-5.4 与 Claude Opus 4.6。
社区
2 条已核对来源的资料Reddit 对 Gemini 3.1 Pro 静态基准与 Arena 选择的讨论
该讨论把 Gemini 3.1 Pro 的 ARC-AGI-2/HLE 发布成绩与 Arena 偏好排名并置,提醒部署选择要用同环境同输入的任务评测,而不能只看静态榜或“喜欢度”。
Reddit 社区实测:Gemini 3.1 Pro 扩展思考、百万上下文综合与 API vs Web 差异
社区多位深度用户实测证实,Gemini 3.1 Pro 在启用 Extended Thinking / thinkinglevel=high 档位时,在 100 万 token 规模的长文档综合分析与多轮记忆上表现优异,但 Web 网页端与 API/AI Studio 存在显著行为差异,且模型权重与思考机制在 2026 年 7~8 月间经历过多次静默调整。
Gemini 3.1 Pro
在 Tabbit 中使用并对比模型
汇总 Gemini 3.1 Pro 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。