Google 将 Gemini 3.1 Pro 定位为复杂问题、多模态推理和 agentic workflow 的核心模型,并报告 ARC-AGI-2 verified 77.1%,但发布页只给出有限基准上下文。
版本:Gemini 3.1 Pro,2026-02-19 以 preview 形式发布。
入口:Gemini API/AI Studio、Gemini CLI、Google Antigravity、Android Studio、Vertex AI、Gemini Enterprise、Gemini app、NotebookLM。
基准:ARC-AGI-2,官方描述为测试模型解决全新逻辑模式的能力。
配置:发布页称 verified score,但没有在文章中公开完整提示、样本划分、采样参数或工具轨迹。
官方发布页没有给出 ARC-AGI-2 的完整输入和执行 harness。产品示例层面,官方将模型用于复杂问题、多模态解释、数据合成和创意项目;开发者预览路径以 gemini-3.1-pro-preview 为准。
ARC-AGI-2 verified:77.1%。
Google 称该分数超过 Gemini 3 Pro 的两倍;发布页没有在同一篇文章中给出 Gemini 3 Pro 的完整配置信息。
产品定位:复杂问题和跨模态高级推理;发布时明确说明后续要继续验证 ambitious agentic workflows,再逐步走向一般可用。
ARC-AGI-2 数据支持 Gemini 3.1 Pro 作为抽象推理强项候选;若用户任务是编码 Agent、SQL 或多工具编排,必须另做任务级评测,不能由单一 ARC 分数推导。
官方自报,发布文章未提供完整原始样本、提示词、随机种子、成本、失败类型和置信区间。
“verified”说明有验证过程,但仍不等于独立第三方复现。
preview 模型的 API、价格、速率和行为可能变化;不能把发布日状态当成永久规格。
文章明确将 agentic workflow 作为继续验证方向,不能宣称其 Agent 能力已经全面稳定。
使用固定 gemini-3.1-pro-preview snapshot 和官方允许的 ARC-AGI-2 evaluation protocol。
记录 thinking level、temperature、工具、输入版本、输出和每题耗时;不要混用 Gemini app 与 API 结果。
另建编码、SQL、多工具任务集,按成功率、工具调用准确率、延迟和费用分项报告。
将官方 77.1% 作为发布基线,明确标注自己的 harness 是否可比。
Gemini 3.1 Pro