Gemini 3.1 Pro · 官方来源 · 厂商自报
Google 发布页以 2026-02-19 的 Gemini 3.1 Pro preview 和 ARC-AGI-2 verified 77.1% 作为产品基线,但没有公开完整 ARC harness。
Google 将 Gemini 3.1 Pro 定位为复杂问题、多模态推理和 agentic workflow 的核心模型,并报告 ARC-AGI-2 verified 77.1%,但发布页只给出有限基准上下文。
版本:Gemini 3.1 Pro,2026-02-19 以 preview 形式发布。
入口:Gemini API/AI Studio、Gemini CLI、Google Antigravity、Android Studio、Vertex AI、Gemini Enterprise、Gemini app、NotebookLM。
基准:ARC-AGI-2,官方描述为测试模型解决全新逻辑模式的能力。
配置:发布页称 verified score,但没有在文章中公开完整提示、样本划分、采样参数或工具轨迹。
官方发布页没有给出 ARC-AGI-2 的完整输入和执行 harness。产品示例层面,官方将模型用于复杂问题、多模态解释、数据合成和创意项目;开发者预览路径以 gemini-3.1-pro-preview 为准。
ARC-AGI-2 verified:77.1%。
Google 称该分数超过 Gemini 3 Pro 的两倍;发布页没有在同一篇文章中给出 Gemini 3 Pro 的完整配置信息。
产品定位:复杂问题和跨模态高级推理;发布时明确说明后续要继续验证 ambitious agentic workflows,再逐步走向一般可用。
ARC-AGI-2 数据支持 Gemini 3.1 Pro 作为抽象推理强项候选;若用户任务是编码 Agent、SQL 或多工具编排,必须另做任务级评测,不能由单一 ARC 分数推导。
官方自报,发布文章未提供完整原始样本、提示词、随机种子、成本、失败类型和置信区间。
“verified”说明有验证过程,但仍不等于独立第三方复现。
preview 模型的 API、价格、速率和行为可能变化;不能把发布日状态当成永久规格。
文章明确将 agentic workflow 作为继续验证方向,不能宣称其 Agent 能力已经全面稳定。
使用固定 gemini-3.1-pro-preview snapshot 和官方允许的 ARC-AGI-2 evaluation protocol。
记录 thinking level、temperature、工具、输入版本、输出和每题耗时;不要混用 Gemini app 与 API 结果。
另建编码、SQL、多工具任务集,按成功率、工具调用准确率、延迟和费用分项报告。
将官方 77.1% 作为发布基线,明确标注自己的 harness 是否可比。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Google Blog / Gemini models · The Gemini Team · 原文发布日期 2026-02-19 · 本站编辑日期 2026-09-20
打开原始来源Gemini 3.1 Pro
下载 Tabbit 客户端后检查模型可用性