Gemini 3.1 Pro

Gemini 3.1 Pro · 测评与证据

Gemini 3.1 Pro,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

Artificial Analysis 在第一方 API 上比较 182 个同价位模型,给 Gemini 3.1 Pro Preview 48 的 Intelligence Index、121.4 t/s 和 32.45 秒 TTFT,呈现高吞吐但高前置延迟。

Artificial Analysis · 查看证据

精选证据

官方厂商自报

Gemini 3.1 Pro 官方发布:ARC-AGI-2 与产品定位基线

Google 发布页以 2026-02-19 的 Gemini 3.1 Pro preview 和 ARC-AGI-2 verified 77.1% 作为产品基线,但没有公开完整 ARC harness。

来源Google Blog / Gemini models
原文日期2026-02-19
采集2026-08-20
来源具体观察
2026-02-19 Google 发布;模型为 Gemini 3.1 Pro preview,官方报告 ARC-AGI-2 verified 77.1%。
已公布条件
发布页没有公开 ARC prompt、样本划分、采样参数或工具轨迹;模型 API 名称以 gemini-3.1-pro-preview 为准。
能力
媒体 / 基准方独立测量

LayerLens Stratix 对 Gemini 3.1 Pro Preview 的六类基准实测

LayerLens Stratix 用 14,549 个样本覆盖六类基准,显示 Gemini 3.1 Pro 在 ARC 与 BIRD-CRITIC 等任务间差异很大。

来源LayerLens / Stratix
原文日期2026-02-19
采集2026-08-20
来源具体观察
2026-02-19 LayerLens Stratix;14,549 个测试用例,覆盖 ARC AGI 2、LiveCodeBench、SWE Bench Lite、IF-Evals、BIRD-CRITIC、BFCL v3。
已公布条件
文章称使用 standardized configurations 和 consistent parameters,但没有公开每项完整 prompt、temperature、重复次数和置信区间。
能力
媒体 / 基准方独立测量

Artificial Analysis 对 Gemini 3.1 Pro Preview 的 182 模型综合基准与端到端延迟实测

Artificial Analysis 在第一方 API 上比较 182 个同价位模型,给 Gemini 3.1 Pro Preview 48 的 Intelligence Index、121.4 t/s 和 32.45 秒 TTFT,呈现高吞吐但高前置延迟。

来源Artificial Analysis
原文日期2026-02-19
采集2026-08-20
来源具体观察
2026-02-19 起的 Artificial Analysis 跟踪页;对比价位超过 $1/1M tokens 的 182 个模型,使用 Intelligence Index v4.1.1 九项基准。
已公布条件
页面记录第一方 API 默认参数、全流程 token、吞吐、TTFT 和费用;价格与模型 preview 快照会变化。
能力
媒体 / 基准方独立测量

MindStudio 对 GPT-5.4、Claude Opus 4.6 与 Gemini 3.1 Pro 的三旗舰全任务实测

MindStudio 用 HumanEval、SWE-bench、MATH、GPQA、MMLU Pro 及定制长文档任务比较三款旗舰;Gemini 的长上下文优势不能外推到所有代码修复。

来源MindStudio Blog
原文日期2026-03-15
采集2026-08-20

待验证:本次未能重新核实原文。

来源具体观察
2026-03-15 MindStudio;HumanEval 164 道 Python pass@1,另有 SWE-bench Verified、MATH、GPQA Diamond、MMLU Pro、120k token 文档和 5,000 词写作任务。
已公布条件
客观项目自动判定,主观项目由 3 位独立评审盲评;评测混合 GPT-5.4、Claude Opus 4.6 与 Gemini 3.1 Pro。
能力

全部来源

全部来源

7 / 7
官方厂商自报

Gemini 3.1 Pro 官方发布:ARC-AGI-2 与产品定位基线

Google 发布页以 2026-02-19 的 Gemini 3.1 Pro preview 和 ARC-AGI-2 verified 77.1% 作为产品基线,但没有公开完整 ARC harness。

来源Google Blog / Gemini models
原文日期2026-02-19
采集2026-08-20
来源具体观察
2026-02-19 Google 发布;模型为 Gemini 3.1 Pro preview,官方报告 ARC-AGI-2 verified 77.1%。
已公布条件
发布页没有公开 ARC prompt、样本划分、采样参数或工具轨迹;模型 API 名称以 gemini-3.1-pro-preview 为准。
能力
媒体 / 基准方独立测量

LayerLens Stratix 对 Gemini 3.1 Pro Preview 的六类基准实测

LayerLens Stratix 用 14,549 个样本覆盖六类基准,显示 Gemini 3.1 Pro 在 ARC 与 BIRD-CRITIC 等任务间差异很大。

来源LayerLens / Stratix
原文日期2026-02-19
采集2026-08-20
来源具体观察
2026-02-19 LayerLens Stratix;14,549 个测试用例,覆盖 ARC AGI 2、LiveCodeBench、SWE Bench Lite、IF-Evals、BIRD-CRITIC、BFCL v3。
已公布条件
文章称使用 standardized configurations 和 consistent parameters,但没有公开每项完整 prompt、temperature、重复次数和置信区间。
能力
媒体 / 基准方独立测量

Artificial Analysis 对 Gemini 3.1 Pro Preview 的 182 模型综合基准与端到端延迟实测

Artificial Analysis 在第一方 API 上比较 182 个同价位模型,给 Gemini 3.1 Pro Preview 48 的 Intelligence Index、121.4 t/s 和 32.45 秒 TTFT,呈现高吞吐但高前置延迟。

来源Artificial Analysis
原文日期2026-02-19
采集2026-08-20
来源具体观察
2026-02-19 起的 Artificial Analysis 跟踪页;对比价位超过 $1/1M tokens 的 182 个模型,使用 Intelligence Index v4.1.1 九项基准。
已公布条件
页面记录第一方 API 默认参数、全流程 token、吞吐、TTFT 和费用;价格与模型 preview 快照会变化。
能力
媒体 / 基准方独立测量

MindStudio 对 GPT-5.4、Claude Opus 4.6 与 Gemini 3.1 Pro 的三旗舰全任务实测

MindStudio 用 HumanEval、SWE-bench、MATH、GPQA、MMLU Pro 及定制长文档任务比较三款旗舰;Gemini 的长上下文优势不能外推到所有代码修复。

来源MindStudio Blog
原文日期2026-03-15
采集2026-08-20

待验证:本次未能重新核实原文。

来源具体观察
2026-03-15 MindStudio;HumanEval 164 道 Python pass@1,另有 SWE-bench Verified、MATH、GPQA Diamond、MMLU Pro、120k token 文档和 5,000 词写作任务。
已公布条件
客观项目自动判定,主观项目由 3 位独立评审盲评;评测混合 GPT-5.4、Claude Opus 4.6 与 Gemini 3.1 Pro。
能力
官方个人体验

Google AI 开发者论坛:4000 词复杂系统提示词下 Gemini 3.1 Pro 的指令遵循实测

一名 Antigravity Ultra 用户报告:约 4,000 词、含多阶段流程与负向约束的工程指令下,Gemini 3.1 Pro High 会跳过规划、缩短输出、长会话漂移或越权重构。

来源Google AI Developers Forum
原文日期2026-04-07
采集2026-08-20

待验证:本次未能重新核实原文。

模型/版本
Gemini 3.1 Pro;来源日期 2026-04-07;不混用其他快照或推理档位。
平台/评测环境
Google AI Developers Forum;以该来源公布的平台与 harness 为观察单位。
样本/日期边界
采集日期 2026-08-20;“Google AI 开发者论坛:4000 词复杂系统提示词下 Gemini 3.1 Pro 的指令遵循实测”不能在其公开样本之外推出统一通过率。
能力
社区个人体验

Reddit 对 Gemini 3.1 Pro 静态基准与 Arena 选择的讨论

Reddit 讨论把 ARC-AGI-2、HLE 发布分数与 Arena 偏好榜并置,主张将正确率、工具成功率、成本和盲评偏好拆开验证,而不是据单榜选部署模型。

来源Reddit / r/LocalLLM
原文日期2026-02-19
采集2026-08-20

待验证:本次未能重新核实原文。

模型/版本
Gemini 3.1 Pro;来源日期 2026-02-19;不混用其他快照或推理档位。
平台/评测环境
Reddit / r/LocalLLM;以该来源公布的平台与 harness 为观察单位。
样本/日期边界
采集日期 2026-08-20;“Reddit 对 Gemini 3.1 Pro 静态基准与 Arena 选择的讨论”不能在其公开样本之外推出统一通过率。
能力
社区个人体验

Reddit 社区实测:Gemini 3.1 Pro 扩展思考、百万上下文综合与 API vs Web 差异

Reddit 深度用户报告在 AI Studio/API 开启 high thinking 后,百万 token 文档综合和长会话状态保持优于普通 Web 体验,同时提醒线上权重与客户端包装会频繁变化。

来源Reddit / r/GeminiAI
原文日期2026-08-08
采集2026-08-20

待验证:本次未能重新核实原文。

模型/版本
Gemini 3.1 Pro;来源日期 2026-08-08;不混用其他快照或推理档位。
平台/评测环境
Reddit / r/GeminiAI;以该来源公布的平台与 harness 为观察单位。
样本/日期边界
采集日期 2026-08-20;“Reddit 社区实测:Gemini 3.1 Pro 扩展思考、百万上下文综合与 API vs Web 差异”不能在其公开样本之外推出统一通过率。
能力

Gemini 3.1 Pro

在 Tabbit 中比较 Gemini 3.1 Pro

客户端中的模型、功能和权限以当前账户为准。