Google 发布页以 2026-02-19 的 Gemini 3.1 Pro preview 和 ARC-AGI-2 verified 77.1% 作为产品基线,但没有公开完整 ARC harness。
Google Blog / Gemini models · 查看证据Gemini 3.1 Pro · 测评与证据
Gemini 3.1 Pro,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
LayerLens Stratix 用 14,549 个样本覆盖六类基准,显示 Gemini 3.1 Pro 在 ARC 与 BIRD-CRITIC 等任务间差异很大。
LayerLens / Stratix · 查看证据Artificial Analysis 在第一方 API 上比较 182 个同价位模型,给 Gemini 3.1 Pro Preview 48 的 Intelligence Index、121.4 t/s 和 32.45 秒 TTFT,呈现高吞吐但高前置延迟。
Artificial Analysis · 查看证据精选证据
Gemini 3.1 Pro 官方发布:ARC-AGI-2 与产品定位基线
Google 发布页以 2026-02-19 的 Gemini 3.1 Pro preview 和 ARC-AGI-2 verified 77.1% 作为产品基线,但没有公开完整 ARC harness。
- 来源具体观察
- 2026-02-19 Google 发布;模型为 Gemini 3.1 Pro preview,官方报告 ARC-AGI-2 verified 77.1%。
- 已公布条件
- 发布页没有公开 ARC prompt、样本划分、采样参数或工具轨迹;模型 API 名称以 gemini-3.1-pro-preview 为准。
LayerLens Stratix 对 Gemini 3.1 Pro Preview 的六类基准实测
LayerLens Stratix 用 14,549 个样本覆盖六类基准,显示 Gemini 3.1 Pro 在 ARC 与 BIRD-CRITIC 等任务间差异很大。
- 来源具体观察
- 2026-02-19 LayerLens Stratix;14,549 个测试用例,覆盖 ARC AGI 2、LiveCodeBench、SWE Bench Lite、IF-Evals、BIRD-CRITIC、BFCL v3。
- 已公布条件
- 文章称使用 standardized configurations 和 consistent parameters,但没有公开每项完整 prompt、temperature、重复次数和置信区间。
Artificial Analysis 对 Gemini 3.1 Pro Preview 的 182 模型综合基准与端到端延迟实测
Artificial Analysis 在第一方 API 上比较 182 个同价位模型,给 Gemini 3.1 Pro Preview 48 的 Intelligence Index、121.4 t/s 和 32.45 秒 TTFT,呈现高吞吐但高前置延迟。
- 来源具体观察
- 2026-02-19 起的 Artificial Analysis 跟踪页;对比价位超过 $1/1M tokens 的 182 个模型,使用 Intelligence Index v4.1.1 九项基准。
- 已公布条件
- 页面记录第一方 API 默认参数、全流程 token、吞吐、TTFT 和费用;价格与模型 preview 快照会变化。
MindStudio 对 GPT-5.4、Claude Opus 4.6 与 Gemini 3.1 Pro 的三旗舰全任务实测
MindStudio 用 HumanEval、SWE-bench、MATH、GPQA、MMLU Pro 及定制长文档任务比较三款旗舰;Gemini 的长上下文优势不能外推到所有代码修复。
待验证:本次未能重新核实原文。
- 来源具体观察
- 2026-03-15 MindStudio;HumanEval 164 道 Python pass@1,另有 SWE-bench Verified、MATH、GPQA Diamond、MMLU Pro、120k token 文档和 5,000 词写作任务。
- 已公布条件
- 客观项目自动判定,主观项目由 3 位独立评审盲评;评测混合 GPT-5.4、Claude Opus 4.6 与 Gemini 3.1 Pro。
全部来源
全部来源
Gemini 3.1 Pro 官方发布:ARC-AGI-2 与产品定位基线
Google 发布页以 2026-02-19 的 Gemini 3.1 Pro preview 和 ARC-AGI-2 verified 77.1% 作为产品基线,但没有公开完整 ARC harness。
- 来源具体观察
- 2026-02-19 Google 发布;模型为 Gemini 3.1 Pro preview,官方报告 ARC-AGI-2 verified 77.1%。
- 已公布条件
- 发布页没有公开 ARC prompt、样本划分、采样参数或工具轨迹;模型 API 名称以 gemini-3.1-pro-preview 为准。
LayerLens Stratix 对 Gemini 3.1 Pro Preview 的六类基准实测
LayerLens Stratix 用 14,549 个样本覆盖六类基准,显示 Gemini 3.1 Pro 在 ARC 与 BIRD-CRITIC 等任务间差异很大。
- 来源具体观察
- 2026-02-19 LayerLens Stratix;14,549 个测试用例,覆盖 ARC AGI 2、LiveCodeBench、SWE Bench Lite、IF-Evals、BIRD-CRITIC、BFCL v3。
- 已公布条件
- 文章称使用 standardized configurations 和 consistent parameters,但没有公开每项完整 prompt、temperature、重复次数和置信区间。
Artificial Analysis 对 Gemini 3.1 Pro Preview 的 182 模型综合基准与端到端延迟实测
Artificial Analysis 在第一方 API 上比较 182 个同价位模型,给 Gemini 3.1 Pro Preview 48 的 Intelligence Index、121.4 t/s 和 32.45 秒 TTFT,呈现高吞吐但高前置延迟。
- 来源具体观察
- 2026-02-19 起的 Artificial Analysis 跟踪页;对比价位超过 $1/1M tokens 的 182 个模型,使用 Intelligence Index v4.1.1 九项基准。
- 已公布条件
- 页面记录第一方 API 默认参数、全流程 token、吞吐、TTFT 和费用;价格与模型 preview 快照会变化。
MindStudio 对 GPT-5.4、Claude Opus 4.6 与 Gemini 3.1 Pro 的三旗舰全任务实测
MindStudio 用 HumanEval、SWE-bench、MATH、GPQA、MMLU Pro 及定制长文档任务比较三款旗舰;Gemini 的长上下文优势不能外推到所有代码修复。
待验证:本次未能重新核实原文。
- 来源具体观察
- 2026-03-15 MindStudio;HumanEval 164 道 Python pass@1,另有 SWE-bench Verified、MATH、GPQA Diamond、MMLU Pro、120k token 文档和 5,000 词写作任务。
- 已公布条件
- 客观项目自动判定,主观项目由 3 位独立评审盲评;评测混合 GPT-5.4、Claude Opus 4.6 与 Gemini 3.1 Pro。
Google AI 开发者论坛:4000 词复杂系统提示词下 Gemini 3.1 Pro 的指令遵循实测
一名 Antigravity Ultra 用户报告:约 4,000 词、含多阶段流程与负向约束的工程指令下,Gemini 3.1 Pro High 会跳过规划、缩短输出、长会话漂移或越权重构。
待验证:本次未能重新核实原文。
- 模型/版本
- Gemini 3.1 Pro;来源日期 2026-04-07;不混用其他快照或推理档位。
- 平台/评测环境
- Google AI Developers Forum;以该来源公布的平台与 harness 为观察单位。
- 样本/日期边界
- 采集日期 2026-08-20;“Google AI 开发者论坛:4000 词复杂系统提示词下 Gemini 3.1 Pro 的指令遵循实测”不能在其公开样本之外推出统一通过率。
Reddit 对 Gemini 3.1 Pro 静态基准与 Arena 选择的讨论
Reddit 讨论把 ARC-AGI-2、HLE 发布分数与 Arena 偏好榜并置,主张将正确率、工具成功率、成本和盲评偏好拆开验证,而不是据单榜选部署模型。
待验证:本次未能重新核实原文。
- 模型/版本
- Gemini 3.1 Pro;来源日期 2026-02-19;不混用其他快照或推理档位。
- 平台/评测环境
- Reddit / r/LocalLLM;以该来源公布的平台与 harness 为观察单位。
- 样本/日期边界
- 采集日期 2026-08-20;“Reddit 对 Gemini 3.1 Pro 静态基准与 Arena 选择的讨论”不能在其公开样本之外推出统一通过率。
Reddit 社区实测:Gemini 3.1 Pro 扩展思考、百万上下文综合与 API vs Web 差异
Reddit 深度用户报告在 AI Studio/API 开启 high thinking 后,百万 token 文档综合和长会话状态保持优于普通 Web 体验,同时提醒线上权重与客户端包装会频繁变化。
待验证:本次未能重新核实原文。
- 模型/版本
- Gemini 3.1 Pro;来源日期 2026-08-08;不混用其他快照或推理档位。
- 平台/评测环境
- Reddit / r/GeminiAI;以该来源公布的平台与 harness 为观察单位。
- 样本/日期边界
- 采集日期 2026-08-20;“Reddit 社区实测:Gemini 3.1 Pro 扩展思考、百万上下文综合与 API vs Web 差异”不能在其公开样本之外推出统一通过率。