Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区Gemini 3.1 Pro

Reddit 对 Gemini 3.1 Pro 静态基准与 Arena 选择的讨论

原始来源

Reddit / r/LocalLLM

作者snakemas 与社区评论者

原文日期2026-02-19

Tabbit 整理2026-08-19

查看原文

一句话结论

该讨论把 Gemini 3.1 Pro 的 ARC-AGI-2/HLE 发布成绩与 Arena 偏好排名并置,提醒部署选择要用同环境同输入的任务评测,而不能只看静态榜或“喜欢度”。

测试环境

  • 环境:Reddit 对 Google 发布数据、Arena 排名和模型部署选择的讨论。

  • 输入/配置:帖子引用 ARC-AGI-2 77.1%、Humanity’s Last Exam 44.4%,并观察 Arena 文本/代码榜的相对位置;没有统一 API、工具或重复运行。

  • 结果形式:观点与链接,不是受控实验。

输入/配置

帖子没有公开可复制的完整提示词或完整输出,因此不能把它包装为 prompt。可复用的评测流程建议是:相同模型版本、相同输入、相同工具和相同运行预算,在目标 Agent 环境中进行对照,并分开记录正确性与用户偏好。

结果数据

  • 帖子引用 Gemini 3.1 Pro ARC-AGI-2 77.1%,并称 Humanity’s Last Exam 44.4%。

  • 帖子称 Arena 文本榜中 Claude Opus 4.6 仍领先 Gemini 3.1 Pro 约 4 分;代码榜中 Opus 4.6、Opus 4.5 和 GPT-5.2 High 位于其前。

  • 作者指出 ARC-AGI-2 更接近静态能力测试,而 Arena 投票更多反映用户喜欢的输出;两者都不是同工具环境中的 live adversarial test。

结论

如果任务偏抽象推理,Gemini 3.1 Pro 的官方/社区基准值得重视;如果任务偏编码、对话风格或工具 Agent,应在真实环境中预注册成功标准,避免把 Arena 偏好或单一 benchmark 当成部署结论。

局限

  • Reddit 用户身份、引用的时间点和 Arena 具体快照无法在帖子中完整核实。

  • 帖子没有运行原始任务,数据主要来自转述的官方成绩和排行榜。

  • “领先几分”可能随 Arena 榜单实时变化;采集时只作为讨论中的观察,不作稳定事实。

复现步骤

  1. 固定 Gemini 3.1 Pro 和对照模型的 API snapshot、thinking level、温度、工具集和 token 预算。

  2. 构造包含抽象推理、代码修复、工具调用、长上下文和偏好盲评的任务集。

  3. 把正确率、resolved、工具调用成功率、成本和延迟与盲评偏好分开统计。

  4. 记录所有 prompt、输出和失败案例;每次榜单或模型版本更新后重新跑,不把旧帖子当实时榜单。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Gemini 3.1 Pro

在 Tabbit 中使用并对比模型

Gemini 3.1 Pro

相关测评

官方Google Blog / Gemini models2026-02-19

Gemini 3.1 Pro 官方发布:ARC-AGI-2 与产品定位基线

官方Google AI Developers Forum2026-04-07

Google AI 开发者论坛:4000 词复杂系统提示词下 Gemini 3.1 Pro 的指令遵循实测

媒体LayerLens / Stratix2026-02-19

LayerLens Stratix 对 Gemini 3.1 Pro Preview 的六类基准实测

媒体Artificial Analysis2026-02-19

Artificial Analysis 对 Gemini 3.1 Pro Preview 的 182 模型综合基准与端到端延迟实测

Gemini 3.1 Pro

相关提示词

官方Google AI for Developers / Gemini 3 Developer Guide2026-08-04

Gemini 3.1 Pro 的简洁指令与长上下文定位提示

官方Google AI for Developers / Gemini 3 Developer Guide 与 Gemini 3.1 Pro Preview 模型页2026-02

Gemini 3.1 Pro 的思考级别、结构化输出与工具配置

官方Google AI Developers Forum2026-04-07

Claude 主导规划、Gemini 隔离执行的 Spec 驱动编程工作流

社区GitHub / asgeirtj/systempromptsleaks2026-05-18

Gemini 3.1 Pro Web 端官方系统提示词与交互组件规范