该讨论把 Gemini 3.1 Pro 的 ARC-AGI-2/HLE 发布成绩与 Arena 偏好排名并置,提醒部署选择要用同环境同输入的任务评测,而不能只看静态榜或“喜欢度”。
环境:Reddit 对 Google 发布数据、Arena 排名和模型部署选择的讨论。
输入/配置:帖子引用 ARC-AGI-2 77.1%、Humanity’s Last Exam 44.4%,并观察 Arena 文本/代码榜的相对位置;没有统一 API、工具或重复运行。
结果形式:观点与链接,不是受控实验。
帖子没有公开可复制的完整提示词或完整输出,因此不能把它包装为 prompt。可复用的评测流程建议是:相同模型版本、相同输入、相同工具和相同运行预算,在目标 Agent 环境中进行对照,并分开记录正确性与用户偏好。
帖子引用 Gemini 3.1 Pro ARC-AGI-2 77.1%,并称 Humanity’s Last Exam 44.4%。
帖子称 Arena 文本榜中 Claude Opus 4.6 仍领先 Gemini 3.1 Pro 约 4 分;代码榜中 Opus 4.6、Opus 4.5 和 GPT-5.2 High 位于其前。
作者指出 ARC-AGI-2 更接近静态能力测试,而 Arena 投票更多反映用户喜欢的输出;两者都不是同工具环境中的 live adversarial test。
如果任务偏抽象推理,Gemini 3.1 Pro 的官方/社区基准值得重视;如果任务偏编码、对话风格或工具 Agent,应在真实环境中预注册成功标准,避免把 Arena 偏好或单一 benchmark 当成部署结论。
Reddit 用户身份、引用的时间点和 Arena 具体快照无法在帖子中完整核实。
帖子没有运行原始任务,数据主要来自转述的官方成绩和排行榜。
“领先几分”可能随 Arena 榜单实时变化;采集时只作为讨论中的观察,不作稳定事实。
固定 Gemini 3.1 Pro 和对照模型的 API snapshot、thinking level、温度、工具集和 token 预算。
构造包含抽象推理、代码修复、工具调用、长上下文和偏好盲评的任务集。
把正确率、resolved、工具调用成功率、成本和延迟与盲评偏好分开统计。
记录所有 prompt、输出和失败案例;每次榜单或模型版本更新后重新跑,不把旧帖子当实时榜单。
Gemini 3.1 Pro