Grok 4.6 · 媒体来源 · 编辑分析
作者基于 xAI 发布的十行评测表做了逐项计数:在与 GPT-5.6 Sol Max 共同有成绩的 9 行中,Grok 4.6 赢 6 行,只输 DeepSWE v1.1 和 Terminal-Bench v3.0;对 Fable 5 Max 的十行比较中,Grok 赢 3 行、输 7 行。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
作者基于 xAI 发布的十行评测表做了逐项计数:在与 GPT-5.6 Sol Max 共同有成绩的 9 行中,Grok 4.6 赢 6 行,只输 DeepSWE v1.1 和 Terminal-Bench v3.0;对 Fable 5 Max 的十行比较中,Grok 赢 3 行、输 7 行。
Intelligence Index:Grok 4.6 与 Sol Max 均为 61,Fable 5 Max 为 62。
GDPval-AA v2:Grok 1753,高于 Sol 的 1728 和 Fable 的 1741。
AA-Briefcase:Grok 1577,高于 Sol 的 1502,略高于 Fable 的 1574。
Harvey LAB:Grok 15.8%,Sol 2.5%,Fable 11.3%。作者认为这个六倍差距更像是评测口径或模型适配差异的信号,不宜单独证明法律能力差距。
CursorBench v3.2:Grok 69.9%,略低于 Fable 70.5%。
DeepSWE v1.1:Grok 65.9%,低于 Sol 73%,但明显高于 Grok 4.5 的 54%。
Terminal-Bench v3.0:Grok 26%,低于 Sol 34.6% 和 Fable 34.1%。
APEX-Agents:Grok 57.5%,高于 Sol 56.7%,低于 Fable 59.2%。
作者指出,xAI 的表格混合了不同推理 effort 和不同测试 harness:Grok 4.6、Grok 4.5 使用 High,竞品使用 Max;竞品数字还是各自自报或公开成绩。因此,“赢 6/9”是对已发布数字的计数,不是统一条件下的新实验。
这篇文章适合用来识别成绩单中的强项和缺口,不能替代同一代码库、同一 Agent harness 下的实测。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Medium / Data Science Collective · Mehmet Özel · 原文发布日期 2026-08-13 · 本站编辑日期 2026-09-20
打开原始来源Grok 4.6
下载 Tabbit 客户端后检查模型可用性