作者基于 xAI 发布的十行评测表做了逐项计数:在与 GPT-5.6 Sol Max 共同有成绩的 9 行中,Grok 4.6 赢 6 行,只输 DeepSWE v1.1 和 Terminal-Bench v3.0;对 Fable 5 Max 的十行比较中,Grok 赢 3 行、输 7 行。
Intelligence Index:Grok 4.6 与 Sol Max 均为 61,Fable 5 Max 为 62。
GDPval-AA v2:Grok 1753,高于 Sol 的 1728 和 Fable 的 1741。
AA-Briefcase:Grok 1577,高于 Sol 的 1502,略高于 Fable 的 1574。
Harvey LAB:Grok 15.8%,Sol 2.5%,Fable 11.3%。作者认为这个六倍差距更像是评测口径或模型适配差异的信号,不宜单独证明法律能力差距。
CursorBench v3.2:Grok 69.9%,略低于 Fable 70.5%。
DeepSWE v1.1:Grok 65.9%,低于 Sol 73%,但明显高于 Grok 4.5 的 54%。
Terminal-Bench v3.0:Grok 26%,低于 Sol 34.6% 和 Fable 34.1%。
APEX-Agents:Grok 57.5%,高于 Sol 56.7%,低于 Fable 59.2%。
作者指出,xAI 的表格混合了不同推理 effort 和不同测试 harness:Grok 4.6、Grok 4.5 使用 High,竞品使用 Max;竞品数字还是各自自报或公开成绩。因此,“赢 6/9”是对已发布数字的计数,不是统一条件下的新实验。
这篇文章适合用来识别成绩单中的强项和缺口,不能替代同一代码库、同一 Agent harness 下的实测。
Grok 4.6