KIE 将 Grok 4.6 的 Intelligence Index 概括为 61,与 GPT-5.6 Sol 持平;价格为输入 $2、输出 $6 / 1M tokens。文章认为它的主要卖点是价格-智能比,而不是在所有单项评测上都领先。
Grok 4.6 的强项集中在知识工作和法律推理:GDPVal-AA 1753、AA-Briefcase 1577、Harvey LAB 15.8%。
Terminal-Bench v3.0 为 26%,低于 GPT-5.6 Sol 的 34.6%,是发布表中最明显的短板之一。
DeepSWE v1.1 为 65.9%,比 Grok 4.5 的 54% 有较大提升,但仍低于 Sol 的 73%。
APEX-Agents 从 47.1% 提升到 57.5%,显示长链路 Agent 任务有明显进步。
文章强调,截至 2026-08-13,公开数据中还没有完整的独立第三方复现。表格中的竞品结果来自各自公开成绩,不能替代统一 harness 下的实测。
Grok 4.6