Emergent 认为,Grok 4.6 的公开成绩呈现出明显的能力分布:知识工作评测强,纯软件工程评测相对弱。它的 Intelligence Index 为 61,与 GPT-5.6 Sol 持平;但在 DeepSWE v1.1 和 Terminal-Bench v3.0 上分别落后 GPT-5.6 Sol 7.1 和 8.6 个百分点。
| 评测 | Grok 4.6 | Grok 4.5 | GPT-5.6 Sol | Fable 5 |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPval-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB | 15.8% | 12.9% | 2.5% | 11.3% |
Grok 4.6 在 GDPval-AA、AA-Briefcase 和 Harvey 法律工作评测上拿到表内最高分,说明它更适合研究、分析、文档和专业知识工作。
它相较 Grok 4.5 在所有公开行上都有提升,Agent 类任务的提升尤其明显。
Artificial Analysis 额外测得 65.7% non-hallucination rate。这个指标对客服、知识库和面向用户的 Agent 很重要,但不应与“事实准确率”简单画等号。
文章提醒,xAI 的表格是“各模型自报或公开最佳成绩”的并置,不是严格控制变量的同场重测。Terminal-Bench v2.1 和 v3.0 的成绩差异也说明,引用 benchmark 时必须写清版本号、推理档位和测试来源。
Grok 4.6