Grok 4.6 的定位是长任务 Agent、编码、知识工作和交互式/视觉项目。官方称其在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平,综合分 61;但官方表格同时显示,它在知识工作类评测更强,在 DeepSWE、Terminal-Bench 等软件工程评测上落后于 GPT-5.6 Sol Max。
| 评测 | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1(Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB(Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
长任务中保持上下文,在研究、代码库操作和应用构建之间持续推进。
在 GDPVal-AA v2、AA-Briefcase 和 Harvey LAB 等知识工作/法律工作评测中表现突出。
训练覆盖通用编码、知识工作、内核优化、Web 开发和 CAD 等 Agent 环境。
官方称长轨迹中出现更多自测和验证行为。
上下文窗口:500,000 tokens
输入价格:$2 / 1M tokens
输出价格:$6 / 1M tokens
可用渠道:Cursor、Grok Build、API、OpenRouter、Vercel、Cloudflare 等
官方注明,竞品分数来自各自开发者发布的 system card 或公开榜单,不是同一实验环境下的四模型重跑。因此,表格适合做方向判断,不应当视为严格的横向实验结论。尤其是 Terminal-Bench 的版本、推理档位和运行 harness 都会影响结果。
Grok 4.6