一部分用户认为 Grok 4.6 相比 4.5 的升级符合榜单趋势,尤其是在 Agentic 和编码任务上;另一部分用户认为过去 Grok 4.5 的公开分数与实际体验并不匹配,因此不愿仅凭 Intelligence Index 推断能力。
评论区还提到:
每个 AA 指数点的提升可能都很难获得,不能把 5 分提升看作普通的小幅变化。
Terminal-Bench 是公开成绩中较特殊的一行,不能忽略它与其他 coding/agentic 评测的差异。
在 Cursor 中,用户会根据技术栈和任务类型切换 Grok、Kimi、GPT 或其他模型。
这是一个关于“榜单和真实体验是否一致”的社区样本。它没有提供独立重跑数据,但说明模型选型必须同时看分项评测、实际 harness、任务成功率和用户自己的代码库。
Grok 4.6