评论区引用了 Grok 4.6 在 DeepSWE v1.1 上的 65.9%,并指出它高于 DeepSeek V4 Pro 0813 的 62.7%。这说明 Grok 4.6 相比 Grok 4.5 的 54% 有明显进步,但仍低于 GPT-5.6 Sol Max 的 73%。
帖子还讨论了 Terminal-Bench 的版本变化:从 2.1 到 3.0 后,原本接近 90% 的模型可能回落到约 30%,因此不能把不同版本的分数直接比较。
有用户在 Cursor Enterprise 中使用 Grok 4.6,认为它适合大量 token 的工作。
有用户认为 Grok 4.6 的能力接近 Opus 5,但 500K 上下文对某些架构师型工作仍有限制。
另一类评论将 Grok 4.6 用于简单 E2E 任务和子 Agent,评价是“足够聪明且很快”。
也有评论认为 DeepSWE 只反映仓库任务和隐藏测试,不能代表真实开发中的架构、可维护性和长期协作。
这个帖子更像社区对公开成绩的快速解读,而不是独立重跑。它的价值在于提醒读者:Grok 4.6 的编码成绩要同时看 DeepSWE、Terminal-Bench 的版本和测试目标,并把“适合子 Agent 的速度”与“独立完成复杂工程的稳定性”分开评价。
Grok 4.6