Grok 4.6 · 社区来源 · 个人体验
评论区引用了 Grok 4.6 在 DeepSWE v1.1 上的 65.9%,并指出它高于 DeepSeek V4 Pro 0813 的 62.7%。这说明 Grok 4.6 相比 Grok 4.5 的 54% 有明显进步,但仍低于 GPT-5.6 Sol Max 的 73%。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
评论区引用了 Grok 4.6 在 DeepSWE v1.1 上的 65.9%,并指出它高于 DeepSeek V4 Pro 0813 的 62.7%。这说明 Grok 4.6 相比 Grok 4.5 的 54% 有明显进步,但仍低于 GPT-5.6 Sol Max 的 73%。
帖子还讨论了 Terminal-Bench 的版本变化:从 2.1 到 3.0 后,原本接近 90% 的模型可能回落到约 30%,因此不能把不同版本的分数直接比较。
有用户在 Cursor Enterprise 中使用 Grok 4.6,认为它适合大量 token 的工作。
有用户认为 Grok 4.6 的能力接近 Opus 5,但 500K 上下文对某些架构师型工作仍有限制。
另一类评论将 Grok 4.6 用于简单 E2E 任务和子 Agent,评价是“足够聪明且很快”。
也有评论认为 DeepSWE 只反映仓库任务和隐藏测试,不能代表真实开发中的架构、可维护性和长期协作。
这个帖子更像社区对公开成绩的快速解读,而不是独立重跑。它的价值在于提醒读者:Grok 4.6 的编码成绩要同时看 DeepSWE、Terminal-Bench 的版本和测试目标,并把“适合子 Agent 的速度”与“独立完成复杂工程的稳定性”分开评价。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Reddit r/opencodeCLI · 作者未公开 · 原文发布日期 Unknown · 本站编辑日期 2026-09-20
打开原始来源Grok 4.6
下载 Tabbit 客户端后检查模型可用性