Grok 4.6 · 社区来源 · 个人体验
一部分用户认为 Grok 4.6 相比 4.5 的升级符合榜单趋势,尤其是在 Agentic 和编码任务上;另一部分用户认为过去 Grok 4.5 的公开分数与实际体验并不匹配,因此不愿仅凭 Intelligence Index 推断能力。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
一部分用户认为 Grok 4.6 相比 4.5 的升级符合榜单趋势,尤其是在 Agentic 和编码任务上;另一部分用户认为过去 Grok 4.5 的公开分数与实际体验并不匹配,因此不愿仅凭 Intelligence Index 推断能力。
评论区还提到:
每个 AA 指数点的提升可能都很难获得,不能把 5 分提升看作普通的小幅变化。
Terminal-Bench 是公开成绩中较特殊的一行,不能忽略它与其他 coding/agentic 评测的差异。
在 Cursor 中,用户会根据技术栈和任务类型切换 Grok、Kimi、GPT 或其他模型。
这是一个关于“榜单和真实体验是否一致”的社区样本。它没有提供独立重跑数据,但说明模型选型必须同时看分项评测、实际 harness、任务成功率和用户自己的代码库。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Reddit r/cursor · 作者未公开 · 原文发布日期 Unknown · 本站编辑日期 2026-09-20
打开原始来源Grok 4.6
下载 Tabbit 客户端后检查模型可用性