Grok 4.6 · 社区来源 · 个人体验
这条证据围绕“Reddit r/cursor:Grok 4.6 与 GPT-5.6 Sol 的同任务对比”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
作者在 Cursor 中用 Grok 4.6 Extra High 和 GPT-5.6 Sol Medium 执行同一个详细后端方案,起点和计划相同,任务规模约 2,500 行代码;由 Fable 5 High 作为独立评审。
作者给出的近似评分为 Sol 60、Grok 40。Sol 在资金相关边界条件、竞态风险和整体架构方面更好,测试也更有针对性。
成本方面,作者称 Grok 的 Cursor 用量几乎没有变化,而 Sol 消耗了 200 美元订阅月度额度的约 5%。评论区提醒,前后运行顺序、分支残留和上下文污染可能影响结果;作者回复称 Grok 先运行,并快速检查过 Sol 的思考过程,未发现它读取 Git 历史。
有用户认为 Grok 4.6 如果第一次不成功,凭借低成本和速度可以接受第二次尝试。
有用户指出 Grok 4.6 相比 4.5 可能消耗更多 reasoning tokens 和工具调用,因此“每 token 价格相同”不代表“每任务成本相同”。
讨论还提醒 Cursor、Codex 等不同 harness 会改变模型表现。
这是一项小样本、单任务的工程体验,不足以推翻公开榜单。但它清楚展示了 Grok 4.6 的边界:在复杂后端实现中,成本优势明显;在金钱逻辑、竞态和架构级边界处理上,Sol 可能更稳。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Reddit r/cursor · 作者未公开 · 原文发布日期 Unknown · 本站编辑日期 2026-09-20
打开原始来源Grok 4.6
下载 Tabbit 客户端后检查模型可用性