作者在 Cursor 中用 Grok 4.6 Extra High 和 GPT-5.6 Sol Medium 执行同一个详细后端方案,起点和计划相同,任务规模约 2,500 行代码;由 Fable 5 High 作为独立评审。
作者给出的近似评分为 Sol 60、Grok 40。Sol 在资金相关边界条件、竞态风险和整体架构方面更好,测试也更有针对性。
成本方面,作者称 Grok 的 Cursor 用量几乎没有变化,而 Sol 消耗了 200 美元订阅月度额度的约 5%。评论区提醒,前后运行顺序、分支残留和上下文污染可能影响结果;作者回复称 Grok 先运行,并快速检查过 Sol 的思考过程,未发现它读取 Git 历史。
有用户认为 Grok 4.6 如果第一次不成功,凭借低成本和速度可以接受第二次尝试。
有用户指出 Grok 4.6 相比 4.5 可能消耗更多 reasoning tokens 和工具调用,因此“每 token 价格相同”不代表“每任务成本相同”。
讨论还提醒 Cursor、Codex 等不同 harness 会改变模型表现。
这是一项小样本、单任务的工程体验,不足以推翻公开榜单。但它清楚展示了 Grok 4.6 的边界:在复杂后端实现中,成本优势明显;在金钱逻辑、竞态和架构级边界处理上,Sol 可能更稳。
Grok 4.6