Grok 4.6 · 媒体来源 · 编辑分析
KIE 将 Grok 4.6 的 Intelligence Index 概括为 61,与 GPT-5.6 Sol 持平;价格为输入 $2、输出 $6 / 1M tokens。文章认为它的主要卖点是价格-智能比,而不是在所有单项评测上都领先。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
KIE 将 Grok 4.6 的 Intelligence Index 概括为 61,与 GPT-5.6 Sol 持平;价格为输入 $2、输出 $6 / 1M tokens。文章认为它的主要卖点是价格-智能比,而不是在所有单项评测上都领先。
Grok 4.6 的强项集中在知识工作和法律推理:GDPVal-AA 1753、AA-Briefcase 1577、Harvey LAB 15.8%。
Terminal-Bench v3.0 为 26%,低于 GPT-5.6 Sol 的 34.6%,是发布表中最明显的短板之一。
DeepSWE v1.1 为 65.9%,比 Grok 4.5 的 54% 有较大提升,但仍低于 Sol 的 73%。
APEX-Agents 从 47.1% 提升到 57.5%,显示长链路 Agent 任务有明显进步。
文章强调,截至 2026-08-13,公开数据中还没有完整的独立第三方复现。表格中的竞品结果来自各自公开成绩,不能替代统一 harness 下的实测。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
KIE.ai Blog · Sofia Marenco(Model Evaluation Lead) · 原文发布日期 2026-08-13 · 本站编辑日期 2026-09-20
打开原始来源Grok 4.6
下载 Tabbit 客户端后检查模型可用性