Artificial Analysis 将 Grok 4.6 评为 Intelligence Index 61,与 GPT-5.6 Sol 持平,仅落后 Claude Opus 5 和 Fable 5。该机构的解读是:Grok 4.6 的优势不只在静态推理,而在知识工作、客服工具调用、终端任务等 Agent 场景中的综合表现和成本效率。
Artificial Analysis Intelligence Index:61,比 Grok 4.5 高 5 分,比 Grok 4.3 高 23 分。
GDPval-AA v2:1753 Elo,仅次于 Claude Opus 5;与 Fable 5、Qwen3.8 Max 的置信区间重叠。
τ³-Banking:50.7%,处在最高分组,与 Qwen3.8 Max 的 51.3% 接近。
Terminal-Bench v2.1:88.4%,与领先模型处于同一水平。
AA-Briefcase:1577 Elo,接近 Fable 5 级别的长周期知识工作能力。
每个任务成本:约 $0.84。
AA-Briefcase 平均约 53 轮、0.5B 输入 tokens;对照的 Claude Opus 5 Max 约 103 轮、2.0B 输入 tokens。
Grok 4.6 的标价为输入 $2 / 1M tokens、输出 $6 / 1M tokens,缓存命中输入为 $0.5 / 1M tokens。Artificial Analysis 认为,相比 GPT-5.6 Sol 的 $5 / $30 和 Claude Opus 5 的 $5 / $25,Grok 4.6 在输出价格和任务成本上更有优势。
Artificial Analysis 的结果支持这样的使用判断:
需要多轮检索、资料整理、客服工具调用和长链路知识工作时,Grok 4.6 的优势更明显。
不能只看每百万 token 的标价,还要看完成同一任务所需的轮数和 token 数量。
Terminal-Bench v2.1 与 xAI 发布的 v3.0 是不同版本,不能直接把 88.4% 与 26% 当成矛盾数据。
AA-Briefcase 是 Artificial Analysis 的私有评测,不能等同于公开基准。所有结果仍应结合自己的代码库、工具链和长任务样本复测。
Grok 4.6