Grok 4.6 · 媒体来源 · 独立测量
这条证据围绕“Artificial Analysis:Grok 4.6 的智能与成本评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
Artificial Analysis 将 Grok 4.6 评为 Intelligence Index 61,与 GPT-5.6 Sol 持平,仅落后 Claude Opus 5 和 Fable 5。该机构的解读是:Grok 4.6 的优势不只在静态推理,而在知识工作、客服工具调用、终端任务等 Agent 场景中的综合表现和成本效率。
Artificial Analysis Intelligence Index:61,比 Grok 4.5 高 5 分,比 Grok 4.3 高 23 分。
GDPval-AA v2:1753 Elo,仅次于 Claude Opus 5;与 Fable 5、Qwen3.8 Max 的置信区间重叠。
τ³-Banking:50.7%,处在最高分组,与 Qwen3.8 Max 的 51.3% 接近。
Terminal-Bench v2.1:88.4%,与领先模型处于同一水平。
AA-Briefcase:1577 Elo,接近 Fable 5 级别的长周期知识工作能力。
每个任务成本:约 $0.84。
AA-Briefcase 平均约 53 轮、0.5B 输入 tokens;对照的 Claude Opus 5 Max 约 103 轮、2.0B 输入 tokens。
Grok 4.6 的标价为输入 $2 / 1M tokens、输出 $6 / 1M tokens,缓存命中输入为 $0.5 / 1M tokens。Artificial Analysis 认为,相比 GPT-5.6 Sol 的 $5 / $30 和 Claude Opus 5 的 $5 / $25,Grok 4.6 在输出价格和任务成本上更有优势。
Artificial Analysis 的结果支持这样的使用判断:
需要多轮检索、资料整理、客服工具调用和长链路知识工作时,Grok 4.6 的优势更明显。
不能只看每百万 token 的标价,还要看完成同一任务所需的轮数和 token 数量。
Terminal-Bench v2.1 与 xAI 发布的 v3.0 是不同版本,不能直接把 88.4% 与 26% 当成矛盾数据。
AA-Briefcase 是 Artificial Analysis 的私有评测,不能等同于公开基准。所有结果仍应结合自己的代码库、工具链和长任务样本复测。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Artificial Analysis · 作者未公开 · 原文发布日期 2026-08-12 · 本站编辑日期 2026-09-20
打开原始来源Grok 4.6
下载 Tabbit 客户端后检查模型可用性