Grok 4.7 · 媒体来源 · 独立测量
Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。
Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。
适合判断的任务:比较 Grok 4.7 (xhigh) 在 Artificial Analysis 统一 harness 下的综合智能指数,以及在 Grok Build 这一方编码代理里的 Coding Agent Index;判断 AA-Briefcase、GDPval-AA 这类长程知识工作,以及输出 token、解码时间和幻觉率。
不适合外推的任务:把本页分数换成 xAI 发布页的自报基准;把 Grok 4.6 的 high 与 xhigh 当成同一档;把 Coding Agent Index 里的 Terminal-Bench 4.0 当成 Intelligence Index 里的同名项目;把约 7.1 分钟理解成含首 token 和开销的端到端墙钟时间;把标价理解成本次评测的美元花费。
适用的模型版本:Grok 4.7,评测档位为 xhigh。对照里同时出现 Grok 4.6 (high) 和 Grok 4.6 (xhigh),二者分数不同。文章没有给出 Grok 4.7 的 low、medium、high 分数,也没有出现 Grok 4.7 Fast 或 fast variant。
测试环境或客户端:Intelligence Index 使用跨模型统一的 evaluation harness,具体软件名未注明。Coding Agent Index 对 Grok 使用其一方编码代理 Grok Build;同图其他模型使用各自的 native harness,图上可见 Claude Code、Codex、Muse Code、Opencode、Kimi Code CLI、Antigravity SDK。API provider、地区和硬件未注明。
推理档位和参数:文章写明可配置推理档位从 low 到 xhigh,本次评测使用 xhigh。温度、top-p、随机种子、最大输出、工具 schema、样本量和 fallback 的具体含义均为未注明。
这是 Artificial Analysis 2026-09-21 的独立评测文章,不是 xAI 发布说明。正文写 “We evaluated the new model at xhigh reasoning effort.” 分项图标题写 “Intelligence evaluations measured independently by Artificial Analysis”。
两套指数必须分开:
Artificial Analysis Intelligence Index v4.3。图注写明包含 10 项:AA-Briefcase、GDPval-AA v2、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。正文写明这套结果使用跨模型统一的 evaluation harness。
Artificial Analysis Coding Agent Index v1.5。图注写明包含 3 项:DeepSWE v1.1、Terminal-Bench 4.0、SWE-Atlas-QnA,Higher is better。Grok 的这套结果使用 Grok Build。正文写明它与 Intelligence Index 分开。
图上还有这些口径,均是 Artificial Analysis 的测量说明,不是 xAI 自报:
AA-Briefcase Elo:综合 rubric pass rate、analytical quality Elo 和 presentation Elo,Higher is better。
GDPval-AA v2:真实工作任务的 Elo,锚定人类基线 1,000,Higher is better。
编码三项分图:Average pass@1,Higher is better。
智能指数每题输出 token:加权平均,图例分开 Answer 与 Reasoning。
每题时间:加权平均解码时间(分钟),excludes TTFT and overhead time,Lower is better。
AA-Omniscience Index:分数范围 -100 到 100;答对加分,幻觉扣分,拒答不扣分;0 表示对与错一样多。
AA-Omniscience Accuracy:在全部问题中答对的比例,不论模型是否选择作答。
AA-Omniscience Hallucination Rate:在所有非正确回应中答错的比例,即 incorrect / (incorrect + partial answers + not attempted),Lower is better。
文末分项大图把 AA-Briefcase 和 GDPval-AA v2 画成 (Elo-500)/2000,所以那两格的百分数不是原始 Elo。Terminal-Bench 4.0 与 GDP.pdf 在该图上标了 NEW。GDP.pdf 的副标题是 “Professional document reasoning, All-pass”。
“Other model details” 里的上下文窗口和标价是文章列出的模型规格。它们不是 Intelligence Index 或 Coding Agent Index 的得分。
以下先列 Artificial Analysis 的测量,再列文章中的模型规格。
Artificial Analysis 测量
Intelligence Index:Grok 4.7 为 46,正文写比 Grok 4.6 高 2 分。指数图把 Grok 4.7 标为 (xhigh)、46,把 Grok 4.6 标为 (high)、44。
编码代理:Grok 4.7 (xhigh) + Grok Build 为 56,比 Grok 4.6 (xhigh) + Grok Build 的 47 高 9 分。正文称在 native harness 比较中排第 4,只落后于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。标题写 Coding Agent Index 超过 GPT-5.6 Sol。
AA-Briefcase:Grok 4.7 为 1657 Elo,比 Grok 4.6 (high) 高 111。分析质量 1994 Elo,展示质量 1499 Elo;Grok 4.6 (high) 分别为 1690 和 1519。展示质量低于 Grok 4.6 (high)。
GDPval-AA:Grok 4.7 为 1695 Elo,Grok 4.6 (high) 为 1605 Elo,正文写高出 90。
智能指数里、统一 harness 下,相对 Grok 4.6 (high):Terminal-Bench 4.0 高 4.5 个百分点,GDP.pdf 高 3.0 个百分点,AA-LCR 低 3.7 个百分点,AutomationBench-AA 低 1.1 个百分点。这四项的绝对分在正文里未给出。
Grok Build 分项,与上面的统一 harness 不是同一组数字:DeepSWE v1.1 从 65% 到 73%,Terminal-Bench 4.0 从 18% 到 33%,SWE-Atlas-QnA 从 58% 到 63%。对照对象是 Grok 4.6 (xhigh)。
输出 token:Grok 4.7 (xhigh) 每道智能指数题大约 81k。正文先与 Grok 4.6 (high) 的 36k、GPT-6 Astra (max) 的 27k 比较,并写分别多 125% 和 196%。后文又写 Grok 4.6 (xhigh) 为 38k,Muse Spark 1.3 (max) 为 60k,GPT-6 Astra (max) 仍为 27k。
速度与时间:长提示下答案输出速度大约 188 tokens/second。每道智能指数题大约 7.1 分钟;时间图把该指标定义为不含 TTFT 和 overhead 的解码时间。
AA-Omniscience:Grok 4.7 (xhigh) 的幻觉率 29%,Grok 4.6 (high) 为 34%。准确率 47% 对 48%。指数从 30 到 32。
文章列出的模型规格,不是本次得分
上下文窗口 500k tokens,与 Grok 4.6 相同。
价格为每百万 token 输入 $2、输出 $6,cache hit 为每百万 token $0.50,与 Grok 4.6 相同。
推理档位可从 low 配到 xhigh。
标题还写 Grok 4.7 使 SpaceXAI 进入 “top 4 AI labs”。文章没有列出这四家实验室的名单。指数图上 Grok 4.7 (xhigh) 的 46 低于 Claude Fable 5.1、GPT-6 Astra、Claude Opus 5、Claude Fable 5、Muse Spark 1.3 和 GPT-5.6 Sol。
采集日为 2026-09-22。Elo 图上有误差线,但没有印出区间端点,下表只记柱上的点估计。未印出的推理档位不补写。
图注所列 10 项见上文。柱序与图上从左到右一致。
| 模型与档位 | 指数 |
|---|---|
| Claude Fable 5.1 (max with fallback) | 53 |
| GPT-6 Astra (max) | 53 |
| Claude Opus 5 (max) | 51 |
| Claude Fable 5 (with fallback) | 50 |
| Muse Spark 1.3 (max) | 48 |
| GPT-5.6 Sol (max) | 47 |
| Grok 4.7 (xhigh) | 46 |
| Qwen3.8 Max (0902) | 45 |
| GLM-5.3 (max) | 45 |
| Grok 4.6 (high) | 44 |
| Step 5 Preview | 44 |
| Kimi K3 (max) | 44 |
| GPT-5.6 Terra (max) | 42 |
| GLM-5.3-Flash | 42 |
| Gemini 3.8 Flash (high) | 41 |
| DeepSeek V4.1 Flash (max) | 39 |
| GPT-5.6 Luna (max) | 37 |
| DeepSeek V4 Pro 0813 (max) | 36 |
| Qwen3.8 27B (xhigh) | 34 |
| K2-Horizon 375B A23B | 31 |
| MiniMax-M3 | 29 |
| Inkling | 25 |
| Nemotron 3 Ultra | 23 |
| Gemini 3.5 Flash-Lite | 22 |
| Muse Glimmer (high) | 17 |
| Mistral Medium 3.5 | 14 |
| gpt-oss-120b (high) | 12 |
Harness 与模型按图上标签分行。Grok 使用 Grok Build。
| Harness | 模型与档位 | 指数 |
|---|---|---|
| Claude Code | Fable 5.1 (max) (with fallback) | 62 |
| Codex | GPT-6 Astra (max) | 62 |
| Claude Code | Opus 5 (max) | 60 |
| Grok Build | Grok 4.7 (xhigh) | 56 |
| Codex | GPT-5.6 Sol (max) | 55 |
| Muse Code | Muse Spark 1.3 (max) | 54 |
| Opencode | GLM-5.3 | 54 |
| Kimi Code CLI | Kimi K3 | 52 |
| Grok Build | Grok 4.6 (xhigh) | 47 |
| Claude Code | Qwen3.8 Max | 43 |
| Codex | DeepSeek V4 Pro 0813 (max) | 43 |
| Antigravity SDK | Gemini 3.8 Flash (high) | 42 |
Grok Build 三项 pass@1,正文给出的是 Grok 4.7 (xhigh) 相对 Grok 4.6 (xhigh):
| 基准 | Grok 4.6 (xhigh) | Grok 4.7 (xhigh) |
|---|---|---|
| DeepSWE v1.1 | 65% | 73% |
| Terminal-Bench 4.0 | 18% | 33% |
| SWE-Atlas-QnA | 58% | 63% |
AA-Briefcase 图上 Grok 4.7 为 (xhigh)。GDPval 图同样把 Grok 4.7 标为 (xhigh)。人类基线为 1,000。
| 顺位 | AA-Briefcase 模型与档位 | Elo | GDPval-AA v2 模型与档位 | Elo |
|---|---|---|---|---|
| 1 | Claude Fable 5.1 (max with fallback) | 1678 | Claude Fable 5.1 (max with fallback) | 1735 |
| 2 | Claude Opus 5 (max) | 1673 | Claude Opus 5 (max) | 1708 |
| 3 | Grok 4.7 (xhigh) | 1657 | Grok 4.7 (xhigh) | 1695 |
| 4 | Qwen3.8 Max (0902) | 1640 | Muse Spark 1.3 (max) | 1674 |
| 5 | Muse Spark 1.3 (max) | 1597 | Qwen3.8 Max (0902) | 1668 |
| 6 | GPT-6 Astra (max) | 1569 | GLM-5.3 (max) | 1646 |
| 7 | Grok 4.6 (high) | 1546 | GLM-5.3-Flash | 1641 |
| 8 | Claude Fable 5 (with fallback) | 1543 | Grok 4.6 (high) | 1605 |
| 9 | GLM-5.3 (max) | 1525 | DeepSeek V4.1 Flash (max) | 1600 |
| 10 | Kimi K3 (max) | 1510 | Claude Fable 5 (with fallback) | 1595 |
| 11 | GPT-5.6 Sol (max) | 1487 | GPT-5.6 Sol (max) | 1588 |
| 12 | GLM-5.3-Flash | 1459 | Step 5 Preview | 1566 |
| 13 | Step 5 Preview | 1432 | GPT-6 Astra (max) | 1542 |
| 14 | DeepSeek V4.1 Flash (max) | 1432 | Kimi K3 (max) | 1524 |
| 15 | Qwen3.8 27B (xhigh) | 1403 | GPT-5.6 Luna (max) | 1443 |
| 16 | GPT-5.6 Luna (max) | 1345 | DeepSeek V4 Pro 0813 (max) | 1441 |
| 17 | GPT-5.6 Terra (max) | 1336 | GPT-5.6 Terra (max) | 1432 |
| 18 | K2-Horizon 375B A23B | 1303 | Gemini 3.8 Flash (high) | 1412 |
| 19 | DeepSeek V4 Pro 0813 (max) | 1261 | Qwen3.8 27B (xhigh) | 1409 |
| 20 | Gemini 3.8 Flash (high) | 1202 | K2-Horizon 375B A23B | 1349 |
| 21 | MiniMax-M3 | 1092 | MiniMax-M3 | 1230 |
| 22 | Nemotron 3 Ultra | 873 | Inkling | 1064 |
| 23 | Inkling | 829 | Nemotron 3 Ultra | 1000 |
| 24 | Gemini 3.5 Flash-Lite | 642 | Gemini 3.5 Flash-Lite | 970 |
| 25 | Mistral Medium 3.5 | 515 | Muse Glimmer (high) | 774 |
| 26 | Muse Glimmer (high) | 469 | Mistral Medium 3.5 | 747 |
| 27 | gpt-oss-120b (high) | 0 | gpt-oss-120b (high) | 596 |
正文另给 AA-Briefcase 的质量分,只覆盖这一对:
| 指标 | Grok 4.7 | Grok 4.6 (high) |
|---|---|---|
| 综合 Elo | 1657 | 1546 |
| Analytical quality Elo | 1994 | 1690 |
| Presentation quality Elo | 1499 | 1519 |
Grok 4.7 在这张质量分里的推理档位,正文未单独重复;同段综合 Elo 1657 与上表 (xhigh) 的 1657 相同。
智能指数每题输出 token。正文用 “approximately”。图上另印总分,并把 Answer 与 Reasoning 分成两段。11k 与 17k 相加不等于柱顶的 27k,表中保留图上印出的数字,不改写成能加总的值。
| 模型与档位 | 正文约数 | 图上总分 | 图上 Answer | 图上 Reasoning |
|---|---|---|---|---|
| GPT-6 Astra (max) | 27k | 27k | 11k | 17k |
| Grok 4.6 (high) | 36k | 36k | 17k | 19k |
| Grok 4.6 (xhigh) | 38k | 38k | 18k | 20k |
| Muse Spark 1.3 (max) | 60k | 60k | 26k | 34k |
| Grok 4.7 (xhigh) | 81k | 81k | 22k | 59k |
正文写 81k 比 36k 多 125%,比 27k 多 196%。
| 指标 | 数值 | 口径 |
|---|---|---|
| 答案输出速度 | 约 188 tokens/second | 正文:“for long prompts”。提示长度未注明 |
| 每道智能指数题时间 | 约 7.1 分钟 | 时间图:加权平均解码时间,不含 TTFT 和 overhead |
| 指标 | Grok 4.7 (xhigh) | Grok 4.6 (high) |
|---|---|---|
| Index | 32 | 30 |
| Accuracy | 47% | 48% |
| Hallucination Rate | 29% | 34% |
| 项目 | 文章原文 |
|---|---|
| 上下文窗口 | 500k tokens,与 Grok 4.6 相同 |
| 输入 / 输出价格 | 每百万 token $2 / $6 |
| Cache hit | 每百万 token $0.50 |
| 推理档位范围 | low 到 xhigh |
| 本次评测档位 | xhigh |
| 每道评测题的美元成本 | 未注明 |
Grok 4.7 (xhigh) 在这篇文章里的优势集中在两类任务:统一 harness 下的长程知识工作(AA-Briefcase 1657、GDPval-AA 1695),以及 Grok Build 上的编码代理指数(56)。分析质量 Elo 明显高于 Grok 4.6 (high),展示质量 Elo 更低。统一 harness 下的 Terminal-Bench 4.0 和 GDP.pdf 有小幅上升,AA-LCR 与 AutomationBench-AA 有小幅下降。这些升降的绝对分未在正文给出。
token 用量是边界的一部分。约 81k 输出 token 高于正文点名的 Grok 4.6 (high) 36k、Grok 4.6 (xhigh) 38k、Muse Spark 1.3 (max) 60k 和 GPT-6 Astra (max) 27k。图上 Grok 4.7 的 81k 里,Reasoning 段为 59k,Answer 段为 22k。
下列内容不能并进上面的测量:
xAI 发布页上的 CursorBench、DeepSWE、EEBench 等自报分数。本篇没有打开或引用那一页的数字。DeepSWE 与 Terminal-Bench 若要引用,只能使用本文的 Artificial Analysis / Grok Build 口径。
模型索引页。文章链到了该页,本篇没有用它补分数、provider 或价格。
high 与 xhigh。智能指数图上的 44 标的是 Grok 4.6 (high),与正文的 +2 分对应;AA-Briefcase、GDPval 和 Omniscience 的对照也是 Grok 4.6 (high)。编码代理对照是 Grok 4.6 (xhigh)。
两套 Terminal-Bench 4.0。统一 harness 只给了相对 Grok 4.6 (high) 的 +4.5 个百分点。Grok Build 给的是 18% 到 33%。
7.1 分钟。它是不含 TTFT 和 overhead 的解码时间。
$2 / $6 和 cache $0.50。这是标价。文章没有给出跑完智能指数或编码指数的美元成本。
“top 4 AI labs”。这是标题用语,文章没有给出实验室排名表。
样本量、置信区间数字、温度、种子、provider、API model ID,以及 “with fallback” 的含义,均为未注明。
打开 https://artificialanalysis.ai/articles/benchmarking-grok-4-7 ,核对日期 September 21, 2026 和标题中的指数 46。
先读正文,把 xhigh、Grok Build、统一 harness 分开。不要用模型索引页填补本文没有的字段。
指数、Elo、token 和编码代理分数在文内图片里。读柱顶数字和斜向模型名,保留图上的推理档位。Elo 图只复述点估计。
分项大图的 AA-Briefcase 与 GDPval 轴是 (Elo-500)/2000。不要把那些百分数当成原始 Elo,也不要当成正文里的 1657 或 1695。
文章没有公开题目清单、评分脚本、随机种子或请求参数,第三方不能按本文逐题重跑。能核对的是 2026-09-22 这一版页面上的指数版本、harness 名称、档位、Elo、token、时间和对照模型集合。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Artificial Analysis · Artificial Analysis(页面 JSON-LD 的作者类型为 Organization) · 原文发布日期 2026-09-21 · 本站编辑日期 2026-09-22
打开原始来源Grok 4.7
下载 Tabbit 客户端后检查模型可用性