Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Grok 4.7 · 媒体来源 · 独立测量

Artificial Analysis:Grok 4.7 的智能指数与编码代理

Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。

媒体来源独立测量编辑日期 2026-09-22

测试条件速查

来源具体观察
Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。
已公布条件
把本页分数换成 xAI 发布页的自报基准;把 Grok 4.6 的 high 与 xhigh 当成同一档;把 Coding Agent Index 里的 Terminal-Bench 4.0 当成 Intelligence Index 里的同名项目;把约 7.1 分钟理解成含首 token 和开销的端到端墙钟时间;把标价理解成本次评测的美元花费。

关键数据与适用场景

一句话结论

Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。

适用场景

  • 适合判断的任务:比较 Grok 4.7 (xhigh) 在 Artificial Analysis 统一 harness 下的综合智能指数,以及在 Grok Build 这一方编码代理里的 Coding Agent Index;判断 AA-Briefcase、GDPval-AA 这类长程知识工作,以及输出 token、解码时间和幻觉率。

  • 不适合外推的任务:把本页分数换成 xAI 发布页的自报基准;把 Grok 4.6 的 high 与 xhigh 当成同一档;把 Coding Agent Index 里的 Terminal-Bench 4.0 当成 Intelligence Index 里的同名项目;把约 7.1 分钟理解成含首 token 和开销的端到端墙钟时间;把标价理解成本次评测的美元花费。

  • 适用的模型版本:Grok 4.7,评测档位为 xhigh。对照里同时出现 Grok 4.6 (high) 和 Grok 4.6 (xhigh),二者分数不同。文章没有给出 Grok 4.7 的 low、medium、high 分数,也没有出现 Grok 4.7 Fast 或 fast variant。

  • 测试环境或客户端:Intelligence Index 使用跨模型统一的 evaluation harness,具体软件名未注明。Coding Agent Index 对 Grok 使用其一方编码代理 Grok Build;同图其他模型使用各自的 native harness,图上可见 Claude Code、Codex、Muse Code、Opencode、Kimi Code CLI、Antigravity SDK。API provider、地区和硬件未注明。

  • 推理档位和参数:文章写明可配置推理档位从 low 到 xhigh,本次评测使用 xhigh。温度、top-p、随机种子、最大输出、工具 schema、样本量和 fallback 的具体含义均为未注明。

测评方法

这是 Artificial Analysis 2026-09-21 的独立评测文章,不是 xAI 发布说明。正文写 “We evaluated the new model at xhigh reasoning effort.” 分项图标题写 “Intelligence evaluations measured independently by Artificial Analysis”。

两套指数必须分开:

  • Artificial Analysis Intelligence Index v4.3。图注写明包含 10 项:AA-Briefcase、GDPval-AA v2、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。正文写明这套结果使用跨模型统一的 evaluation harness。

  • Artificial Analysis Coding Agent Index v1.5。图注写明包含 3 项:DeepSWE v1.1、Terminal-Bench 4.0、SWE-Atlas-QnA,Higher is better。Grok 的这套结果使用 Grok Build。正文写明它与 Intelligence Index 分开。

图上还有这些口径,均是 Artificial Analysis 的测量说明,不是 xAI 自报:

  • AA-Briefcase Elo:综合 rubric pass rate、analytical quality Elo 和 presentation Elo,Higher is better。

  • GDPval-AA v2:真实工作任务的 Elo,锚定人类基线 1,000,Higher is better。

  • 编码三项分图:Average pass@1,Higher is better。

  • 智能指数每题输出 token:加权平均,图例分开 Answer 与 Reasoning。

  • 每题时间:加权平均解码时间(分钟),excludes TTFT and overhead time,Lower is better。

  • AA-Omniscience Index:分数范围 -100 到 100;答对加分,幻觉扣分,拒答不扣分;0 表示对与错一样多。

  • AA-Omniscience Accuracy:在全部问题中答对的比例,不论模型是否选择作答。

  • AA-Omniscience Hallucination Rate:在所有非正确回应中答错的比例,即 incorrect / (incorrect + partial answers + not attempted),Lower is better。

文末分项大图把 AA-Briefcase 和 GDPval-AA v2 画成 (Elo-500)/2000,所以那两格的百分数不是原始 Elo。Terminal-Bench 4.0 与 GDP.pdf 在该图上标了 NEW。GDP.pdf 的副标题是 “Professional document reasoning, All-pass”。

“Other model details” 里的上下文窗口和标价是文章列出的模型规格。它们不是 Intelligence Index 或 Coding Agent Index 的得分。

关键结果

以下先列 Artificial Analysis 的测量,再列文章中的模型规格。

Artificial Analysis 测量

  • Intelligence Index:Grok 4.7 为 46,正文写比 Grok 4.6 高 2 分。指数图把 Grok 4.7 标为 (xhigh)、46,把 Grok 4.6 标为 (high)、44。

  • 编码代理:Grok 4.7 (xhigh) + Grok Build 为 56,比 Grok 4.6 (xhigh) + Grok Build 的 47 高 9 分。正文称在 native harness 比较中排第 4,只落后于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。标题写 Coding Agent Index 超过 GPT-5.6 Sol。

  • AA-Briefcase:Grok 4.7 为 1657 Elo,比 Grok 4.6 (high) 高 111。分析质量 1994 Elo,展示质量 1499 Elo;Grok 4.6 (high) 分别为 1690 和 1519。展示质量低于 Grok 4.6 (high)。

  • GDPval-AA:Grok 4.7 为 1695 Elo,Grok 4.6 (high) 为 1605 Elo,正文写高出 90。

  • 智能指数里、统一 harness 下,相对 Grok 4.6 (high):Terminal-Bench 4.0 高 4.5 个百分点,GDP.pdf 高 3.0 个百分点,AA-LCR 低 3.7 个百分点,AutomationBench-AA 低 1.1 个百分点。这四项的绝对分在正文里未给出。

  • Grok Build 分项,与上面的统一 harness 不是同一组数字:DeepSWE v1.1 从 65% 到 73%,Terminal-Bench 4.0 从 18% 到 33%,SWE-Atlas-QnA 从 58% 到 63%。对照对象是 Grok 4.6 (xhigh)。

  • 输出 token:Grok 4.7 (xhigh) 每道智能指数题大约 81k。正文先与 Grok 4.6 (high) 的 36k、GPT-6 Astra (max) 的 27k 比较,并写分别多 125% 和 196%。后文又写 Grok 4.6 (xhigh) 为 38k,Muse Spark 1.3 (max) 为 60k,GPT-6 Astra (max) 仍为 27k。

  • 速度与时间:长提示下答案输出速度大约 188 tokens/second。每道智能指数题大约 7.1 分钟;时间图把该指标定义为不含 TTFT 和 overhead 的解码时间。

  • AA-Omniscience:Grok 4.7 (xhigh) 的幻觉率 29%,Grok 4.6 (high) 为 34%。准确率 47% 对 48%。指数从 30 到 32。

文章列出的模型规格,不是本次得分

  • 上下文窗口 500k tokens,与 Grok 4.6 相同。

  • 价格为每百万 token 输入 $2、输出 $6,cache hit 为每百万 token $0.50,与 Grok 4.6 相同。

  • 推理档位可从 low 配到 xhigh。

标题还写 Grok 4.7 使 SpaceXAI 进入 “top 4 AI labs”。文章没有列出这四家实验室的名单。指数图上 Grok 4.7 (xhigh) 的 46 低于 Claude Fable 5.1、GPT-6 Astra、Claude Opus 5、Claude Fable 5、Muse Spark 1.3 和 GPT-5.6 Sol。

原始数据

采集日为 2026-09-22。Elo 图上有误差线,但没有印出区间端点,下表只记柱上的点估计。未印出的推理档位不补写。

1. Intelligence Index v4.3

图注所列 10 项见上文。柱序与图上从左到右一致。

模型与档位指数
Claude Fable 5.1 (max with fallback)53
GPT-6 Astra (max)53
Claude Opus 5 (max)51
Claude Fable 5 (with fallback)50
Muse Spark 1.3 (max)48
GPT-5.6 Sol (max)47
Grok 4.7 (xhigh)46
Qwen3.8 Max (0902)45
GLM-5.3 (max)45
Grok 4.6 (high)44
Step 5 Preview44
Kimi K3 (max)44
GPT-5.6 Terra (max)42
GLM-5.3-Flash42
Gemini 3.8 Flash (high)41
DeepSeek V4.1 Flash (max)39
GPT-5.6 Luna (max)37
DeepSeek V4 Pro 0813 (max)36
Qwen3.8 27B (xhigh)34
K2-Horizon 375B A23B31
MiniMax-M329
Inkling25
Nemotron 3 Ultra23
Gemini 3.5 Flash-Lite22
Muse Glimmer (high)17
Mistral Medium 3.514
gpt-oss-120b (high)12

2. Coding Agent Index v1.5

Harness 与模型按图上标签分行。Grok 使用 Grok Build。

Harness模型与档位指数
Claude CodeFable 5.1 (max) (with fallback)62
CodexGPT-6 Astra (max)62
Claude CodeOpus 5 (max)60
Grok BuildGrok 4.7 (xhigh)56
CodexGPT-5.6 Sol (max)55
Muse CodeMuse Spark 1.3 (max)54
OpencodeGLM-5.354
Kimi Code CLIKimi K352
Grok BuildGrok 4.6 (xhigh)47
Claude CodeQwen3.8 Max43
CodexDeepSeek V4 Pro 0813 (max)43
Antigravity SDKGemini 3.8 Flash (high)42

Grok Build 三项 pass@1,正文给出的是 Grok 4.7 (xhigh) 相对 Grok 4.6 (xhigh):

基准Grok 4.6 (xhigh)Grok 4.7 (xhigh)
DeepSWE v1.165%73%
Terminal-Bench 4.018%33%
SWE-Atlas-QnA58%63%

3. AA-Briefcase Elo 与 GDPval-AA v2

AA-Briefcase 图上 Grok 4.7 为 (xhigh)。GDPval 图同样把 Grok 4.7 标为 (xhigh)。人类基线为 1,000。

顺位AA-Briefcase 模型与档位EloGDPval-AA v2 模型与档位Elo
1Claude Fable 5.1 (max with fallback)1678Claude Fable 5.1 (max with fallback)1735
2Claude Opus 5 (max)1673Claude Opus 5 (max)1708
3Grok 4.7 (xhigh)1657Grok 4.7 (xhigh)1695
4Qwen3.8 Max (0902)1640Muse Spark 1.3 (max)1674
5Muse Spark 1.3 (max)1597Qwen3.8 Max (0902)1668
6GPT-6 Astra (max)1569GLM-5.3 (max)1646
7Grok 4.6 (high)1546GLM-5.3-Flash1641
8Claude Fable 5 (with fallback)1543Grok 4.6 (high)1605
9GLM-5.3 (max)1525DeepSeek V4.1 Flash (max)1600
10Kimi K3 (max)1510Claude Fable 5 (with fallback)1595
11GPT-5.6 Sol (max)1487GPT-5.6 Sol (max)1588
12GLM-5.3-Flash1459Step 5 Preview1566
13Step 5 Preview1432GPT-6 Astra (max)1542
14DeepSeek V4.1 Flash (max)1432Kimi K3 (max)1524
15Qwen3.8 27B (xhigh)1403GPT-5.6 Luna (max)1443
16GPT-5.6 Luna (max)1345DeepSeek V4 Pro 0813 (max)1441
17GPT-5.6 Terra (max)1336GPT-5.6 Terra (max)1432
18K2-Horizon 375B A23B1303Gemini 3.8 Flash (high)1412
19DeepSeek V4 Pro 0813 (max)1261Qwen3.8 27B (xhigh)1409
20Gemini 3.8 Flash (high)1202K2-Horizon 375B A23B1349
21MiniMax-M31092MiniMax-M31230
22Nemotron 3 Ultra873Inkling1064
23Inkling829Nemotron 3 Ultra1000
24Gemini 3.5 Flash-Lite642Gemini 3.5 Flash-Lite970
25Mistral Medium 3.5515Muse Glimmer (high)774
26Muse Glimmer (high)469Mistral Medium 3.5747
27gpt-oss-120b (high)0gpt-oss-120b (high)596

正文另给 AA-Briefcase 的质量分,只覆盖这一对:

指标Grok 4.7Grok 4.6 (high)
综合 Elo16571546
Analytical quality Elo19941690
Presentation quality Elo14991519

Grok 4.7 在这张质量分里的推理档位,正文未单独重复;同段综合 Elo 1657 与上表 (xhigh) 的 1657 相同。

4. 输出 token、时间、速度

智能指数每题输出 token。正文用 “approximately”。图上另印总分,并把 Answer 与 Reasoning 分成两段。11k 与 17k 相加不等于柱顶的 27k,表中保留图上印出的数字,不改写成能加总的值。

模型与档位正文约数图上总分图上 Answer图上 Reasoning
GPT-6 Astra (max)27k27k11k17k
Grok 4.6 (high)36k36k17k19k
Grok 4.6 (xhigh)38k38k18k20k
Muse Spark 1.3 (max)60k60k26k34k
Grok 4.7 (xhigh)81k81k22k59k

正文写 81k 比 36k 多 125%,比 27k 多 196%。

指标数值口径
答案输出速度约 188 tokens/second正文:“for long prompts”。提示长度未注明
每道智能指数题时间约 7.1 分钟时间图:加权平均解码时间,不含 TTFT 和 overhead

5. AA-Omniscience

指标Grok 4.7 (xhigh)Grok 4.6 (high)
Index3230
Accuracy47%48%
Hallucination Rate29%34%

6. 模型规格

项目文章原文
上下文窗口500k tokens,与 Grok 4.6 相同
输入 / 输出价格每百万 token $2 / $6
Cache hit每百万 token $0.50
推理档位范围low 到 xhigh
本次评测档位xhigh
每道评测题的美元成本未注明

结论与边界

Grok 4.7 (xhigh) 在这篇文章里的优势集中在两类任务:统一 harness 下的长程知识工作(AA-Briefcase 1657、GDPval-AA 1695),以及 Grok Build 上的编码代理指数(56)。分析质量 Elo 明显高于 Grok 4.6 (high),展示质量 Elo 更低。统一 harness 下的 Terminal-Bench 4.0 和 GDP.pdf 有小幅上升,AA-LCR 与 AutomationBench-AA 有小幅下降。这些升降的绝对分未在正文给出。

token 用量是边界的一部分。约 81k 输出 token 高于正文点名的 Grok 4.6 (high) 36k、Grok 4.6 (xhigh) 38k、Muse Spark 1.3 (max) 60k 和 GPT-6 Astra (max) 27k。图上 Grok 4.7 的 81k 里,Reasoning 段为 59k,Answer 段为 22k。

下列内容不能并进上面的测量:

  • xAI 发布页上的 CursorBench、DeepSWE、EEBench 等自报分数。本篇没有打开或引用那一页的数字。DeepSWE 与 Terminal-Bench 若要引用,只能使用本文的 Artificial Analysis / Grok Build 口径。

  • 模型索引页。文章链到了该页,本篇没有用它补分数、provider 或价格。

  • high 与 xhigh。智能指数图上的 44 标的是 Grok 4.6 (high),与正文的 +2 分对应;AA-Briefcase、GDPval 和 Omniscience 的对照也是 Grok 4.6 (high)。编码代理对照是 Grok 4.6 (xhigh)。

  • 两套 Terminal-Bench 4.0。统一 harness 只给了相对 Grok 4.6 (high) 的 +4.5 个百分点。Grok Build 给的是 18% 到 33%。

  • 7.1 分钟。它是不含 TTFT 和 overhead 的解码时间。

  • $2 / $6 和 cache $0.50。这是标价。文章没有给出跑完智能指数或编码指数的美元成本。

  • “top 4 AI labs”。这是标题用语,文章没有给出实验室排名表。

  • 样本量、置信区间数字、温度、种子、provider、API model ID,以及 “with fallback” 的含义,均为未注明。

复现说明

  1. 打开 https://artificialanalysis.ai/articles/benchmarking-grok-4-7 ,核对日期 September 21, 2026 和标题中的指数 46。

  2. 先读正文,把 xhigh、Grok Build、统一 harness 分开。不要用模型索引页填补本文没有的字段。

  3. 指数、Elo、token 和编码代理分数在文内图片里。读柱顶数字和斜向模型名,保留图上的推理档位。Elo 图只复述点估计。

  4. 分项大图的 AA-Briefcase 与 GDPval 轴是 (Elo-500)/2000。不要把那些百分数当成原始 Elo,也不要当成正文里的 1657 或 1695。

  5. 文章没有公开题目清单、评分脚本、随机种子或请求参数,第三方不能按本文逐题重跑。能核对的是 2026-09-22 这一版页面上的指数版本、harness 名称、档位、Elo、token、时间和对照模型集合。

能支持的判断

  • 比较 Grok 4.7 (xhigh) 在 Artificial Analysis 统一 harness 下的综合智能指数,以及在 Grok Build 这一方编码代理里的 Coding Agent Index;判断 AA-Briefcase、GDPval-AA 这类长程知识工作,以及输出 token、解码时间和幻觉率。

不能支持的判断

  • 把本页分数换成 xAI 发布页的自报基准;把 Grok 4.6 的 high 与 xhigh 当成同一档;把 Coding Agent Index 里的 Terminal-Bench 4.0 当成 Intelligence Index 里的同名项目;把约 7.1 分钟理解成含首 token 和开销的端到端墙钟时间;把标价理解成本次评测的美元花费。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Artificial Analysis · Artificial Analysis(页面 JSON-LD 的作者类型为 Organization) · 原文发布日期 2026-09-21 · 本站编辑日期 2026-09-22

打开原始来源

Grok 4.7

在 Tabbit 中比较 Grok 4.7

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

Grok 4.7 测评:标价没变,输出 token 大约翻了一倍

Grok 4.7 仍是每百万 token 输入 2 美元、输出 6 美元。xhigh 每道智能指数题约 8.1 万输出 token。这篇说明哪些任务值得多花这些 token。

定价 · 简体中文

Grok 4.7 价格:标价仍是 $2/$6,账单不是

Grok 4.7 的 API 短上下文仍是每百万 token $2、$0.50 和 $6。推理档位、20 万门槛、Fast,以及 Cursor 的 25.6 万线,会改写实际账单。

模型对比 · 简体中文

Grok 4.7 对比 Grok 4.6:单价没变,账单会变长

Grok 4.7 与 Grok 4.6 的 API 标价同为每百万 token 输入 $2、输出 $6,上下文都是 50 万。xhigh 下智能指数题输出约 8.1 万 token,4.6 约 3.6 万。

相关评测

xAI 官方发布:Grok 4.7 基准分数与能力定位xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。xAI 官方模型卡:Grok 4.7 的安全评测与使用边界官方模型卡把 Grok 4.7 写成 Grok 4.6 之后、面向编码、工程与办公室任务的已部署检查点,并给出可用渠道、训练截止日期,以及在 xhigh 或 high 档上的能力与安全分数;卡片没有出现快速变体,也没有 API model ID。X:Artificial Analysis 的 AA-Briefcase 图——Grok 4.7(xhigh)综合 Elo 1657在这条帖附带的 AA-Briefcase Elo 图上,Grok 4.7(xhigh)为 1657,位于 Claude Fable 5.1(max with fallback,1678)和 Claude Opus 5(max,1673)之后。帖文正文另称它在该基准上仅落后于 Anthropic 模型、紧跟 Opus 5,且每任务成本约为后者的一半;AA-Briefcase-Lite 上,分析质量 Elo 从 Grok 4.6 的 1698 升到 1994,演示 Elo 从 1531 降到 1499。Arena:Grok 4.7 在 Agent Arena 净改进图上尚未出分截至 2026-09-22,这条 Arena 帖文没有公布 Grok 4.7 的 Agent Arena 净改进分数;图上 Grok 4.7 标为 Coming soon,帖文写 Scores coming soon,同线程投票只是 412 人对落地位置的预测。OpenRouter 上的 Grok 4.7 API 接入配置OpenRouter 模型页把 x-ai/grok-4.7 标成 SpaceXAI 的 Grok 4.7,列出的输入 / 输出价格是每百万 token $1.60 / $4.80,并给出了 OpenRouter SDK 与 cURL 的调用示例;请求体里的推理档位字段和 Low、Medium、High 各档标价在本次采集中未读到。xAI 官方文档:Grok 4.7 API 参数与推理档位公开 xAI API 的模型名是 grok-4.7;文档列出的推理档位为 Low、medium、high(默认)或 xhigh,输入价 $2.00 / 1M tokens,输出价 $6.00 / 1M tokens。Grok 4.7 Fast 被写成同一模型的更快部署,按标准 token 价格的两倍计费,并且只出现在 Cursor 与 Grok Build。Box 在 AI Studio 里用 Grok 4.7 审查 Merewick 索赔的提示与结果Box 的这条帖是一段 41 秒的 Box Agent 预览:在 Box AI Studio 中选定 Grok 4.7,对文件夹「Active Commercial Property Claims」输入一段索赔审查提示,生成文件 Claim Reconciliation Review Merewick Coastal Foods ASC-26-0184.md。备忘录写明具名风暴免赔额少计 USD 143,000、发票 RCS-26118 的 USD 82,000 在建筑险与营业用动产中重复、供应商贷项通知单 CM-66204 的 USD 64,000 未从食品库存中扣除,并写明营业中断的 72 小时等待期不适用于额外费用。备忘录把最终承保和付款决定留给理赔员与承保律师。