Grok 4.7 · 官方来源 · 厂商自报
xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。
xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。
适合判断的任务:确认 xAI 如何描述 Grok 4.7 的产品定位、公开了哪些基准名称和分数、对照表使用了哪一档推理标签,以及列出的输入/输出 token 标价。
不适合外推的任务:把本页分数当作第三方复测;把标题中的速度和价格口号换成已测量的对照实验;把快速变体、Grok 4.6 或其他推理档位的结果并入 Grok 4.7 xHigh;在缺少样本量、harness 和评分脚本时比较胜率或成本效率。
适用的模型版本:正文主体是 Grok 4.7。对照表列头为 Grok 4.7 xHigh,DeepSWE 单元格另标 high effort。散点图另有 Grok 4.7 Extra High、High、Medium、Low。Grok 4.6 只出现在对照列和三张柱状图,档位标为 High / (high)。页面写有一个 “fast variant”,没有出现 “Grok 4.7 Fast” 这个名称,也没有给该变体任何基准分。
测试环境或客户端:统一测试 harness 未注明。可用性段落写明当天可在 Cursor、Grok Build、Grok API、第三方 coding harness、model router 和云平台使用。训练描述提到 Grok Bot harness,页面没有把它写成上述基准的运行环境。
推理档位和参数:只记录各表可见标签。温度、top-p、随机种子、上下文长度、最大输出、工具配置和样本量均为未注明。页面也没有给出 API model ID。
这是一篇厂商发布说明。页面没有提供可独立重跑的协议,本篇只转写 2026-09-22 在原文中读到的声称和数字。
可见的设置只有这些:
主对照表的列头写明四个对象:Grok 4.7 xHigh、Grok 4.6 High、GPT-5.6 Sol Max、Fable 5.1 Max。
图注写明,Grok 4.7 的 DeepSWE 星号表示 high-effort 分数。该星号没有标在同列的其他基准上。
CursorBench 4.0 散点图可在 Cost、Tokens、Steps 之间切换。每个点的无障碍名称给出模型、档位、分数,以及平均每任务成本、平均输出 token 或平均步数。
下方三张柱状图的页签是 Professional knowledge work、Multi-hour office work、Electrical engineering。共享图注把它们称为 GDPval、AA Briefcase 和 EEBench,比较对象是 Grok 4.7、Grok 4.6、Fable 5.1 和 GPT-6 Astra。
安全段点名 LatchBio 的 biosafety benchmark,以及 xAI 自称 “our benchmark” 的 HackerBench v0.3。
交互图上的成本、token、步数和柱状图分数会随页面更新。下文将这些读数标为 2026-09-22 快照。坐标轴刻度(例如 20%–55%、$0–$18、Elo 0–1500)是标尺,不是模型得分。
样本量、harness 名称与版本、题目清单、评分脚本、置信区间和评测运行日期均为未注明。
厂商定位和未配测量表的声称:
页面称 Grok 4.7 是其最强的编码与知识工作模型,能在困难任务上工作更久,并更仔细地检查自己的输出。
标题与摘要写 “Twice as fast, at half the price of comparable models”。比较对象、速度单位和价格口径未注明。
正文写它以与 Grok 4.6 相同的价格和速度提供。对照表中两列标价同为每百万 token 输入 $2、输出 $6。页面没有给出 tokens/s 或延迟测量。
相对 Grok 4.6,页面称 Grok 4.7 使用了新的、更大的基座,强化学习跑得更长,任务组合更难并偏向多小时问题;自检和长上下文更好;并针对 Grok Bot harness 做了原生训练。这些句子没有参数量、上下文窗口或训练步数。
页面称 Grok 4.7 更擅长文档和演示,在 GDPval 与 AA Briefcase 上优于 Grok 4.6,并与其他前沿模型相当。
安全段称它使用全新 safeguard stack,在 xAI 自己测过的拒答和越狱抵抗上最强;在网络安全和生物等双用途领域,良性任务效用和危险请求拒答都领先。除下面两个数字外,没有公开对照分数。
定价段称还有一个 fast variant,输出速度为两倍,价格为两倍。页面没有写出该变体的 token 标价、速度测量值或基准分。
页面直接给出的官方分数,均缺样本量与 harness:
CursorBench 4.0:对照表中 Grok 4.7 xHigh 46.3%、Grok 4.6 High 40.4%、GPT-5.6 Sol Max 41.7%、Fable 5.1 Max 51.8%。散点图把同一组 46.3% / 41.7% / 51.8% 标成 Extra High / Max / Max,并给出更多档位。
DeepSWE v1.1:Grok 4.7 为 71.0%,页面明确标成 high effort;Grok 4.6 High 65.2%;GPT-5.6 Sol Max 72.7%;Fable 5.1 Max 70.0%。
主对照表还有 EEBench、AA Briefcase v1.1、Terminal-Bench 4.0、Harvey Legal Agent Benchmark、HealthBench Professional。
柱状图另给出 GDPval Elo,以及带 GPT-6 Astra (max) 的 AA Briefcase / EEBench 读数。GPT-6 Astra 不在主对照表和 CursorBench 散点图中。
LatchBio biosafety benchmark:62.4%。页面没有解释该百分比的分子、分母或对照模型分数。
HackerBench v0.3:页面称风险双用途提示中只有 3.3% 被放行,并称正当安全工作很少被拦截。正当请求的放行率未注明。
列顺序与页面一致。Grok 4.7 列的列头是 xHigh;只有 DeepSWE 按图注改记为 high effort。其余单元格沿用列头档位。样本量、harness、评测日期均为未注明。
| 项目 | Grok 4.7 | Grok 4.6 | GPT-5.6 Sol | Fable 5.1 |
|---|---|---|---|---|
| 推理档位(列头) | xHigh;DeepSWE 为 high effort | High | Max | Max |
| 输入价格(每百万 token) | $2 | $2 | $4 | $10 |
| 输出价格(每百万 token) | $6 | $6 | $20 | $50 |
| CursorBench 4.0 | 46.3% | 40.4% | 41.7% | 51.8% |
| DeepSWE v1.1 | 71.0%(high effort) | 65.2% | 72.7% | 70.0% |
| EEBench | 64.0% | 53.0% | 39.4% | 56.4% |
| AA Briefcase v1.1 | 1,657 | 1,546 | 1,487 | 1,678 |
| Terminal-Bench 4.0 | 38.0% | 20.3% | 37.3% | 57.9% |
| Harvey Legal Agent Benchmark | 19.6% | 15.8% | 2.5% | 6.7% |
| HealthBench Professional | 56.7% | 48.5% | 60.5% | 62.1% |
页面给这些行加的类别标签是:Software engineering、Electrical engineering、Multi-hour office work、Multi-hour terminal work、Legal work、Clinical reasoning。AA Briefcase v1.1 与后文柱状图使用 Elo 式大数,页面没有在对照表旁再解释单位。
定价段另写 “priced starting at” 每百万 token 输入 $2、输出 $6。fast variant 没有单独一行标价。
图的无障碍名称是 “CursorBench 4.0 score by average cost / output tokens / steps per task”。点上可见的模型是 Fable 5.1、Opus 5、Grok 4.7、GPT-5.6 Sol、Sonnet 5。Grok 4.6 不在这张图上。Grok 4.7 没有 Max 点。每个点的样本量、harness、输入 token 和评测日期均为未注明。平均成本是每任务成本,与上一节的每百万 token 标价不是同一口径。
Grok 4.7 Extra High 的 46.3% 与对照表 Grok 4.7 xHigh 的 CursorBench 4.0 分数相同。页面同时使用了 Extra High 和 xHigh 两种写法,没有另给 API 参数名。
| 模型与页面档位 | 分数 | 平均每任务成本 | 平均输出 token | 平均步数 |
|---|---|---|---|---|
| Grok 4.7 Extra High | 46.3% | $6.01 | 70,141 | 88 |
| Grok 4.7 High | 43.9% | $4.69 | 56,382 | 71 |
| Grok 4.7 Medium | 41.6% | $3.49 | 36,683 | 60 |
| Grok 4.7 Low | 33.1% | $1.58 | 15,677 | 40 |
| Fable 5.1 Max | 51.8% | $17.28 | 117,236 | 128 |
| Fable 5.1 Extra High | 51.6% | $13.01 | 87,294 | 101 |
| Fable 5.1 High | 49.2% | $9.08 | 58,438 | 77 |
| Fable 5.1 Medium | 46.8% | $7.05 | 45,411 | 63 |
| Fable 5.1 Low | 45.1% | $5.44 | 34,795 | 51 |
| Opus 5 Max | 46.6% | $11.95 | 85,384 | 106 |
| Opus 5 Extra High | 46.1% | $11.43 | 80,094 | 103 |
| Opus 5 High | 44.7% | $9.00 | 61,405 | 86 |
| Opus 5 Medium | 43.3% | $6.94 | 45,272 | 72 |
| Opus 5 Low | 40.7% | $4.87 | 31,995 | 57 |
| GPT-5.6 Sol Max | 41.7% | $8.23 | 42,944 | 99 |
| GPT-5.6 Sol Extra High | 37.7% | $4.40 | 24,729 | 55 |
| GPT-5.6 Sol High | 35.7% | $2.85 | 16,174 | 41 |
| GPT-5.6 Sol Medium | 31.1% | $1.77 | 10,111 | 32 |
| GPT-5.6 Sol Low | 24.6% | $0.87 | 4,885 | 21 |
| Sonnet 5 Max | 34.1% | $7.17 | 149,257 | 140 |
| Sonnet 5 Extra High | 32.0% | $4.55 | 83,373 | 102 |
| Sonnet 5 High | 30.8% | $3.48 | 61,146 | 85 |
| Sonnet 5 Medium | 28.0% | $2.31 | 39,114 | 65 |
| Sonnet 5 Low | 24.1% | $1.39 | 23,772 | 46 |
三张图的档位写法是 (xhigh)、(high)、(max)。样本量、harness 和评测日期未注明。柱状图用 GPT-6 Astra (max),主对照表用 GPT-5.6 Sol Max;两套比较对象不要合并成一行。
| 图表 | 指标 | Grok 4.7 (xhigh) | Grok 4.6 (high) | Fable 5.1 (max) | GPT-6 Astra (max) |
|---|---|---|---|---|---|
| Professional knowledge work / GDPval | Elo | 1,695 | 1,605 | 1,735 | 1,542 |
| Multi-hour office work / AA Briefcase | Elo | 1,657 | 1,546 | 1,678 | 1,569 |
| Electrical engineering / EEBench | Accuracy | 64.0% | 53.0% | 56.4% | 69.3% |
办公图的无障碍名称是 “Multi-hour office work scores by model”,标签本身没有再印 “AA Briefcase v1.1”。1,657、1,546、1,678 与主对照表 AA Briefcase v1.1 的对应单元格一致。主对照表另有 GPT-5.6 Sol Max 的 1,487,柱状图没有这个点。
电气工程图的单位是 Accuracy。64.0%、53.0%、56.4% 与主对照表 EEBench 的对应单元格一致。主对照表另有 GPT-5.6 Sol Max 的 39.4%。柱状图上的 69.3% 属于 GPT-6 Astra (max),不是 GPT-5.6 Sol。
GDPval 只出现在柱状图,不在主对照表中。
| 项目 | 页面给出的值 | 未注明字段 |
|---|---|---|
| LatchBio biosafety benchmark | Grok 4.7 为 62.4%,页面称在该基准上领先 | 模型版本档位、对照模型分数、样本量、harness、指标定义、评测日期 |
| HackerBench v0.3 | 风险双用途提示放行 3.3%;页面称这是 xAI 用于风险和恶意网络任务的基准,并称安全性最高 | 推理档位、提示总数、正当安全工作的拦截率、对照模型分数、harness、评测日期 |
| 拒答与越狱抵抗 | 页面称是其测过的最强模型 | 基准名、分数、样本量 |
| 红队能力 | 页面称已向部分网络安全合作方提供邀请制访问,用于防御研究 | 公开分数未给出 |
本页全部基准数字都是 xAI 发布稿中的官方结果。独立测量、第三方复跑日志和统计显著性均为未注明。不能把这篇发布稿写成 Grok 4.7 的独立复测。
版本要分开记:
Grok 4.7 的主对照列是 xHigh,但 DeepSWE v1.1 的 71.0% 被单独标成 high effort。散点图还公开了 Extra High、High、Medium、Low 四档 CursorBench 结果,不能只用 46.3% 代表所有档位。
页面没有出现 “Grok 4.7 Fast”。fast variant 只有“两倍输出速度、两倍价格”这句话,没有基准分,也没有单独标价。散点图和对照表上的 Grok 4.7 分数不适用于这个变体。
Grok 4.6 的公开档位是 High / (high)。它的 CursorBench 4.0 是 40.4%,与 Grok 4.7 任一档都不是同一个数。
比较对象也不止一套。主对照表和 CursorBench 散点图分别带入 GPT-5.6 Sol、Opus 5、Sonnet 5;三张柱状图带入 GPT-6 Astra,并拿掉 GPT-5.6 Sol。EEBench 上因此同时可见 GPT-5.6 Sol Max 39.4% 和 GPT-6 Astra (max) 69.3%,它们来自不同的对照集合。
价格和速度要按原句分开:
对照表支持“Grok 4.7 与 Grok 4.6 列表价格同为 $2 / $6”这一读法。
“与 Grok 4.6 同速”“比同类模型快一倍、价格一半”以及 fast variant 的“两倍速度、两倍价格”都没有配速度表或点名比较对象。
散点图的平均每任务成本是 CursorBench 任务开销,不能换算成每百万 token 标价,也不能代表 fast variant。
安全结论停留在页面原句。62.4% 和 3.3% 没有样本量,HackerBench 被写成 xAI 自己的基准。邀请制红队访问不是公开分数。
动态图是 2026-09-22 的页面快照。文章发布日期是 2026-09-21。之后页面若更新散点或柱状图,以重新打开的原文为准。
仅凭本页不能复现这些分数。页面未注明题目集版本、样本量、完整提示、harness、工具 schema、温度、随机种子、评分脚本、失败样本和置信区间,也没有 API model ID。
若以后另做复测,需要先固定当时的模型版本和推理档位,把 Grok 4.7 的 xHigh、high effort、Extra High、High、Medium、Low 以及 fast variant 分成不同运行;Grok 4.6 单独列表。本文件不提供这样一次复测的结果。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
xAI News(浏览器标题后缀为 SpaceXAI,页脚版权为 SpaceXAI LLC) · xAI(schema.org 中的组织作者;正文未见个人署名) · 原文发布日期 2026-09-21 · 本站编辑日期 2026-09-22
打开原始来源Grok 4.7
下载 Tabbit 客户端后检查模型可用性