Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Grok 4.7 · 官方来源 · 厂商自报

xAI 官方发布:Grok 4.7 基准分数与能力定位

xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。

官方来源厂商自报编辑日期 2026-09-22

测试条件速查

来源具体观察
xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。
已公布条件
把本页分数当作第三方复测;把标题中的速度和价格口号换成已测量的对照实验;把快速变体、Grok 4.6 或其他推理档位的结果并入 Grok 4.7 xHigh;在缺少样本量、harness 和评分脚本时比较胜率或成本效率。

关键数据与适用场景

一句话结论

xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。

适用场景

  • 适合判断的任务:确认 xAI 如何描述 Grok 4.7 的产品定位、公开了哪些基准名称和分数、对照表使用了哪一档推理标签,以及列出的输入/输出 token 标价。

  • 不适合外推的任务:把本页分数当作第三方复测;把标题中的速度和价格口号换成已测量的对照实验;把快速变体、Grok 4.6 或其他推理档位的结果并入 Grok 4.7 xHigh;在缺少样本量、harness 和评分脚本时比较胜率或成本效率。

  • 适用的模型版本:正文主体是 Grok 4.7。对照表列头为 Grok 4.7 xHigh,DeepSWE 单元格另标 high effort。散点图另有 Grok 4.7 Extra High、High、Medium、Low。Grok 4.6 只出现在对照列和三张柱状图,档位标为 High / (high)。页面写有一个 “fast variant”,没有出现 “Grok 4.7 Fast” 这个名称,也没有给该变体任何基准分。

  • 测试环境或客户端:统一测试 harness 未注明。可用性段落写明当天可在 Cursor、Grok Build、Grok API、第三方 coding harness、model router 和云平台使用。训练描述提到 Grok Bot harness,页面没有把它写成上述基准的运行环境。

  • 推理档位和参数:只记录各表可见标签。温度、top-p、随机种子、上下文长度、最大输出、工具配置和样本量均为未注明。页面也没有给出 API model ID。

测评方法

这是一篇厂商发布说明。页面没有提供可独立重跑的协议,本篇只转写 2026-09-22 在原文中读到的声称和数字。

可见的设置只有这些:

  • 主对照表的列头写明四个对象:Grok 4.7 xHigh、Grok 4.6 High、GPT-5.6 Sol Max、Fable 5.1 Max。

  • 图注写明,Grok 4.7 的 DeepSWE 星号表示 high-effort 分数。该星号没有标在同列的其他基准上。

  • CursorBench 4.0 散点图可在 Cost、Tokens、Steps 之间切换。每个点的无障碍名称给出模型、档位、分数,以及平均每任务成本、平均输出 token 或平均步数。

  • 下方三张柱状图的页签是 Professional knowledge work、Multi-hour office work、Electrical engineering。共享图注把它们称为 GDPval、AA Briefcase 和 EEBench,比较对象是 Grok 4.7、Grok 4.6、Fable 5.1 和 GPT-6 Astra。

  • 安全段点名 LatchBio 的 biosafety benchmark,以及 xAI 自称 “our benchmark” 的 HackerBench v0.3。

交互图上的成本、token、步数和柱状图分数会随页面更新。下文将这些读数标为 2026-09-22 快照。坐标轴刻度(例如 20%–55%、$0–$18、Elo 0–1500)是标尺,不是模型得分。

样本量、harness 名称与版本、题目清单、评分脚本、置信区间和评测运行日期均为未注明。

关键结果

厂商定位和未配测量表的声称:

  • 页面称 Grok 4.7 是其最强的编码与知识工作模型,能在困难任务上工作更久,并更仔细地检查自己的输出。

  • 标题与摘要写 “Twice as fast, at half the price of comparable models”。比较对象、速度单位和价格口径未注明。

  • 正文写它以与 Grok 4.6 相同的价格和速度提供。对照表中两列标价同为每百万 token 输入 $2、输出 $6。页面没有给出 tokens/s 或延迟测量。

  • 相对 Grok 4.6,页面称 Grok 4.7 使用了新的、更大的基座,强化学习跑得更长,任务组合更难并偏向多小时问题;自检和长上下文更好;并针对 Grok Bot harness 做了原生训练。这些句子没有参数量、上下文窗口或训练步数。

  • 页面称 Grok 4.7 更擅长文档和演示,在 GDPval 与 AA Briefcase 上优于 Grok 4.6,并与其他前沿模型相当。

  • 安全段称它使用全新 safeguard stack,在 xAI 自己测过的拒答和越狱抵抗上最强;在网络安全和生物等双用途领域,良性任务效用和危险请求拒答都领先。除下面两个数字外,没有公开对照分数。

  • 定价段称还有一个 fast variant,输出速度为两倍,价格为两倍。页面没有写出该变体的 token 标价、速度测量值或基准分。

页面直接给出的官方分数,均缺样本量与 harness:

  • CursorBench 4.0:对照表中 Grok 4.7 xHigh 46.3%、Grok 4.6 High 40.4%、GPT-5.6 Sol Max 41.7%、Fable 5.1 Max 51.8%。散点图把同一组 46.3% / 41.7% / 51.8% 标成 Extra High / Max / Max,并给出更多档位。

  • DeepSWE v1.1:Grok 4.7 为 71.0%,页面明确标成 high effort;Grok 4.6 High 65.2%;GPT-5.6 Sol Max 72.7%;Fable 5.1 Max 70.0%。

  • 主对照表还有 EEBench、AA Briefcase v1.1、Terminal-Bench 4.0、Harvey Legal Agent Benchmark、HealthBench Professional。

  • 柱状图另给出 GDPval Elo,以及带 GPT-6 Astra (max) 的 AA Briefcase / EEBench 读数。GPT-6 Astra 不在主对照表和 CursorBench 散点图中。

  • LatchBio biosafety benchmark:62.4%。页面没有解释该百分比的分子、分母或对照模型分数。

  • HackerBench v0.3:页面称风险双用途提示中只有 3.3% 被放行,并称正当安全工作很少被拦截。正当请求的放行率未注明。

原始数据

1. 主对照表

列顺序与页面一致。Grok 4.7 列的列头是 xHigh;只有 DeepSWE 按图注改记为 high effort。其余单元格沿用列头档位。样本量、harness、评测日期均为未注明。

项目Grok 4.7Grok 4.6GPT-5.6 SolFable 5.1
推理档位(列头)xHigh;DeepSWE 为 high effortHighMaxMax
输入价格(每百万 token)$2$2$4$10
输出价格(每百万 token)$6$6$20$50
CursorBench 4.046.3%40.4%41.7%51.8%
DeepSWE v1.171.0%(high effort)65.2%72.7%70.0%
EEBench64.0%53.0%39.4%56.4%
AA Briefcase v1.11,6571,5461,4871,678
Terminal-Bench 4.038.0%20.3%37.3%57.9%
Harvey Legal Agent Benchmark19.6%15.8%2.5%6.7%
HealthBench Professional56.7%48.5%60.5%62.1%

页面给这些行加的类别标签是:Software engineering、Electrical engineering、Multi-hour office work、Multi-hour terminal work、Legal work、Clinical reasoning。AA Briefcase v1.1 与后文柱状图使用 Elo 式大数,页面没有在对照表旁再解释单位。

定价段另写 “priced starting at” 每百万 token 输入 $2、输出 $6。fast variant 没有单独一行标价。

2. CursorBench 4.0 散点图(2026-09-22 快照)

图的无障碍名称是 “CursorBench 4.0 score by average cost / output tokens / steps per task”。点上可见的模型是 Fable 5.1、Opus 5、Grok 4.7、GPT-5.6 Sol、Sonnet 5。Grok 4.6 不在这张图上。Grok 4.7 没有 Max 点。每个点的样本量、harness、输入 token 和评测日期均为未注明。平均成本是每任务成本,与上一节的每百万 token 标价不是同一口径。

Grok 4.7 Extra High 的 46.3% 与对照表 Grok 4.7 xHigh 的 CursorBench 4.0 分数相同。页面同时使用了 Extra High 和 xHigh 两种写法,没有另给 API 参数名。

模型与页面档位分数平均每任务成本平均输出 token平均步数
Grok 4.7 Extra High46.3%$6.0170,14188
Grok 4.7 High43.9%$4.6956,38271
Grok 4.7 Medium41.6%$3.4936,68360
Grok 4.7 Low33.1%$1.5815,67740
Fable 5.1 Max51.8%$17.28117,236128
Fable 5.1 Extra High51.6%$13.0187,294101
Fable 5.1 High49.2%$9.0858,43877
Fable 5.1 Medium46.8%$7.0545,41163
Fable 5.1 Low45.1%$5.4434,79551
Opus 5 Max46.6%$11.9585,384106
Opus 5 Extra High46.1%$11.4380,094103
Opus 5 High44.7%$9.0061,40586
Opus 5 Medium43.3%$6.9445,27272
Opus 5 Low40.7%$4.8731,99557
GPT-5.6 Sol Max41.7%$8.2342,94499
GPT-5.6 Sol Extra High37.7%$4.4024,72955
GPT-5.6 Sol High35.7%$2.8516,17441
GPT-5.6 Sol Medium31.1%$1.7710,11132
GPT-5.6 Sol Low24.6%$0.874,88521
Sonnet 5 Max34.1%$7.17149,257140
Sonnet 5 Extra High32.0%$4.5583,373102
Sonnet 5 High30.8%$3.4861,14685
Sonnet 5 Medium28.0%$2.3139,11465
Sonnet 5 Low24.1%$1.3923,77246

3. GDPval、AA Briefcase 与 EEBench 柱状图(2026-09-22 快照)

三张图的档位写法是 (xhigh)、(high)、(max)。样本量、harness 和评测日期未注明。柱状图用 GPT-6 Astra (max),主对照表用 GPT-5.6 Sol Max;两套比较对象不要合并成一行。

图表指标Grok 4.7 (xhigh)Grok 4.6 (high)Fable 5.1 (max)GPT-6 Astra (max)
Professional knowledge work / GDPvalElo1,6951,6051,7351,542
Multi-hour office work / AA BriefcaseElo1,6571,5461,6781,569
Electrical engineering / EEBenchAccuracy64.0%53.0%56.4%69.3%

办公图的无障碍名称是 “Multi-hour office work scores by model”,标签本身没有再印 “AA Briefcase v1.1”。1,657、1,546、1,678 与主对照表 AA Briefcase v1.1 的对应单元格一致。主对照表另有 GPT-5.6 Sol Max 的 1,487,柱状图没有这个点。

电气工程图的单位是 Accuracy。64.0%、53.0%、56.4% 与主对照表 EEBench 的对应单元格一致。主对照表另有 GPT-5.6 Sol Max 的 39.4%。柱状图上的 69.3% 属于 GPT-6 Astra (max),不是 GPT-5.6 Sol。

GDPval 只出现在柱状图,不在主对照表中。

4. 安全数字

项目页面给出的值未注明字段
LatchBio biosafety benchmarkGrok 4.7 为 62.4%,页面称在该基准上领先模型版本档位、对照模型分数、样本量、harness、指标定义、评测日期
HackerBench v0.3风险双用途提示放行 3.3%;页面称这是 xAI 用于风险和恶意网络任务的基准,并称安全性最高推理档位、提示总数、正当安全工作的拦截率、对照模型分数、harness、评测日期
拒答与越狱抵抗页面称是其测过的最强模型基准名、分数、样本量
红队能力页面称已向部分网络安全合作方提供邀请制访问,用于防御研究公开分数未给出

结论与边界

本页全部基准数字都是 xAI 发布稿中的官方结果。独立测量、第三方复跑日志和统计显著性均为未注明。不能把这篇发布稿写成 Grok 4.7 的独立复测。

版本要分开记:

  • Grok 4.7 的主对照列是 xHigh,但 DeepSWE v1.1 的 71.0% 被单独标成 high effort。散点图还公开了 Extra High、High、Medium、Low 四档 CursorBench 结果,不能只用 46.3% 代表所有档位。

  • 页面没有出现 “Grok 4.7 Fast”。fast variant 只有“两倍输出速度、两倍价格”这句话,没有基准分,也没有单独标价。散点图和对照表上的 Grok 4.7 分数不适用于这个变体。

  • Grok 4.6 的公开档位是 High / (high)。它的 CursorBench 4.0 是 40.4%,与 Grok 4.7 任一档都不是同一个数。

比较对象也不止一套。主对照表和 CursorBench 散点图分别带入 GPT-5.6 Sol、Opus 5、Sonnet 5;三张柱状图带入 GPT-6 Astra,并拿掉 GPT-5.6 Sol。EEBench 上因此同时可见 GPT-5.6 Sol Max 39.4% 和 GPT-6 Astra (max) 69.3%,它们来自不同的对照集合。

价格和速度要按原句分开:

  • 对照表支持“Grok 4.7 与 Grok 4.6 列表价格同为 $2 / $6”这一读法。

  • “与 Grok 4.6 同速”“比同类模型快一倍、价格一半”以及 fast variant 的“两倍速度、两倍价格”都没有配速度表或点名比较对象。

  • 散点图的平均每任务成本是 CursorBench 任务开销,不能换算成每百万 token 标价,也不能代表 fast variant。

安全结论停留在页面原句。62.4% 和 3.3% 没有样本量,HackerBench 被写成 xAI 自己的基准。邀请制红队访问不是公开分数。

动态图是 2026-09-22 的页面快照。文章发布日期是 2026-09-21。之后页面若更新散点或柱状图,以重新打开的原文为准。

复现说明

仅凭本页不能复现这些分数。页面未注明题目集版本、样本量、完整提示、harness、工具 schema、温度、随机种子、评分脚本、失败样本和置信区间,也没有 API model ID。

若以后另做复测,需要先固定当时的模型版本和推理档位,把 Grok 4.7 的 xHigh、high effort、Extra High、High、Medium、Low 以及 fast variant 分成不同运行;Grok 4.6 单独列表。本文件不提供这样一次复测的结果。

能支持的判断

  • 确认 xAI 如何描述 Grok 4.7 的产品定位、公开了哪些基准名称和分数、对照表使用了哪一档推理标签,以及列出的输入/输出 token 标价。

不能支持的判断

  • 把本页分数当作第三方复测;把标题中的速度和价格口号换成已测量的对照实验;把快速变体、Grok 4.6 或其他推理档位的结果并入 Grok 4.7 xHigh;在缺少样本量、harness 和评分脚本时比较胜率或成本效率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

xAI News(浏览器标题后缀为 SpaceXAI,页脚版权为 SpaceXAI LLC) · xAI(schema.org 中的组织作者;正文未见个人署名) · 原文发布日期 2026-09-21 · 本站编辑日期 2026-09-22

打开原始来源

Grok 4.7

在 Tabbit 中比较 Grok 4.7

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

Grok 4.7 测评:标价没变,输出 token 大约翻了一倍

Grok 4.7 仍是每百万 token 输入 2 美元、输出 6 美元。xhigh 每道智能指数题约 8.1 万输出 token。这篇说明哪些任务值得多花这些 token。

定价 · 简体中文

Grok 4.7 价格:标价仍是 $2/$6,账单不是

Grok 4.7 的 API 短上下文仍是每百万 token $2、$0.50 和 $6。推理档位、20 万门槛、Fast,以及 Cursor 的 25.6 万线,会改写实际账单。

模型对比 · 简体中文

Grok 4.7 对比 Grok 4.6:单价没变,账单会变长

Grok 4.7 与 Grok 4.6 的 API 标价同为每百万 token 输入 $2、输出 $6,上下文都是 50 万。xhigh 下智能指数题输出约 8.1 万 token,4.6 约 3.6 万。

相关评测

xAI 官方模型卡:Grok 4.7 的安全评测与使用边界官方模型卡把 Grok 4.7 写成 Grok 4.6 之后、面向编码、工程与办公室任务的已部署检查点,并给出可用渠道、训练截止日期,以及在 xhigh 或 high 档上的能力与安全分数;卡片没有出现快速变体,也没有 API model ID。Artificial Analysis:Grok 4.7 的智能指数与编码代理Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。X:Artificial Analysis 的 AA-Briefcase 图——Grok 4.7(xhigh)综合 Elo 1657在这条帖附带的 AA-Briefcase Elo 图上,Grok 4.7(xhigh)为 1657,位于 Claude Fable 5.1(max with fallback,1678)和 Claude Opus 5(max,1673)之后。帖文正文另称它在该基准上仅落后于 Anthropic 模型、紧跟 Opus 5,且每任务成本约为后者的一半;AA-Briefcase-Lite 上,分析质量 Elo 从 Grok 4.6 的 1698 升到 1994,演示 Elo 从 1531 降到 1499。Arena:Grok 4.7 在 Agent Arena 净改进图上尚未出分截至 2026-09-22,这条 Arena 帖文没有公布 Grok 4.7 的 Agent Arena 净改进分数;图上 Grok 4.7 标为 Coming soon,帖文写 Scores coming soon,同线程投票只是 412 人对落地位置的预测。OpenRouter 上的 Grok 4.7 API 接入配置OpenRouter 模型页把 x-ai/grok-4.7 标成 SpaceXAI 的 Grok 4.7,列出的输入 / 输出价格是每百万 token $1.60 / $4.80,并给出了 OpenRouter SDK 与 cURL 的调用示例;请求体里的推理档位字段和 Low、Medium、High 各档标价在本次采集中未读到。xAI 官方文档:Grok 4.7 API 参数与推理档位公开 xAI API 的模型名是 grok-4.7;文档列出的推理档位为 Low、medium、high(默认)或 xhigh,输入价 $2.00 / 1M tokens,输出价 $6.00 / 1M tokens。Grok 4.7 Fast 被写成同一模型的更快部署,按标准 token 价格的两倍计费,并且只出现在 Cursor 与 Grok Build。Box 在 AI Studio 里用 Grok 4.7 审查 Merewick 索赔的提示与结果Box 的这条帖是一段 41 秒的 Box Agent 预览:在 Box AI Studio 中选定 Grok 4.7,对文件夹「Active Commercial Property Claims」输入一段索赔审查提示,生成文件 Claim Reconciliation Review Merewick Coastal Foods ASC-26-0184.md。备忘录写明具名风暴免赔额少计 USD 143,000、发票 RCS-26118 的 USD 82,000 在建筑险与营业用动产中重复、供应商贷项通知单 CM-66204 的 USD 64,000 未从食品库存中扣除,并写明营业中断的 72 小时等待期不适用于额外费用。备忘录把最终承保和付款决定留给理赔员与承保律师。