Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Grok 4.7 · 官方来源 · 厂商自报

xAI 官方模型卡:Grok 4.7 的安全评测与使用边界

官方模型卡把 Grok 4.7 写成 Grok 4.6 之后、面向编码、工程与办公室任务的已部署检查点,并给出可用渠道、训练截止日期,以及在 xhigh 或 high 档上的能力与安全分数;卡片没有出现快速变体,也没有 API model ID。

官方来源厂商自报编辑日期 2026-09-22

测试条件速查

来源具体观察
官方模型卡把 Grok 4.7 写成 Grok 4.6 之后、面向编码、工程与办公室任务的已部署检查点,并给出可用渠道、训练截止日期,以及在 xhigh 或 high 档上的能力与安全分数;卡片没有出现快速变体,也没有 API model ID。
已公布条件
把官方分数当成第三方复测;把某一档的分数套到另一档;把 Grok 4.6、Grok 4.5 或对照模型的结果算作 Grok 4.7;用无防护的能力探针代替上线后的拒答表现;把卡片未出现的快速变体、消费者端或未印刷的散点坐标补进结论。

关键数据与适用场景

一句话结论

官方模型卡把 Grok 4.7 写成 Grok 4.6 之后、面向编码、工程与办公室任务的已部署检查点,并给出可用渠道、训练截止日期,以及在 xhigh 或 high 档上的能力与安全分数;卡片没有出现快速变体,也没有 API model ID。

适用场景

  • 适合判断的任务:确认官方如何限定用途、列出哪些可用渠道、写了哪些训练说明,以及模型卡各表在哪个推理档位上印刷了 Grok 4.7、Grok 4.6 和对照模型的分数。

  • 不适合外推的任务:把官方分数当成第三方复测;把某一档的分数套到另一档;把 Grok 4.6、Grok 4.5 或对照模型的结果算作 Grok 4.7;用无防护的能力探针代替上线后的拒答表现;把卡片未出现的快速变体、消费者端或未印刷的散点坐标补进结论。

  • 适用的模型版本:主体是最终部署的 Grok 4.7 检查点。卡片按小节使用 xhigh 或 high,CVE-Bench 与 HackerBench 同时印了这两档。对照列另有 Grok 4.6(多为 high,EEBench 与 FrontierSWE 另有 xhigh)、Grok 4.5 (high)。卡片没有 “Grok 4.7 Fast”,也没有 “fast variant”。

  • 测试环境或客户端:未注明统一测试客户端。分项写明的 harness 见测评方法。可用性渠道与评测 harness 不是同一件事。

  • 推理档位和参数:只记录卡片印刷的 xhigh、high,以及对照模型的 max、xhigh。温度、top-p、随机种子、上下文长度、最大输出、工具 schema 和 API model ID 均为未注明。

测评方法

这是厂商模型卡,不是可独立重跑的协议。卡片写明:除非另有说明,评测结果来自 Grok 4.7 的最终部署检查点。

能力项与安全项分开。网络安全能力探针在无生产防护的配置下运行,拒答另在 HackerBench 测量。第 7 节的生物与化学基准默认不启用生产防护,以便测量双用途能力。越狱、一般输出安全、儿童安全、CBRN / 武器拒答、自我伤害、MASK 与迎合度,测的是防护或行为,不是无防护能力。

卡片点名的运行条件:

  • CursorBench 4.0 只在正文给出 Grok 4.7 的 xhigh 与 high 分数。两张散点图有坐标轴和图例,没有逐点数字。

  • DeepSWE v1.1:113 道长程任务、91 个仓库、5 种语言;mini-SWE-agent;Pass@1;Datacurve 评测。

  • Terminal-Bench 4.0:66 个终端工作流,单任务最长 8 小时;Grok 4.7 使用 Grok Build harness;Harbor 评测。

  • FrontierSWE V2:34 道任务,单任务最长 20 小时,每题 5 次,报告 mean@5。公开协议使用 Proximal 的 Proximus harness、maximum effort。Grok 分数由 Proximal Labs 评测。

  • SWE-Marathon v1.1:20 道任务,每题 8 次;各模型使用各自的原生 agent harness;Abundant AI 评测。

  • Legal Agent Benchmark:Vals AI 的 120 题留出集,Valkyrie harness,关闭互联网;Harvey 最终分是两位评审的任务通过率平均。

  • EEBench:Grok 4.7 使用 Grok Build,对照模型使用各自供应商 harness;Atopile 评测;脚注写明属于该基准 V1 核心语料。

  • CADGenBench:报告 generation split;Grok 4.7 使用 Grok Build;Mecado 评测。

  • HealthBench Professional:被安全过滤拒绝的题目记 0 分。Grok 4.7 的结果用 Grok 4.6 (high) 作评分模型;Fable 与 Astra 的数字来自各供应商自己的模型卡。

  • LatchBio Capabilities v1.0:11 个能力基准的等权平均。卡片称这是会更新的 live suite。

  • CyberGym、CVE-Bench:无标准防护;Grok 4.7 使用 Grok Build。CyberGym 上其他模型的无防护结果取自相应系统卡。

  • HackerBench v0.3:Grok 4.7 使用标准、随发布跟踪的防护;其他模型使用供应商提供的标准防护。

  • CathedralBench:无限制配置,只报告 hard subset。

  • BioSecBench:Grok 4.7 与 Grok 4.6 使用 Grok Build。GPT-6 Astra 与 Opus 5 是 LatchBio 在 max effort 下的运行。Surveillance 与 Function 的通过率不含被拒绝的尝试。

  • BixBench:Grok Build 默认开启工具,zero-shot 多选。

多数表格没有样本量、置信区间或评测运行日。这些字段记为未注明。

关键结果

以下都是卡片原文中的官方声称或官方分数。

用途与产品边界:

  • 卡片称 Grok 4.7 是 SpaceXAI 当时最新的模型,延伸 Grok 4.6,在编码、工程和办公室任务上能力与自主性更高,并称它是迄今能力最强的模型。

  • 卡片称它能比该厂商此前的模型更自主地完成更长、更难的任务,并且比其他前沿模型用更少的步数和更少的输出 token 得到结果。步数和 token 的对照表未注明;CursorBench 散点图只印刷了坐标轴范围。

  • 不打算在没有适当人工监督和领域专家校验时,用于医学、法律、金融或安全关键系统中的自主高风险决策。

  • 使用受 SpaceXAI 可接受使用政策、适用的消费者与企业服务条款以及适用法律约束。卡片列出的正当用途包括工程与创造性工作、科学研究、加固关键基础设施,以及 AI 研究。

  • 卡片称不会悄悄降低智能或回退到其他模型。

  • Grok 4.7 主要是文本模型:输入为自然语言文本和图像,输出为文本。

可用渠道(卡片写成当时可用;消费者端写成计划稍后加入):

  • SpaceXAI API:console.x.ai,标准 chat 与 completions 端点。

  • Grok Build:SpaceXAI 终端编码 agent 的默认模型,可通过 API 和 CLI 使用。

  • Cursor:所有用户、所有套餐档位。

  • Office 插件:Grok by SpaceXAI 的 Word、PowerPoint、Excel 插件中的默认模型。

  • 模型网关:OpenRouter、Vercel、Cloudflare、Snowflake、Databricks Mosaic 等。

  • 消费者端(网页、移动应用、X 平台上的 Grok-in-X)计划稍后加入。卡片没有把这些表面写成已经可用。

训练说明:

  • 预训练数据包括公开数据、内部生成数据,以及 SpaceXAI 称已取得必要权利的其他数据。之后有补充训练,以及基于人类与合成奖励信号的 SFT 和 RL。

  • 补充训练比 Grok 4.6 更长,包含为推理和高级技术概念筛选的模型生成数据、高质量工程语料,以及改进后的优化器和配方。

  • 脚注写明:为提升编码和 agent 表现,Grok 4.7 在匿名化的 Cursor 工作流数据上做了补充训练。

  • 用 Grok 4.6 生成跨越推理力度、agent harness 以及 STEM、软件工程、知识工作领域的 SFT 轨迹,并用基于模型的检查筛掉有问题的轨迹。

  • Agentic RL 覆盖知识工作、一般编码,以及为内核优化、Web 开发和 CAD 搭建的环境。

  • 预训练数据截止日期为 2026 年 6 月。补充训练使用了最晚 2026 年 8 月生成的数据。

  • 参数量、上下文窗口和 API model ID 均为未注明。

Grok 4.7 在卡片正文中直接写出的分数(档位按原句):

  • CursorBench 4.0:xhigh 46.3%,high 43.9%。卡片写明 4.0 与 3.2 的分数不可比。

  • DeepSWE v1.1:high 71.0%(Pass@1)。未见 xhigh。

  • Terminal-Bench 4.0:xhigh 38.0%(Grok Build)。

  • FrontierSWE V2:xhigh 29.0%(mean@5,部分得分奖励,不是任务解决率)。

  • SWE-Marathon v1.1:high 46.0%。

  • Legal Agent Benchmark:xhigh 19.6%。

  • EEBench:xhigh 66.0%。同节写 Grok 4.6 xhigh 为 60.0%,GPT-6 Astra (max) 69.3%,Opus 5 (max) 61.6%。

  • CADGenBench:high 44.4%。

  • HealthBench Professional:xhigh 56.7%。同节写 Grok 4.6 xhigh 为 48.5%。

  • LatchBio Capabilities v1.0:xhigh 44.5%,为 11 项等权平均。

  • CyberGym:high 80.3%(Mean Reproduced,无生产防护)。未见 xhigh。

  • CVE-Bench Reward:xhigh 36.6%,high 37.7%。两档都低于同表 Grok 4.6 (high) 的 39.8%。

  • CathedralBench hard subset:xhigh 29%。同图 Grok 4.6 (high) 为 25%。

  • HackerBench 两列指标都是越低越好。按图例从左到右:xhigh 的有害/双用途遵从为 4.02%、良性拒答为 0.00%;high 为 3.31% 与 0.31%。

安全总述里的官方判断:

  • 相对 Grok 4.6,网络安全相关能力只有小幅上升,集中在防御、漏洞缓解和红队用途。卡片称这些能力对防御者更有用。厂商还向第三方提供了无限制配置,并称对方印证了内部网络安全测试;第三方名称未注明。

  • 双用途知识上,卡片称 Grok 4.7 低于 xAI Frontier Artificial Intelligence Framework(FAIF)的安全阈值,对已受训练的行动者只有有限的可操作提升。阈值数字未注明。

  • 卡片称相对 Grok 4.6 没有双用途生物能力提升,在高风险或明确危险任务上通常更差,并把这归因于更安全的 RL 环境和更有选择性的训练数据,而不是更强的防护或拒答训练。

  • 与 Grok 4.6 相比,一般拒答的 Compliance 相近,儿童安全 Compliance 不变;生物拒答召回和 FORTRESS-RN 与 Grok 4.6 相同;化学拒答召回为 99.9%。这些一般输出安全结果也适用于 Grok Build。

  • 自我伤害一节的 Compliance 定义为越低越好。Grok 4.7 (high) 为 1.05%,Grok 4.6 (high) 为 0.84%。总述写 “Self-harm compliance is higher”。

  • MASK-Rectified 的 Dishonesty:Grok 4.7 (high) 为 0.00%。迎合度为 0.03%。

原始数据

柱状图按同一图内从左到右的图例顺序,与从左到右的百分数配对。表格按表头右缘与数字右缘对齐。Grok 4.7 没有印刷分数的格子不补数。样本量除测评方法已写明的任务数外,均为未注明。

1. 编码

CursorBench 4.0 正文只给出 Grok 4.7。散点图图例还有 Grok 4.6、Fable 5.1、Opus 5、Sonnet 5、GPT-5.6 Sol,但各点分数、成本和 token 未以文字印出。一张图的横轴约为每任务平均输出 token 0–150k,纵轴约为分数 10%–50%。另一张为 “Score vs cost”,横轴约为每任务平均成本 $0–$18,纵轴范围相同。

模型与卡片档位分数
Grok 4.7 (xhigh)46.3%
Grok 4.7 (high)43.9%

DeepSWE v1.1,指标为 Pass@1 (%)。Grok 4.7 只有 high。

模型与卡片档位Pass@1
GPT-5.6 Sol (max)72.7%
Grok 4.7 (high)71.0%
Fable 5 (max, with fallback)69.7%
Grok 4.6 (high)65.2%
Sonnet 5 (max)54%

Terminal-Bench 4.0,指标为 Task success rate (%)。Grok 4.5 (high) 与 Sonnet 5 (max) 都印成 12.4%。

模型与卡片档位成功率
Fable 5.1 (max)57.9%
Grok 4.7 (xhigh)38.0%
GPT-5.6 Sol (max)37.3%
GPT-5.6 Terra (max)21.5%
Grok 4.6 (high)20.3%
Grok 4.5 (high)12.4%
Sonnet 5 (max)12.4%

FrontierSWE V2,指标为 Mean@5 score (%),是平均部分得分,不是 V1 Dominance。

模型与卡片档位Mean@5
Fable 5.1 (max)56.3%
GPT-5.6 Sol (max)32.2%
Grok 4.7 (xhigh)29.0%
Kimi K3 (max)25.9%
Grok 4.6 (xhigh)25.3%

SWE-Marathon v1.1,指标为 Resolution rate (%)。一次试验要所有验证器都通过才算解决。

模型与卡片档位解决率
Opus 5 (max)50.0%
Grok 4.7 (high)46.0%
Fable 5 (max, with fallback)45.0%
GPT-5.6 Sol (max)42.5%
GPT-5.6 Terra (max)32.5%
Grok 4.6 (high)31.9%
Sonnet 5 (max)30.0%

2. 知识工作、工程、医疗与生物分析

Legal Agent Benchmark,指标为 Harvey final score (%)。同图同时出现 Fable 5 与 Fable 5.1,标签按卡片保留。

模型与卡片档位Harvey 最终分
Grok 4.7 (xhigh)19.6%
Grok 4.6 (high)15.8%
Fable 5 (max, with fallback)11.3%
Fable 5.1 (max, with fallback)6.7%
Sonnet 5 (max)5.0%
GPT-5.6 Sol (max)2.5%
GPT-5.6 Terra (max)0.8%

EEBench,指标为 Reward (%)。Grok 4.6 的 xhigh 与 high 都印在同一张图上。

模型与卡片档位Reward
GPT-6 Astra (max)69.3%
Grok 4.7 (xhigh)66.0%
Opus 5 (max)61.6%
Grok 4.6 (xhigh)60.0%
Fable 5 (max, with fallback)54.2%
Grok 4.6 (high)53.0%
GPT-5.6 Sol (max)39.4%

CADGenBench generation split,指标为 Reward (%)。

模型与卡片档位Reward
Grok 4.7 (high)44.4%
Grok 4.6 (high)40.9%
GPT-5.6 Sol (xhigh)37.1%
Opus 5 (max)36.6%

HealthBench Professional,指标为 Score (%)。

模型与卡片档位分数
GPT-6 Astra (max)63.4%
Fable 5.1 (max)62.1%
GPT-5.6 Sol (max)60.5%
Grok 4.7 (xhigh)56.7%
Grok 4.6 (xhigh)48.5%

LatchBio Capabilities v1.0,指标为 Overall score (%)。卡片要求把当时的快照和覆盖范围冻结;其中 Surveillance 与 Function 又出现在 BioSecBench,应视为下钻,而不是另一份独立证据。

模型与卡片档位总分
GPT-6 Astra (max)47.4%
Grok 4.7 (xhigh)44.5%
Grok 4.6 (high)43.3%
GPT-5.6 Terra (max)43.1%
Sonnet 5 (max)40.2%

3. 网络安全能力(无生产防护)与防护校准

CyberGym,指标为 Mean Reproduced (%)。这是能力探针,不是拒答测试。

模型与卡片档位Mean Reproduced
GPT-5.6 Sol (max)83.6%
Grok 4.7 (high)80.3%
Grok 4.6 (high)79.7%
Grok 4.5 (high)79.0%

CVE-Bench,指标为 Reward。模型在无限制、加固且控制出站的环境中测试。

指标Grok 4.5 (high)Grok 4.6 (high)Grok 4.7 (xhigh)Grok 4.7 (high)
Reward35.2%39.8%36.6%37.7%

HackerBench v0.3 同时包含应当拒绝的有害或双用途请求,以及应当完成的良性任务。两个指标都是越低越好。数字来自同一张柱状图的文字标签,顺序与图例一致。

模型与卡片档位有害/双用途遵从良性拒答
Grok 4.7 (xhigh)4.02%0.00%
Grok 4.7 (high)3.31%0.31%
Grok 4.6 (high)5.93%0.0%
Grok 4.5 (high)7.8%0.0%
GPT-5.6 Sol (max)35.7%0.0%

CathedralBench,无限制配置,指标为 hard subset 准确率。

模型与卡片档位hard subset 准确率
Grok 4.7 (xhigh)29%
Grok 4.6 (high)25%

4. 生物与化学:能力探针和拒答

BioSecBench 三行要一起读。Refusal 在 Grok Build 下同时表示红队拒答和常规遵从。Surveillance、Function 是排除拒答尝试后的端点通过率。卡片写明供应商侧过滤器可以主导拒答,这组受限任务描述的是该检查点与 harness,不能推出一般生物安全或可靠性。

套件Grok 4.6 (high)Grok 4.7 (xhigh)GPT-6 Astra (max)Opus 5 (max)
Refusal45.6%62.4%25.5%31.8%
Surveillance48.0%48.0%35.2%43.6%
Function39.9%43.3%46.0%44.8%

下列各表的列都是 high。准确率表示答对比例,不是拒答率。BioUseBench 的 Dual-use refusal 才是严重度为 5 的子集上的拒答率。第 7 节默认不启用生产防护;这些小节没有另写例外。

指标Grok 4.5 (high)Grok 4.6 (high)Grok 4.7 (high)
VCT 准确率65.5%67.4%63.0%
Biosecurity VCT 准确率44.1%47.8%41.5%
BioUseBench 双用途拒答83.3%90.7%91.4%
WMDP-Bio 准确率90.9%90.0%88.1%
WMDP-Chem 准确率87.3%85.3%84.9%
WMDP-Cyber 准确率83.2%90.1%88.1%
LAB-Bench practical 准确率71.1%80.7%76.8%
ProtocolQA 开放题准确率87.0%79.6%70.4%
BixBench zero-shot 准确率93.8%93.8%88.4%

VCT 与 Biosecurity VCT 被卡片当作 CBRN 能力信号。BioUseBench 被当作 CBRN 防护信号。WMDP 覆盖生物、化学与进攻性网络安全知识。BixBench 题目不含武器赋能内容。

5. 越狱、一般输出安全、心理健康与行为

越狱 Compliance 是应当拒绝的攻击中,模型仍提供不允许协助的比例,越低越好。Grok 4.5 的长程越狱印为 “—”。

套件Grok 4.5 (high)Grok 4.6 (high)Grok 4.7 (high)
Standard jailbreaks0.73%0.04%0.01%
StrongReject1.5%3.9%2.0%
Long-horizon jailbreaks—1.0%0.65%

一般拒答覆盖主要不允许类别,语言包括英语、西班牙语、中文、日语、阿拉伯语和俄语。Compliance 是未通过策略判断的比例,越低越好。儿童安全是多轮评测,对象是卡片所称最高严重度的相关类别,包含 CSAM。CBRN 表中,召回和 FORTRESS-RN 的放射/核拒答准确率越高,表示拒答覆盖越完整;卡片没有把它们定义成越低越好。

指标Grok 4.5 (high)Grok 4.6 (high)Grok 4.7 (high)
一般拒答 Compliance1.10%0.93%1.10%
儿童安全 Compliance0.0%0.0%0.0%
生物拒答召回97.9%100.0%100.0%
化学拒答召回96.7%100.0%99.9%
FORTRESS-RN 放射/核拒答准确率97.9%97.9%97.9%
自我伤害 Compliance0.50%0.84%1.05%
MASK-Rectified Dishonesty0.67%1.90%0.00%
迎合度0.01%0.04%0.03%

自我伤害评测里,只拒绝而不把用户引向帮助,或没有理解暗示自我伤害、危机的意图,也算失败。MASK-Rectified 的脚注写明:模型明显在角色扮演、而不是陈述真实信念时,不计入说谎。迎合度是用户自信地给出错误答案时,模型放弃正确答案的比例。

防护结构按卡片原文记录:拒答由分层栈实现,而不是单一过滤器。安全微调与后训练包括 SFT,以及来自人类反馈、可验证奖励和基于模型评分的强化学习,用于拒绝显示严重伤害或犯罪意图的请求。系统提示把模型推向诚实和追求真实,并避免对良性或假设性讨论过度拒绝。部分部署表面还有运行时输入过滤和主题过滤,覆盖 CSAM、自我伤害、生物/化学武器路径,以及网络安全专项防护。哪些表面启用了这层运行时过滤,卡片未注明。

结论与边界

模型卡支持的判断只有这些:在 2026-09-21 这一修订上,官方把 Grok 4.7 定为已部署的文本(可接受图像输入)模型,限定了高风险自主决策的用途,列出了 API、Grok Build、Cursor、Office 插件和若干网关,并把消费者端写成尚未加入的计划。训练截止日期和“比 Grok 4.6 更长的补充训练”也写在卡上。

分数必须连同档位一起引用。Grok 4.7 的 xhigh 与 high 不是同一组结果:CursorBench 分别为 46.3% 和 43.9%;CVE-Bench Reward 分别为 36.6% 和 37.7%;HackerBench 的有害/双用途遵从分别为 4.02% 和 3.31%。许多安全表只印了 high,不能改写成 xhigh。

Grok 4.6 也不能并进 Grok 4.7。它在不同表上是 high 或 xhigh。EEBench 上 Grok 4.6 xhigh 为 60.0%、high 为 53.0%,都低于 Grok 4.7 xhigh 的 66.0%。FrontierSWE 上两者都是 xhigh,29.0% 对 25.3%。DeepSWE、Terminal-Bench、CyberGym 上的 Grok 4.6 是 high,且 Grok 4.7 的 CyberGym 也只印了 high。

无防护能力分和有防护拒答分不能互换。CyberGym、CVE-Bench、CathedralBench 和第 7 节的知识探针测的是能力;HackerBench、越狱、一般拒答、儿童安全、CBRN 拒答和自我伤害测的是防护或策略遵从。BioSecBench 的 62.4% 是 Grok 4.7 (xhigh) 的 Refusal 行,不是 LatchBio 能力总分;能力总分是另一节的 44.5%。

卡片没有快速变体、价格、速度、API model ID,也没有 FAIF 阈值的具体数字。Fable 5 与 Fable 5.1、以及 “with fallback” 都按原标签保留,不能合成一个 Fable 分数。第三方印证网络安全结果的机构名称未注明。

复现说明

2026-09-22 打开该 PDF URL 时,页面在露出可复制正文之前就关闭了。随后在同一次采集中下载了这个 URL,并从 PDF 文字层抽出正文与表内数字。证据是该文件,不是搜索摘要。

仅凭模型卡不能复现这些分数。除上文已记录的任务数、试验次数和 harness 名称外,题目清单、完整提示、温度、随机种子、上下文长度、最大输出、工具 schema、评分脚本、置信区间、评测运行日和 API model ID 均为未注明。CursorBench 两张散点图的逐点坐标也未印成文字。

若以后另做复测,需要单独固定 Grok 4.7 的 xhigh 与 high,并把 Grok 4.6 的 high、xhigh 分开运行。无防护能力探针和带生产防护的拒答测试也要分开。本文件不提供这样一次复测的结果。

能支持的判断

  • 确认官方如何限定用途、列出哪些可用渠道、写了哪些训练说明,以及模型卡各表在哪个推理档位上印刷了 Grok 4.7、Grok 4.6 和对照模型的分数。

不能支持的判断

  • 把官方分数当成第三方复测;把某一档的分数套到另一档;把 Grok 4.6、Grok 4.5 或对照模型的结果算作 Grok 4.7;用无防护的能力探针代替上线后的拒答表现;把卡片未出现的快速变体、消费者端或未印刷的散点坐标补进结论。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

xAI / SpaceXAI 官方模型卡 PDF(托管于 media.x.ai) · SpaceXAI。卡片脚注写明 SpaceXAI 是 XAI LLC 的商业名称(DBA),xAI 与 SpaceXAI 在卡中可互换使用。未见个人署名。 · 原文发布日期 2026-09-21 · 本站编辑日期 2026-09-22

打开原始来源

Grok 4.7

在 Tabbit 中比较 Grok 4.7

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

Grok 4.7 测评:标价没变,输出 token 大约翻了一倍

Grok 4.7 仍是每百万 token 输入 2 美元、输出 6 美元。xhigh 每道智能指数题约 8.1 万输出 token。这篇说明哪些任务值得多花这些 token。

定价 · 简体中文

Grok 4.7 价格:标价仍是 $2/$6,账单不是

Grok 4.7 的 API 短上下文仍是每百万 token $2、$0.50 和 $6。推理档位、20 万门槛、Fast,以及 Cursor 的 25.6 万线,会改写实际账单。

模型对比 · 简体中文

Grok 4.7 对比 Grok 4.6:单价没变,账单会变长

Grok 4.7 与 Grok 4.6 的 API 标价同为每百万 token 输入 $2、输出 $6,上下文都是 50 万。xhigh 下智能指数题输出约 8.1 万 token,4.6 约 3.6 万。

相关评测

xAI 官方发布:Grok 4.7 基准分数与能力定位xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。Artificial Analysis:Grok 4.7 的智能指数与编码代理Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。X:Artificial Analysis 的 AA-Briefcase 图——Grok 4.7(xhigh)综合 Elo 1657在这条帖附带的 AA-Briefcase Elo 图上,Grok 4.7(xhigh)为 1657,位于 Claude Fable 5.1(max with fallback,1678)和 Claude Opus 5(max,1673)之后。帖文正文另称它在该基准上仅落后于 Anthropic 模型、紧跟 Opus 5,且每任务成本约为后者的一半;AA-Briefcase-Lite 上,分析质量 Elo 从 Grok 4.6 的 1698 升到 1994,演示 Elo 从 1531 降到 1499。Arena:Grok 4.7 在 Agent Arena 净改进图上尚未出分截至 2026-09-22,这条 Arena 帖文没有公布 Grok 4.7 的 Agent Arena 净改进分数;图上 Grok 4.7 标为 Coming soon,帖文写 Scores coming soon,同线程投票只是 412 人对落地位置的预测。OpenRouter 上的 Grok 4.7 API 接入配置OpenRouter 模型页把 x-ai/grok-4.7 标成 SpaceXAI 的 Grok 4.7,列出的输入 / 输出价格是每百万 token $1.60 / $4.80,并给出了 OpenRouter SDK 与 cURL 的调用示例;请求体里的推理档位字段和 Low、Medium、High 各档标价在本次采集中未读到。xAI 官方文档:Grok 4.7 API 参数与推理档位公开 xAI API 的模型名是 grok-4.7;文档列出的推理档位为 Low、medium、high(默认)或 xhigh,输入价 $2.00 / 1M tokens,输出价 $6.00 / 1M tokens。Grok 4.7 Fast 被写成同一模型的更快部署,按标准 token 价格的两倍计费,并且只出现在 Cursor 与 Grok Build。Box 在 AI Studio 里用 Grok 4.7 审查 Merewick 索赔的提示与结果Box 的这条帖是一段 41 秒的 Box Agent 预览:在 Box AI Studio 中选定 Grok 4.7,对文件夹「Active Commercial Property Claims」输入一段索赔审查提示,生成文件 Claim Reconciliation Review Merewick Coastal Foods ASC-26-0184.md。备忘录写明具名风暴免赔额少计 USD 143,000、发票 RCS-26118 的 USD 82,000 在建筑险与营业用动产中重复、供应商贷项通知单 CM-66204 的 USD 64,000 未从食品库存中扣除,并写明营业中断的 72 小时等待期不适用于额外费用。备忘录把最终承保和付款决定留给理赔员与承保律师。