xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。
xAI News(浏览器标题后缀为 SpaceXAI,页脚版权为 SpaceXAI LLC) · 查看证据Grok 4.7 · 测评与证据
Grok 4.7,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
官方模型卡把 Grok 4.7 写成 Grok 4.6 之后、面向编码、工程与办公室任务的已部署检查点,并给出可用渠道、训练截止日期,以及在 xhigh 或 high 档上的能力与安全分数;卡片没有出现快速变体,也没有 API model ID。
xAI / SpaceXAI 官方模型卡 PDF(托管于 media.x.ai) · 查看证据Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。
Artificial Analysis · 查看证据完整测评与相关内容
精选证据
xAI 官方发布:Grok 4.7 基准分数与能力定位
xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。
- 来源具体观察
- xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。
- 已公布条件
- 把本页分数当作第三方复测;把标题中的速度和价格口号换成已测量的对照实验;把快速变体、Grok 4.6 或其他推理档位的结果并入 Grok 4.7 xHigh;在缺少样本量、harness 和评分脚本时比较胜率或成本效率。
xAI 官方模型卡:Grok 4.7 的安全评测与使用边界
官方模型卡把 Grok 4.7 写成 Grok 4.6 之后、面向编码、工程与办公室任务的已部署检查点,并给出可用渠道、训练截止日期,以及在 xhigh 或 high 档上的能力与安全分数;卡片没有出现快速变体,也没有 API model ID。
- 来源具体观察
- 官方模型卡把 Grok 4.7 写成 Grok 4.6 之后、面向编码、工程与办公室任务的已部署检查点,并给出可用渠道、训练截止日期,以及在 xhigh 或 high 档上的能力与安全分数;卡片没有出现快速变体,也没有 API model ID。
- 已公布条件
- 把官方分数当成第三方复测;把某一档的分数套到另一档;把 Grok 4.6、Grok 4.5 或对照模型的结果算作 Grok 4.7;用无防护的能力探针代替上线后的拒答表现;把卡片未出现的快速变体、消费者端或未印刷的散点坐标补进结论。
Artificial Analysis:Grok 4.7 的智能指数与编码代理
Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。
- 来源具体观察
- Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。
- 已公布条件
- 把本页分数换成 xAI 发布页的自报基准;把 Grok 4.6 的 high 与 xhigh 当成同一档;把 Coding Agent Index 里的 Terminal-Bench 4.0 当成 Intelligence Index 里的同名项目;把约 7.1 分钟理解成含首 token 和开销的端到端墙钟时间;把标价理解成本次评测的美元花费。
X:Artificial Analysis 的 AA-Briefcase 图——Grok 4.7(xhigh)综合 Elo 1657
在这条帖附带的 AA-Briefcase Elo 图上,Grok 4.7(xhigh)为 1657,位于 Claude Fable 5.1(max with fallback,1678)和 Claude Opus 5(max,1673)之后。帖文正文另称它在该基准上仅落后于 Anthropic 模型、紧跟 Opus 5,且每任务成本约为后者的一半;AA-Briefcase-Lite 上,分析质量 Elo 从 Grok 4.6 的 1698 升到 1994,演示 Elo 从 1531 降到 1499。
- 来源具体观察
- 在这条帖附带的 AA-Briefcase Elo 图上,Grok 4.7(xhigh)为 1657,位于 Claude Fable 5.1(max with fallback,1678)和 Claude Opus 5(max,1673)之后。帖文正文另称它在该基准上仅落后于 Anthropic 模型、紧跟 Opus 5,且每任务成本约为后者的一半;AA-Briefcase-Lite 上,分析质量 Elo 从 Grok 4.6 的 1698 升到 1994,演示 Elo 从 1531 降到 1499。
- 已公布条件
- 编码、多模态、通用对话,以及任何未出现在这张图或这段正文里的基准。图上的综合 Elo 不能换成其他 harness 的分数。
全部来源
全部来源
xAI 官方发布:Grok 4.7 基准分数与能力定位
xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。
- 来源具体观察
- xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。
- 已公布条件
- 把本页分数当作第三方复测;把标题中的速度和价格口号换成已测量的对照实验;把快速变体、Grok 4.6 或其他推理档位的结果并入 Grok 4.7 xHigh;在缺少样本量、harness 和评分脚本时比较胜率或成本效率。
xAI 官方模型卡:Grok 4.7 的安全评测与使用边界
官方模型卡把 Grok 4.7 写成 Grok 4.6 之后、面向编码、工程与办公室任务的已部署检查点,并给出可用渠道、训练截止日期,以及在 xhigh 或 high 档上的能力与安全分数;卡片没有出现快速变体,也没有 API model ID。
- 来源具体观察
- 官方模型卡把 Grok 4.7 写成 Grok 4.6 之后、面向编码、工程与办公室任务的已部署检查点,并给出可用渠道、训练截止日期,以及在 xhigh 或 high 档上的能力与安全分数;卡片没有出现快速变体,也没有 API model ID。
- 已公布条件
- 把官方分数当成第三方复测;把某一档的分数套到另一档;把 Grok 4.6、Grok 4.5 或对照模型的结果算作 Grok 4.7;用无防护的能力探针代替上线后的拒答表现;把卡片未出现的快速变体、消费者端或未印刷的散点坐标补进结论。
Artificial Analysis:Grok 4.7 的智能指数与编码代理
Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。
- 来源具体观察
- Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。
- 已公布条件
- 把本页分数换成 xAI 发布页的自报基准;把 Grok 4.6 的 high 与 xhigh 当成同一档;把 Coding Agent Index 里的 Terminal-Bench 4.0 当成 Intelligence Index 里的同名项目;把约 7.1 分钟理解成含首 token 和开销的端到端墙钟时间;把标价理解成本次评测的美元花费。
X:Artificial Analysis 的 AA-Briefcase 图——Grok 4.7(xhigh)综合 Elo 1657
在这条帖附带的 AA-Briefcase Elo 图上,Grok 4.7(xhigh)为 1657,位于 Claude Fable 5.1(max with fallback,1678)和 Claude Opus 5(max,1673)之后。帖文正文另称它在该基准上仅落后于 Anthropic 模型、紧跟 Opus 5,且每任务成本约为后者的一半;AA-Briefcase-Lite 上,分析质量 Elo 从 Grok 4.6 的 1698 升到 1994,演示 Elo 从 1531 降到 1499。
- 来源具体观察
- 在这条帖附带的 AA-Briefcase Elo 图上,Grok 4.7(xhigh)为 1657,位于 Claude Fable 5.1(max with fallback,1678)和 Claude Opus 5(max,1673)之后。帖文正文另称它在该基准上仅落后于 Anthropic 模型、紧跟 Opus 5,且每任务成本约为后者的一半;AA-Briefcase-Lite 上,分析质量 Elo 从 Grok 4.6 的 1698 升到 1994,演示 Elo 从 1531 降到 1499。
- 已公布条件
- 编码、多模态、通用对话,以及任何未出现在这张图或这段正文里的基准。图上的综合 Elo 不能换成其他 harness 的分数。
Arena:Grok 4.7 在 Agent Arena 净改进图上尚未出分
截至 2026-09-22,这条 Arena 帖文没有公布 Grok 4.7 的 Agent Arena 净改进分数;图上 Grok 4.7 标为 Coming soon,帖文写 Scores coming soon,同线程投票只是 412 人对落地位置的预测。
- 来源具体观察
- 截至 2026-09-22,这条 Arena 帖文没有公布 Grok 4.7 的 Agent Arena 净改进分数;图上 Grok 4.7 标为 Coming soon,帖文写 Scores coming soon,同线程投票只是 412 人对落地位置的预测。
- 已公布条件
- 不能据此判断 Grok 4.7 的实际净改进、排名、盲测胜率,也不能外推到文本、视觉、代码或文档任务的质量。
Cursor Ultra 同一任务下 Grok 4.7 与 4.6 的用量消耗
在 Cursor Ultra、extra high、关闭 fast mode 的条件下,作者用同一任务的套餐用量下降速度,估计 Grok 4.7 大约是 Grok 4.6 的 2.5 倍消耗;这是单账号的短时计时,不能当成质量基准。
- 来源具体观察
- 在 Cursor Ultra、extra high、关闭 fast mode 的条件下,作者用同一任务的套餐用量下降速度,估计 Grok 4.7 大约是 Grok 4.6 的 2.5 倍消耗;这是单账号的短时计时,不能当成质量基准。
- 已公布条件
- 代码是否做对、回答质量、官方 API 美元账单、fast mode、其他推理档位、其他客户端,以及作者没有写出的那项任务以外的工作。
Reddit 上并排观看 Grok 4.6 与 Grok 4.7 的帝国时代画面
这是一条约 55 秒、无声、左右分屏的视频:左边标着 Grok 4.6,右边标着 Grok 4.7,画面都是《帝国时代 II》风格的城镇和战斗。帖子没有提示词、客户端、推理档位或胜负规则,只能当作一次并排观感。
- 来源具体观察
- 这是一条约 55 秒、无声、左右分屏的视频:左边标着 Grok 4.6,右边标着 Grok 4.7,画面都是《帝国时代 II》风格的城镇和战斗。帖子没有提示词、客户端、推理档位或胜负规则,只能当作一次并排观感。
- 已公布条件
- 谁完成了建造、两边是不是同一张地图或同一句提示词、操作质量、官方 API 费用,以及其他游戏或客户端。
Grok 4.7 在 Box AI Studio 处理一笔保险索赔的使用报告
作者用一条视频帖称,Grok 4.7 在 Box AI Studio 里处理一笔 200 万美元保险索赔时,指出一张 8.2 万美元的重复发票和一笔缺失的 6.4 万美元 supplier credit,并为理赔员引用了索赔审查。采集只读到这句文字,视频画面没有转写。
- 来源具体观察
- 作者用一条视频帖称,Grok 4.7 在 Box AI Studio 里处理一笔 200 万美元保险索赔时,指出一张 8.2 万美元的重复发票和一笔缺失的 6.4 万美元 supplier credit,并为理赔员引用了索赔审查。采集只读到这句文字,视频画面没有转写。
- 已公布条件
- 索赔是否获赔、净节省金额、其他险种或其他金额、其他客户端、官方基准、API 成本,以及视频里没有写成文字的操作步骤。
r/cursor 用户对 Grok 4.7 的首批使用印象
发帖后数小时内的 7 条评论里,四条给出了 Grok 4.7 的主观印象:没有 4.6 那么慢、感觉像不那么过度思考的 opus5、写作似乎更好但仍在测试,以及 Devin 的 SWE 2.0 加 fusion api 被说成更好。没有人写出任务、计时或评分。
- 来源具体观察
- 发帖后数小时内的 7 条评论里,四条给出了 Grok 4.7 的主观印象:没有 4.6 那么慢、感觉像不那么过度思考的 opus5、写作似乎更好但仍在测试,以及 Devin 的 SWE 2.0 加 fusion api 被说成更好。没有人写出任务、计时或评分。
- 已公布条件
- 代码是否做对、基准名次、价格、套餐用量、官方 API 账单,以及任何需要固定任务和评分规则的比较。
X:eric zakariasson 并排演示 Grok 4.6 与 Grok 4.7 搭建《帝国时代 II》
这条帖用一段约 56 秒、1920×720 的左右分屏视频,演示 Grok 4.6 与 Grok 4.7 搭建《帝国时代 II》。抽看的帧上能读到两边的标签、时代和顶栏数字,但没有提示词、推理档位或胜负字幕。帖里引用的 @SpaceXAI 图片另有一张价格和基准表,那张表不是这段游戏画面的计分。
- 来源具体观察
- 这条帖用一段约 56 秒、1920×720 的左右分屏视频,演示 Grok 4.6 与 Grok 4.7 搭建《帝国时代 II》。抽看的帧上能读到两边的标签、时代和顶栏数字,但没有提示词、推理档位或胜负字幕。帖里引用的 @SpaceXAI 图片另有一张价格和基准表,那张表不是这段游戏画面的计分。
- 已公布条件
- 哪一边赢了、两边是不是同一句提示词或同一张地图、操作质量、编码和其他游戏,以及引用图没有列出的基准。