Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Grok 4.7 · 社区来源 · 编辑分析

X:eric zakariasson 并排演示 Grok 4.6 与 Grok 4.7 搭建《帝国时代 II》

这条帖用一段约 56 秒、1920×720 的左右分屏视频,演示 Grok 4.6 与 Grok 4.7 搭建《帝国时代 II》。抽看的帧上能读到两边的标签、时代和顶栏数字,但没有提示词、推理档位或胜负字幕。帖里引用的 @SpaceXAI 图片另有一张价格和基准表,那张表不是这段游戏画面的计分。

社区来源编辑分析编辑日期 2026-09-22

测试条件速查

来源具体观察
这条帖用一段约 56 秒、1920×720 的左右分屏视频,演示 Grok 4.6 与 Grok 4.7 搭建《帝国时代 II》。抽看的帧上能读到两边的标签、时代和顶栏数字,但没有提示词、推理档位或胜负字幕。帖里引用的 @SpaceXAI 图片另有一张价格和基准表,那张表不是这段游戏画面的计分。
已公布条件
哪一边赢了、两边是不是同一句提示词或同一张地图、操作质量、编码和其他游戏,以及引用图没有列出的基准。

关键数据与适用场景

一句话结论

这条帖用一段约 56 秒、1920×720 的左右分屏视频,演示 Grok 4.6 与 Grok 4.7 搭建《帝国时代 II》。抽看的帧上能读到两边的标签、时代和顶栏数字,但没有提示词、推理档位或胜负字幕。帖里引用的 @SpaceXAI 图片另有一张价格和基准表,那张表不是这段游戏画面的计分。

适用场景

  • 适合判断的任务:这段视频里,两个标签下的画面分别停在什么时代,以及抽帧时刻顶栏数字大概是多少。

  • 不适合外推的任务:哪一边赢了、两边是不是同一句提示词或同一张地图、操作质量、编码和其他游戏,以及引用图没有列出的基准。

  • 适用的模型版本:正文和画面标签写的是 Grok 4.6 与 Grok 4.7。更细的检查点、API 模型 ID 未注明。

  • 测试环境或客户端:正文提到 Cursor、Grok Build 和 API,没有写这段视频用的是哪一个。未注明。

  • 推理档位和参数:视频未注明。引用图的列名把 Grok 4.7 标成 xHigh,把 Grok 4.6 标成 High。

测评方法

作者没有写步骤、输入或评分规则。比较来自嵌入视频的分屏标签。视频时长 55.96 秒,分辨率 1920×720,播放器进度显示到 0:56。播放器提示当前视频无字幕。采集时把进度停在 0:00、0:08、0:16、0:24、0:32、0:40、0:48 和 0:54.5,读取原生画面的顶栏和底部标签。左侧顶栏最左边有一位被裁切的数字,各帧不稳定,不记入下表。

同一条永久链接里还引用了 @SpaceXAI 的帖,附有一张四列表。表内数字来自这张图,不是游戏画面里的分数。

关键结果

点击「显示原文」后的正文:

grok 4.7 is here, and its our best model so far! try it out in cursor, grok build, api or anywhere you get your… 以上为必要节选,完整内容请查看原文。

「迄今为止最好的模型」是作者自己的话。视频没有给出名次、倒计时或胜负字幕。

抽帧时读到的顶栏:

时间左侧 Grok 4.6右侧 Grok 4.7
0:00、0:08、0:16、0:2495、85;人口 46/155;Age II Idle 3445、35、25、40;Age 1
0:3295、85;人口 46/155;Age II Idle 3465、35、25、50;Age 1
0:4090、40;人口 45/155;Age II Idle 3365、35、25、50;Age 1
0:4890、40;人口 46/155;Age II Idle 34115、35、55、50;Age 1
0:54.590、40;人口 46/155;Age II Idle 22115、35、55、50;Age 1

0:00 和 0:08 的左侧是一座海岸城镇,画面中央有黄色大字 TIDEHOLD,下面一行是 The Brinewatch Landing。0:16 起左侧镜头离开这块地名条,能看到水车、码头、塔和士兵。右侧 0:00 和 0:08 是石砌城堡城镇,0:16 和 0:24 切到带脚手架的工地,0:32 是临水建筑,0:48 和 0:54.5 是一大片近战。抽到的这些帧里,右侧时代按钮一直写着 Age 1,也没有和左侧一样的地名条。

左侧底部指令栏在这些帧上能读出 Dock、House、Barracks。右侧底部没有读出同样的三个词。两边没有共同计分板。

原始数据

采集时这条帖的互动计数是 153 回复、99 次转帖、1682 喜欢、168 书签、2723271 次观看。这些是页面计数,不是模型分数。

引用帖可见英文为:

Grok 4.7 is here. It's a notable improvement over Grok 4.6 at the same price and speed.

该引用的 datetime 为 2026-09-21T16:17:53.000Z,永久链接是 https://x.com/SpaceXAI/status/2102069815225586149。图中四列从左到右是 Grok 4.7 xHigh、Grok 4.6 High、GPT-5.6 Sol Max、Fable 5.1 Max。脚注写着 *High Effort,只标在 Grok 4.7 的 DeepSWE 一格。样本量、提供商、运行日期和提示词未注明。

行Grok 4.7 xHighGrok 4.6 HighGPT-5.6 Sol MaxFable 5.1 Max
Input token price,$ per million$2$2$4$10
Output token price,$ per million$6$6$20$50
Software engineering,CursorBench 4.046.3%40.4%41.7%51.8%
Software engineering,DeepSWE v1.171.0%*65.2%72.7%70.0%
Electrical engineering,EEBench64.0%53.0%39.4%56.4%
Multi-Hour office work,AA-Briefcase v1.11657154614871678
Multi-Hour terminal work,Terminal-Bench 4.038.0%20.3%37.3%57.9%
Legal work,Harvey Legal Agent19.6%15.8%2.5%6.7%
Clinical reasoning,HealthBench Pro56.7%48.5%60.5%62.1%

结论与边界

这段视频只说明一次并排画面里,两边标签、时代字样和抽帧顶栏分别是什么。右侧停在 Age 1、左侧停在 Age II,是画面上的字,帖文没有据此宣布胜负,也不能换成「4.7 没能升级」或「4.6 更会玩游戏」。

引用图里的 1657 是 AA-Briefcase v1.1 那一行的 Grok 4.7 xHigh,对照列是 Grok 4.6 High 的 1546。它不是游戏视频的分数,也不能和另一条档位不同的 Grok 4.6 数字直接相减。表上没有写出哪一列是总冠军。

复现说明

2026-09-22 打开上述永久链接。页面已登录,没有遇到验证码。点击「显示原文」后抄录英文正文,播放嵌入视频,并在上面八个时间点暂停,读取 1920×720 画面的顶栏。引用图从帖内图片地址下载后读表;引用句的英文是在同一任务里打开该引用永久链接、再点「显示原文」后抄录的。帖文没有给出提示词、客户端、推理档位或原始运行记录,因此不能只靠这条帖重跑这段演示。

能支持的判断

  • 这段视频里,两个标签下的画面分别停在什么时代,以及抽帧时刻顶栏数字大概是多少。

不能支持的判断

  • 哪一边赢了、两边是不是同一句提示词或同一张地图、操作质量、编码和其他游戏,以及引用图没有列出的基准。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

X · eric zakariasson(@ericzakariasson,认证账号) · 原文发布日期 2026-09-21 · 本站编辑日期 2026-09-22

打开原始来源

Grok 4.7

在 Tabbit 中比较 Grok 4.7

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

Grok 4.7 测评:标价没变,输出 token 大约翻了一倍

Grok 4.7 仍是每百万 token 输入 2 美元、输出 6 美元。xhigh 每道智能指数题约 8.1 万输出 token。这篇说明哪些任务值得多花这些 token。

定价 · 简体中文

Grok 4.7 价格:标价仍是 $2/$6,账单不是

Grok 4.7 的 API 短上下文仍是每百万 token $2、$0.50 和 $6。推理档位、20 万门槛、Fast,以及 Cursor 的 25.6 万线,会改写实际账单。

模型对比 · 简体中文

Grok 4.7 对比 Grok 4.6:单价没变,账单会变长

Grok 4.7 与 Grok 4.6 的 API 标价同为每百万 token 输入 $2、输出 $6,上下文都是 50 万。xhigh 下智能指数题输出约 8.1 万 token,4.6 约 3.6 万。

相关评测

X:Artificial Analysis 的 AA-Briefcase 图——Grok 4.7(xhigh)综合 Elo 1657在这条帖附带的 AA-Briefcase Elo 图上,Grok 4.7(xhigh)为 1657,位于 Claude Fable 5.1(max with fallback,1678)和 Claude Opus 5(max,1673)之后。帖文正文另称它在该基准上仅落后于 Anthropic 模型、紧跟 Opus 5,且每任务成本约为后者的一半;AA-Briefcase-Lite 上,分析质量 Elo 从 Grok 4.6 的 1698 升到 1994,演示 Elo 从 1531 降到 1499。xAI 官方发布:Grok 4.7 基准分数与能力定位xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。xAI 官方模型卡:Grok 4.7 的安全评测与使用边界官方模型卡把 Grok 4.7 写成 Grok 4.6 之后、面向编码、工程与办公室任务的已部署检查点,并给出可用渠道、训练截止日期,以及在 xhigh 或 high 档上的能力与安全分数;卡片没有出现快速变体,也没有 API model ID。Artificial Analysis:Grok 4.7 的智能指数与编码代理Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。Box 在 AI Studio 里用 Grok 4.7 审查 Merewick 索赔的提示与结果Box 的这条帖是一段 41 秒的 Box Agent 预览:在 Box AI Studio 中选定 Grok 4.7,对文件夹「Active Commercial Property Claims」输入一段索赔审查提示,生成文件 Claim Reconciliation Review Merewick Coastal Foods ASC-26-0184.md。备忘录写明具名风暴免赔额少计 USD 143,000、发票 RCS-26118 的 USD 82,000 在建筑险与营业用动产中重复、供应商贷项通知单 CM-66204 的 USD 64,000 未从食品库存中扣除,并写明营业中断的 72 小时等待期不适用于额外费用。备忘录把最终承保和付款决定留给理赔员与承保律师。OpenRouter 上的 Grok 4.7 API 接入配置OpenRouter 模型页把 x-ai/grok-4.7 标成 SpaceXAI 的 Grok 4.7,列出的输入 / 输出价格是每百万 token $1.60 / $4.80,并给出了 OpenRouter SDK 与 cURL 的调用示例;请求体里的推理档位字段和 Low、Medium、High 各档标价在本次采集中未读到。xAI 官方文档:Grok 4.7 API 参数与推理档位公开 xAI API 的模型名是 grok-4.7;文档列出的推理档位为 Low、medium、high(默认)或 xhigh,输入价 $2.00 / 1M tokens,输出价 $6.00 / 1M tokens。Grok 4.7 Fast 被写成同一模型的更快部署,按标准 token 价格的两倍计费,并且只出现在 Cursor 与 Grok Build。