Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Grok 4.7 · 社区来源 · 平台遥测

Arena:Grok 4.7 在 Agent Arena 净改进图上尚未出分

截至 2026-09-22,这条 Arena 帖文没有公布 Grok 4.7 的 Agent Arena 净改进分数;图上 Grok 4.7 标为 Coming soon,帖文写 Scores coming soon,同线程投票只是 412 人对落地位置的预测。

社区来源平台遥测编辑日期 2026-09-22

测试条件速查

来源具体观察
截至 2026-09-22,这条 Arena 帖文没有公布 Grok 4.7 的 Agent Arena 净改进分数;图上 Grok 4.7 标为 Coming soon,帖文写 Scores coming soon,同线程投票只是 412 人对落地位置的预测。
已公布条件
不能据此判断 Grok 4.7 的实际净改进、排名、盲测胜率,也不能外推到文本、视觉、代码或文档任务的质量。

关键数据与适用场景

一句话结论

截至 2026-09-22,这条 Arena 帖文没有公布 Grok 4.7 的 Agent Arena 净改进分数;图上 Grok 4.7 标为 Coming soon,帖文写 Scores coming soon,同线程投票只是 412 人对落地位置的预测。

适用场景

  • 适合判断的任务:判断 Arena 是否已经给出 Grok 4.7 的净改进分,以及采集当时社区把 4.7 相对历史走势预测为 Better、On trend 还是 Worse。

  • 不适合外推的任务:不能据此判断 Grok 4.7 的实际净改进、排名、盲测胜率,也不能外推到文本、视觉、代码或文档任务的质量。

  • 适用的模型版本:帖文讨论的未出分型号是 Grok 4.7。图中已绘点属于 Grok 4.3 (High)、Grok Build 0.1、Grok 4.5、Grok 4.6 (xHigh),不能写成 Grok 4.7 的结果。

  • 测试环境或客户端:图题为 Agent Arena,图源标注 SOURCE: AGENT ARENA,脚注为 RESULTS 7 DAYS AFTER RELEASE。Grok 4.7 在该图上还没有对应结果点。

  • 推理档位和参数:Grok 4.7 未注明。图上只给旧版本标注了 Grok 4.3 (High) 和 Grok 4.6 (xHigh);温度、工具配置和样本量未注明。

测评方法

这不是一条带公开投票数的 Grok 4.7 榜单行,也不是对 Grok 4.7 的受控测评。@arena 在帖文中展示一张历史净改进折线图,并在同页回复里发起预测投票。帖文原文是:Grok 4.7 by @SpaceXAI just dropped. Looking at how past Grok versions have trended on Agent Arena's net improvement score, where do you think 4.7 lands? Poll below. Scores coming soon as you vote on @arena!

图的纵轴是 NET IMPROVEMENT (%),可见刻度为 10%、5%、0%、-5%、-10%。横轴标注 8 Jun 2026、13 Jul 2026、27 Aug 2026 和 Coming soon。已绘点带有竖向误差线,但图上没有印出误差线的数值。脚注写 RESULTS 7 DAYS AFTER RELEASE,没有写出任务集、提示词、样本数或产生这些历史分数的投票数。

预测投票在同页下一条 @arena 回复:https://x.com/arena/status/2102080808123342939 ,datetime 为 2026-09-21T17:01:34.000Z。原文问题是 Where do you think Grok 4.7 will land? 选项为 Better、On trend、Worse。页面在票数后显示「最终结果」。

关键结果

  • Grok 4.7 没有净改进百分数。图上只有标签 Grok 4.7,三条虚线指向 A Better、B On trend、C Worse,横轴位置是 Coming soon。

  • 帖文明确写 Scores coming soon as you vote on @arena,表示分数还没公布。

  • 预测投票已结束,共 412 次投票:Better 47.1%,On trend 33%,Worse 19.9%。这是对落地位置的投票,不是 Agent Arena 净改进分。

原始数据

主帖页面快照(不是模型分数):12 回复,10 次转帖,203 喜欢,13 书签,查看数显示为 2.4万。

图中已绘历史点(纵轴 NET IMPROVEMENT (%);这些不是 Grok 4.7):

图上标签净改进横轴位置
Grok 4.3 (High)-8.4%8 Jun 2026
Grok Build 0.1-6.4%画在 Grok 4.3 (High) 与 Grok 4.5 之间,没有单独日期
Grok 4.55.0%13 Jul 2026
Grok 4.6 (xHigh)5.3%27 Aug 2026
Grok 4.7未绘出分数Coming soon

Grok 4.7 的三条虚线没有百分数。误差线可见,数值未注明。

同线程预测投票(最终结果):

选项得票比例
Better47.1%
On trend33%
Worse19.9%

投票总数 412。该回复的互动是 0 回复、0 次转帖、10 喜欢、4,221 次查看。

帖内还引用了 https://x.com/arena/status/2102074819743453410 。在本页上该引用以翻译形式出现并被截断,可见大意是 Grok 4.7 已进入 Agent Arena;本页引用卡没有给出 Grok 4.7 分数。

结论与边界

  • 不能把 Grok 4.6 (xHigh) 的 5.3%、Grok 4.5 的 5.0%,或图上任何负分,写成 Grok 4.7 的净改进。

  • 412 票是「4.7 会落在哪」的预测,页面自己标明分数尚未公布。Better 47.1% 不是胜率,也不是榜单名次。

  • 历史点的脚注是发布后 7 天的结果,但页上没有任务定义、样本量、置信区间数字或推理参数。误差线不能补写成具体加减值。

  • Grok Build 0.1 的 -6.4% 能在图上读到,日期没有单独标出,不能自行安到 8 Jun 2026 或 13 Jul 2026。

  • 主帖查看数只显示 2.4万,页上没有更精确的整数。

  • 这是 2026-09-22 的帖文与投票快照。Arena 之后若公布 Grok 4.7 分数,不在本页范围内。

复现说明

  1. 打开 https://x.com/arena/status/2102080801462689999 。本次使用已登录的 X 会话,没有遇到登录墙或验证码。

  2. 点击主帖「显示原文」,核对英文正文与 Scores coming soon。

  3. 帖内图为 https://pbs.twimg.com/media/HSwWqqnaAAAPTkt?format=png&name=large 。只记录图上印出的百分数和日期。

  4. 同页下一条回复 https://x.com/arena/status/2102080808123342939 是预测投票。点击该回复的「显示原文」后,选项为 Better、On trend、Worse。

能支持的判断

  • 判断 Arena 是否已经给出 Grok 4.7 的净改进分,以及采集当时社区把 4.7 相对历史走势预测为 Better、On trend 还是 Worse。

不能支持的判断

  • 不能据此判断 Grok 4.7 的实际净改进、排名、盲测胜率,也不能外推到文本、视觉、代码或文档任务的质量。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

X(@arena) · Arena.ai(@arena) · 原文发布日期 2026-09-22 · 本站编辑日期 2026-09-22

打开原始来源

Grok 4.7

在 Tabbit 中比较 Grok 4.7

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

Grok 4.7 测评:标价没变,输出 token 大约翻了一倍

Grok 4.7 仍是每百万 token 输入 2 美元、输出 6 美元。xhigh 每道智能指数题约 8.1 万输出 token。这篇说明哪些任务值得多花这些 token。

定价 · 简体中文

Grok 4.7 价格:标价仍是 $2/$6,账单不是

Grok 4.7 的 API 短上下文仍是每百万 token $2、$0.50 和 $6。推理档位、20 万门槛、Fast,以及 Cursor 的 25.6 万线,会改写实际账单。

模型对比 · 简体中文

Grok 4.7 对比 Grok 4.6:单价没变,账单会变长

Grok 4.7 与 Grok 4.6 的 API 标价同为每百万 token 输入 $2、输出 $6,上下文都是 50 万。xhigh 下智能指数题输出约 8.1 万 token,4.6 约 3.6 万。

相关评测

X:Artificial Analysis 的 AA-Briefcase 图——Grok 4.7(xhigh)综合 Elo 1657在这条帖附带的 AA-Briefcase Elo 图上,Grok 4.7(xhigh)为 1657,位于 Claude Fable 5.1(max with fallback,1678)和 Claude Opus 5(max,1673)之后。帖文正文另称它在该基准上仅落后于 Anthropic 模型、紧跟 Opus 5,且每任务成本约为后者的一半;AA-Briefcase-Lite 上,分析质量 Elo 从 Grok 4.6 的 1698 升到 1994,演示 Elo 从 1531 降到 1499。xAI 官方发布:Grok 4.7 基准分数与能力定位xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。xAI 官方模型卡:Grok 4.7 的安全评测与使用边界官方模型卡把 Grok 4.7 写成 Grok 4.6 之后、面向编码、工程与办公室任务的已部署检查点,并给出可用渠道、训练截止日期,以及在 xhigh 或 high 档上的能力与安全分数;卡片没有出现快速变体,也没有 API model ID。Artificial Analysis:Grok 4.7 的智能指数与编码代理Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。Box 在 AI Studio 里用 Grok 4.7 审查 Merewick 索赔的提示与结果Box 的这条帖是一段 41 秒的 Box Agent 预览:在 Box AI Studio 中选定 Grok 4.7,对文件夹「Active Commercial Property Claims」输入一段索赔审查提示,生成文件 Claim Reconciliation Review Merewick Coastal Foods ASC-26-0184.md。备忘录写明具名风暴免赔额少计 USD 143,000、发票 RCS-26118 的 USD 82,000 在建筑险与营业用动产中重复、供应商贷项通知单 CM-66204 的 USD 64,000 未从食品库存中扣除,并写明营业中断的 72 小时等待期不适用于额外费用。备忘录把最终承保和付款决定留给理赔员与承保律师。OpenRouter 上的 Grok 4.7 API 接入配置OpenRouter 模型页把 x-ai/grok-4.7 标成 SpaceXAI 的 Grok 4.7,列出的输入 / 输出价格是每百万 token $1.60 / $4.80,并给出了 OpenRouter SDK 与 cURL 的调用示例;请求体里的推理档位字段和 Low、Medium、High 各档标价在本次采集中未读到。xAI 官方文档:Grok 4.7 API 参数与推理档位公开 xAI API 的模型名是 grok-4.7;文档列出的推理档位为 Low、medium、high(默认)或 xhigh,输入价 $2.00 / 1M tokens,输出价 $6.00 / 1M tokens。Grok 4.7 Fast 被写成同一模型的更快部署,按标准 token 价格的两倍计费,并且只出现在 Cursor 与 Grok Build。