Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Grok 4.7 · 社区来源 · 独立测量

X:Artificial Analysis 的 AA-Briefcase 图——Grok 4.7(xhigh)综合 Elo 1657

在这条帖附带的 AA-Briefcase Elo 图上,Grok 4.7(xhigh)为 1657,位于 Claude Fable 5.1(max with fallback,1678)和 Claude Opus 5(max,1673)之后。帖文正文另称它在该基准上仅落后于 Anthropic 模型、紧跟 Opus 5,且每任务成本约为后者的一半;AA-Briefcase-Lite 上,分析质量 Elo 从 Grok 4.6 的 1698 升到 1994,演示 Elo 从 1531 降到 1499。

社区来源独立测量编辑日期 2026-09-22

测试条件速查

来源具体观察
在这条帖附带的 AA-Briefcase Elo 图上,Grok 4.7(xhigh)为 1657,位于 Claude Fable 5.1(max with fallback,1678)和 Claude Opus 5(max,1673)之后。帖文正文另称它在该基准上仅落后于 Anthropic 模型、紧跟 Opus 5,且每任务成本约为后者的一半;AA-Briefcase-Lite 上,分析质量 Elo 从 Grok 4.6 的 1698 升到 1994,演示 Elo 从 1531 降到 1499。
已公布条件
编码、多模态、通用对话,以及任何未出现在这张图或这段正文里的基准。图上的综合 Elo 不能换成其他 harness 的分数。

关键数据与适用场景

一句话结论

在这条帖附带的 AA-Briefcase Elo 图上,Grok 4.7(xhigh)为 1657,位于 Claude Fable 5.1(max with fallback,1678)和 Claude Opus 5(max,1673)之后。帖文正文另称它在该基准上仅落后于 Anthropic 模型、紧跟 Opus 5,且每任务成本约为后者的一半;AA-Briefcase-Lite 上,分析质量 Elo 从 Grok 4.6 的 1698 升到 1994,演示 Elo 从 1531 降到 1499。

适用场景

  • 适合判断的任务:Artificial Analysis 定义的代理式知识工作,以及帖文点名的公开尽职调查场景:搭建市场模型并做目标评估演示稿。

  • 不适合外推的任务:编码、多模态、通用对话,以及任何未出现在这张图或这段正文里的基准。图上的综合 Elo 不能换成其他 harness 的分数。

  • 适用的模型版本:正文与图轴写的是 Grok 4.7;对照条是 Grok 4.6。更细的检查点、API 模型 ID 未注明。

  • 测试环境或客户端:图注写明 AA-Briefcase v1.1,由 Artificial Analysis 开发。具体 API 供应商、客户端和运行日期未注明。

  • 推理档位和参数:图上 Grok 4.7 与 Grok 4.6 均为 xhigh。示例幻灯片的 API 成本也标明 xhigh。其他档位未注明。

测评方法

帖文第一张图的图注写明:AA-Briefcase v1.1 是 Artificial Analysis 开发的代理式知识工作基准;AA-Briefcase Elo 是综合指标,汇总评分量表通过率、分析质量 Elo 和演示 Elo,越高越好。各柱上方有误差线,但线端数值在本次截图里没有逐条读出。

正文把 Grok 4.7 相对 Grok 4.6 的变化放在 AA-Briefcase-Lite:作者称为公开尽职调查场景,任务是搭建市场模型并制作目标评估演示稿。样本量、提示词、评审模型和运行次数未注明。

同一永久链接下还有作者自己的两条后续帖,只比较演示稿写法,没有再给出 Elo。

这条永久链接的可见正文和链接里没有 artificialanalysis.ai 文章地址。下列数字只来自帖文英文原文和第一张图。

关键结果

英文原文(点击「显示原文」后的正文):

Grok 4.7 is behind only Anthropic models on AA-Briefcase, ranking just behind Opus 5 at ~50% of its Cost per Task Grok 4… 以上为必要节选,完整内容请查看原文。

与图对照:

  • 综合 AA-Briefcase Elo:Grok 4.7(xhigh)1657,Grok 4.6(xhigh)1555。图上箭头从 1657 指向 1555。

  • 1657 上面的两条都是 Anthropic 模型:Claude Fable 5.1(max with fallback)1678,Claude Opus 5(max)1673。再下一条是 Claude Opus 5(xhigh)1649。这与正文「只落后于 Anthropic 模型、紧跟 Opus 5」一致;第一名在图上是 Fable 5.1,不是 Opus 5。

  • 每任务成本「约为 Opus 5 的约 50%」只出现在正文,这张 Elo 图没有成本轴,也没有给出 Opus 5 的每任务美元数。

  • 1698 → 1994 与 1531 → 1499 是正文中的 AA-Briefcase-Lite 分析质量 Elo 和演示 Elo,不是图上的综合 Elo。1657 不能与 1994 直接相减。

  • 生成示例演示稿的 API 成本:Grok 4.7(xhigh)约 8 美元,Grok 4.6(xhigh)约 4.40 美元。这是示例稿成本,不是上面的「每任务成本」。

原始数据

图中从左到右、本次能对齐的柱值与轴标签:

顺序轴上可见标签AA-Briefcase Elo
1Claude Fable 5.1 (max with fallback)1678
2Claude Opus 5 (max)1673
3Grok 4.7 (xhigh)1657
4Claude Opus 5 (xhigh)1649
5Qwen3.8 Max (0902)1640
6Muse Spark 1.3 (max)1597
7Qwen3.8-Flash-Next1597
8Claude Fable 5.1 (high with fallback)1592
9GPT-6 Astra (max)1569
10Grok 4.6 (xhigh)1555
11GLM-5.3 (max)1525
12Kimi K3 (max)1510
13GPT-5.6 Sol (max)1487
14GLM-5.3-Flash1459
15Step 5 Preview1432
16DeepSeek V4.1 Flash (max)1432
17Qwen3.8 27B (xhigh)1403
18GPT-5.6 Luna (max)1345
19GPT-5.6 Terra (max)1336
20K2 Horizon … A23B1303
21DeepSeek V4 Pro 0813 (max)1261
22Gemini 3.8 Flash (high)1202

第 14、15 条的括号档位在轴上没有读清。第 20 条能读出 K2 Horizon 和 A23B;中间的参数规模数字在不同裁切下不稳定,不记具体 B 数。误差线可见,线端数值未记。

同页作者后续帖(不是另一套分数):

  • https://x.com/ArtificialAnlys/status/2102170395130708064:Example 1。任务是私募股权演示模板中的可比基准分析,并带逐步估值链。Grok 4.6 做简短分析并落在交易合伙人的简略估计上;Grok 4.7 独立跑估值链并标出差异。附有幻灯片截图,表内单元格未逐格抄录。

  • https://x.com/ArtificialAnlys/status/2102170398339313801:Example 2。任务是覆盖规模和财务的资产简介。Grok 4.6 只用最新一年,没有收入趋势或货币讨论;Grok 4.7 看完三年历史,并得出增长被货币贬值抵消、从而影响购买决定。附有幻灯片截图,表内单元格未逐格抄录。

结论与边界

这条帖给出的是 Artificial Analysis 自己的 AA-Briefcase v1.1 综合 Elo 快照,加上一段 AA-Briefcase-Lite 的分项 Elo 和示例稿 API 成本。Grok 4.7(xhigh)在可见柱序里排第三,高于同图的 Grok 4.6(xhigh,1555),也高于图上的 GPT-6 Astra(max,1569)。

不能据此说 Grok 4.7 在所有任务上接近 Opus 5。每任务成本约为一半没有配上美元单价或任务定义。分析质量上升和演示 Elo 小幅下降发生在 Lite 场景,而且演示稿 API 成本从约 4.40 美元增到约 8 美元。示例帖只说明两份尽职调查幻灯片的写法差异。

复现说明

2026-09-22 打开上述永久链接,点击「显示原文」后抄录英文正文,并放大第一张图的柱值与轴标签。页面可直接阅读,没有遇到登录墙或验证码。帖文没有写出题目数量、提示词、评审脚本或原始运行记录,因此不能只靠这条帖重跑 1657。同页回复里的幻灯片截图只作定性示例,不把未读清的表内数字写入本文。

能支持的判断

  • Artificial Analysis 定义的代理式知识工作,以及帖文点名的公开尽职调查场景:搭建市场模型并做目标评估演示稿。

不能支持的判断

  • 编码、多模态、通用对话,以及任何未出现在这张图或这段正文里的基准。图上的综合 Elo 不能换成其他 harness 的分数。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

X · Artificial Analysis(@ArtificialAnlys) · 原文发布日期 2026-09-22 · 本站编辑日期 2026-09-22

打开原始来源

Grok 4.7

在 Tabbit 中比较 Grok 4.7

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

Grok 4.7 测评:标价没变,输出 token 大约翻了一倍

Grok 4.7 仍是每百万 token 输入 2 美元、输出 6 美元。xhigh 每道智能指数题约 8.1 万输出 token。这篇说明哪些任务值得多花这些 token。

定价 · 简体中文

Grok 4.7 价格:标价仍是 $2/$6,账单不是

Grok 4.7 的 API 短上下文仍是每百万 token $2、$0.50 和 $6。推理档位、20 万门槛、Fast,以及 Cursor 的 25.6 万线,会改写实际账单。

模型对比 · 简体中文

Grok 4.7 对比 Grok 4.6:单价没变,账单会变长

Grok 4.7 与 Grok 4.6 的 API 标价同为每百万 token 输入 $2、输出 $6,上下文都是 50 万。xhigh 下智能指数题输出约 8.1 万 token,4.6 约 3.6 万。

相关评测

xAI 官方发布:Grok 4.7 基准分数与能力定位xAI 在发布页把 Grok 4.7 定位为编码与知识工作模型,并自报 CursorBench 4.0、DeepSWE v1.1、EEBench 等分数;这些数字是 2026-09-22 打开原文时可见的厂商口径,本篇没有做独立复测。xAI 官方模型卡:Grok 4.7 的安全评测与使用边界官方模型卡把 Grok 4.7 写成 Grok 4.6 之后、面向编码、工程与办公室任务的已部署检查点,并给出可用渠道、训练截止日期,以及在 xhigh 或 high 档上的能力与安全分数;卡片没有出现快速变体,也没有 API model ID。Artificial Analysis:Grok 4.7 的智能指数与编码代理Artificial Analysis 用 xhigh 档测得 Grok 4.7 的 Intelligence Index v4.3 为 46,Coding Agent Index v1.5 在 Grok Build 上为 56;知识工作 Elo 高于 Grok 4.6 (high),同时每道智能指数题的输出 token 大约 81k。Arena:Grok 4.7 在 Agent Arena 净改进图上尚未出分截至 2026-09-22,这条 Arena 帖文没有公布 Grok 4.7 的 Agent Arena 净改进分数;图上 Grok 4.7 标为 Coming soon,帖文写 Scores coming soon,同线程投票只是 412 人对落地位置的预测。Box 在 AI Studio 里用 Grok 4.7 审查 Merewick 索赔的提示与结果Box 的这条帖是一段 41 秒的 Box Agent 预览:在 Box AI Studio 中选定 Grok 4.7,对文件夹「Active Commercial Property Claims」输入一段索赔审查提示,生成文件 Claim Reconciliation Review Merewick Coastal Foods ASC-26-0184.md。备忘录写明具名风暴免赔额少计 USD 143,000、发票 RCS-26118 的 USD 82,000 在建筑险与营业用动产中重复、供应商贷项通知单 CM-66204 的 USD 64,000 未从食品库存中扣除,并写明营业中断的 72 小时等待期不适用于额外费用。备忘录把最终承保和付款决定留给理赔员与承保律师。OpenRouter 上的 Grok 4.7 API 接入配置OpenRouter 模型页把 x-ai/grok-4.7 标成 SpaceXAI 的 Grok 4.7,列出的输入 / 输出价格是每百万 token $1.60 / $4.80,并给出了 OpenRouter SDK 与 cURL 的调用示例;请求体里的推理档位字段和 Low、Medium、High 各档标价在本次采集中未读到。xAI 官方文档:Grok 4.7 API 参数与推理档位公开 xAI API 的模型名是 grok-4.7;文档列出的推理档位为 Low、medium、high(默认)或 xhigh,输入价 $2.00 / 1M tokens,输出价 $6.00 / 1M tokens。Grok 4.7 Fast 被写成同一模型的更快部署,按标准 token 价格的两倍计费,并且只出现在 Cursor 与 Grok Build。