Grok 4.7 · 社区来源 · 独立测量
在这条帖附带的 AA-Briefcase Elo 图上,Grok 4.7(xhigh)为 1657,位于 Claude Fable 5.1(max with fallback,1678)和 Claude Opus 5(max,1673)之后。帖文正文另称它在该基准上仅落后于 Anthropic 模型、紧跟 Opus 5,且每任务成本约为后者的一半;AA-Briefcase-Lite 上,分析质量 Elo 从 Grok 4.6 的 1698 升到 1994,演示 Elo 从 1531 降到 1499。
在这条帖附带的 AA-Briefcase Elo 图上,Grok 4.7(xhigh)为 1657,位于 Claude Fable 5.1(max with fallback,1678)和 Claude Opus 5(max,1673)之后。帖文正文另称它在该基准上仅落后于 Anthropic 模型、紧跟 Opus 5,且每任务成本约为后者的一半;AA-Briefcase-Lite 上,分析质量 Elo 从 Grok 4.6 的 1698 升到 1994,演示 Elo 从 1531 降到 1499。
适合判断的任务:Artificial Analysis 定义的代理式知识工作,以及帖文点名的公开尽职调查场景:搭建市场模型并做目标评估演示稿。
不适合外推的任务:编码、多模态、通用对话,以及任何未出现在这张图或这段正文里的基准。图上的综合 Elo 不能换成其他 harness 的分数。
适用的模型版本:正文与图轴写的是 Grok 4.7;对照条是 Grok 4.6。更细的检查点、API 模型 ID 未注明。
测试环境或客户端:图注写明 AA-Briefcase v1.1,由 Artificial Analysis 开发。具体 API 供应商、客户端和运行日期未注明。
推理档位和参数:图上 Grok 4.7 与 Grok 4.6 均为 xhigh。示例幻灯片的 API 成本也标明 xhigh。其他档位未注明。
帖文第一张图的图注写明:AA-Briefcase v1.1 是 Artificial Analysis 开发的代理式知识工作基准;AA-Briefcase Elo 是综合指标,汇总评分量表通过率、分析质量 Elo 和演示 Elo,越高越好。各柱上方有误差线,但线端数值在本次截图里没有逐条读出。
正文把 Grok 4.7 相对 Grok 4.6 的变化放在 AA-Briefcase-Lite:作者称为公开尽职调查场景,任务是搭建市场模型并制作目标评估演示稿。样本量、提示词、评审模型和运行次数未注明。
同一永久链接下还有作者自己的两条后续帖,只比较演示稿写法,没有再给出 Elo。
这条永久链接的可见正文和链接里没有 artificialanalysis.ai 文章地址。下列数字只来自帖文英文原文和第一张图。
英文原文(点击「显示原文」后的正文):
Grok 4.7 is behind only Anthropic models on AA-Briefcase, ranking just behind Opus 5 at ~50% of its Cost per Task Grok 4… 以上为必要节选,完整内容请查看原文。
与图对照:
综合 AA-Briefcase Elo:Grok 4.7(xhigh)1657,Grok 4.6(xhigh)1555。图上箭头从 1657 指向 1555。
1657 上面的两条都是 Anthropic 模型:Claude Fable 5.1(max with fallback)1678,Claude Opus 5(max)1673。再下一条是 Claude Opus 5(xhigh)1649。这与正文「只落后于 Anthropic 模型、紧跟 Opus 5」一致;第一名在图上是 Fable 5.1,不是 Opus 5。
每任务成本「约为 Opus 5 的约 50%」只出现在正文,这张 Elo 图没有成本轴,也没有给出 Opus 5 的每任务美元数。
1698 → 1994 与 1531 → 1499 是正文中的 AA-Briefcase-Lite 分析质量 Elo 和演示 Elo,不是图上的综合 Elo。1657 不能与 1994 直接相减。
生成示例演示稿的 API 成本:Grok 4.7(xhigh)约 8 美元,Grok 4.6(xhigh)约 4.40 美元。这是示例稿成本,不是上面的「每任务成本」。
图中从左到右、本次能对齐的柱值与轴标签:
| 顺序 | 轴上可见标签 | AA-Briefcase Elo |
|---|---|---|
| 1 | Claude Fable 5.1 (max with fallback) | 1678 |
| 2 | Claude Opus 5 (max) | 1673 |
| 3 | Grok 4.7 (xhigh) | 1657 |
| 4 | Claude Opus 5 (xhigh) | 1649 |
| 5 | Qwen3.8 Max (0902) | 1640 |
| 6 | Muse Spark 1.3 (max) | 1597 |
| 7 | Qwen3.8-Flash-Next | 1597 |
| 8 | Claude Fable 5.1 (high with fallback) | 1592 |
| 9 | GPT-6 Astra (max) | 1569 |
| 10 | Grok 4.6 (xhigh) | 1555 |
| 11 | GLM-5.3 (max) | 1525 |
| 12 | Kimi K3 (max) | 1510 |
| 13 | GPT-5.6 Sol (max) | 1487 |
| 14 | GLM-5.3-Flash | 1459 |
| 15 | Step 5 Preview | 1432 |
| 16 | DeepSeek V4.1 Flash (max) | 1432 |
| 17 | Qwen3.8 27B (xhigh) | 1403 |
| 18 | GPT-5.6 Luna (max) | 1345 |
| 19 | GPT-5.6 Terra (max) | 1336 |
| 20 | K2 Horizon … A23B | 1303 |
| 21 | DeepSeek V4 Pro 0813 (max) | 1261 |
| 22 | Gemini 3.8 Flash (high) | 1202 |
第 14、15 条的括号档位在轴上没有读清。第 20 条能读出 K2 Horizon 和 A23B;中间的参数规模数字在不同裁切下不稳定,不记具体 B 数。误差线可见,线端数值未记。
同页作者后续帖(不是另一套分数):
https://x.com/ArtificialAnlys/status/2102170395130708064:Example 1。任务是私募股权演示模板中的可比基准分析,并带逐步估值链。Grok 4.6 做简短分析并落在交易合伙人的简略估计上;Grok 4.7 独立跑估值链并标出差异。附有幻灯片截图,表内单元格未逐格抄录。
https://x.com/ArtificialAnlys/status/2102170398339313801:Example 2。任务是覆盖规模和财务的资产简介。Grok 4.6 只用最新一年,没有收入趋势或货币讨论;Grok 4.7 看完三年历史,并得出增长被货币贬值抵消、从而影响购买决定。附有幻灯片截图,表内单元格未逐格抄录。
这条帖给出的是 Artificial Analysis 自己的 AA-Briefcase v1.1 综合 Elo 快照,加上一段 AA-Briefcase-Lite 的分项 Elo 和示例稿 API 成本。Grok 4.7(xhigh)在可见柱序里排第三,高于同图的 Grok 4.6(xhigh,1555),也高于图上的 GPT-6 Astra(max,1569)。
不能据此说 Grok 4.7 在所有任务上接近 Opus 5。每任务成本约为一半没有配上美元单价或任务定义。分析质量上升和演示 Elo 小幅下降发生在 Lite 场景,而且演示稿 API 成本从约 4.40 美元增到约 8 美元。示例帖只说明两份尽职调查幻灯片的写法差异。
2026-09-22 打开上述永久链接,点击「显示原文」后抄录英文正文,并放大第一张图的柱值与轴标签。页面可直接阅读,没有遇到登录墙或验证码。帖文没有写出题目数量、提示词、评审脚本或原始运行记录,因此不能只靠这条帖重跑 1657。同页回复里的幻灯片截图只作定性示例,不把未读清的表内数字写入本文。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
X · Artificial Analysis(@ArtificialAnlys) · 原文发布日期 2026-09-22 · 本站编辑日期 2026-09-22
打开原始来源Grok 4.7
下载 Tabbit 客户端后检查模型可用性