Grok 4.6 · 媒体来源 · 独立测量
这条证据围绕“BenchLM:Grok 4.6 的公开成绩、速度与成本”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
BenchLM 综合公开分:63.4 / 100。
公共榜单排名:#43 / 218。
Agentic 类别:#7 / 130。
Coding 类别:#18 / 135。
公开证据行:42 条;其中 Agentic 4/4、Coding 12/12 标记为已验证。
速度:约 66 tokens/s,首 token 约 32.3 秒。
上下文:500K tokens。
价格:输入 $2、输出 $6、缓存输入 $0.50 / 1M tokens。
页面列出的 Coding 结果包括 DeepSWE 65.9%、CursorBench 3.2 70.8%、FrontierCode 1.1 Extended 61.3%。其中 DeepSWE 的最佳对照为 GPT-5.6 Sol 的 72.7%,而 CursorBench 3.2 页面将 Grok 4.6 标为当前已验证最佳值。
BenchLM 的价值在于把模型分数与价格、速度、上下文和证据覆盖放在同一页面。它同时明确提示:Grok 4.6 的 Reasoning、Knowledge、Math 等类别目前没有足够数据,不应把综合分理解成所有能力的完整画像。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
BenchLM.ai · 作者未公开 · 原文发布日期 Unknown · 本站编辑日期 2026-09-20
打开原始来源Grok 4.6
下载 Tabbit 客户端后检查模型可用性