BenchLM 综合公开分:63.4 / 100。
公共榜单排名:#43 / 218。
Agentic 类别:#7 / 130。
Coding 类别:#18 / 135。
公开证据行:42 条;其中 Agentic 4/4、Coding 12/12 标记为已验证。
速度:约 66 tokens/s,首 token 约 32.3 秒。
上下文:500K tokens。
价格:输入 $2、输出 $6、缓存输入 $0.50 / 1M tokens。
页面列出的 Coding 结果包括 DeepSWE 65.9%、CursorBench 3.2 70.8%、FrontierCode 1.1 Extended 61.3%。其中 DeepSWE 的最佳对照为 GPT-5.6 Sol 的 72.7%,而 CursorBench 3.2 页面将 Grok 4.6 标为当前已验证最佳值。
BenchLM 的价值在于把模型分数与价格、速度、上下文和证据覆盖放在同一页面。它同时明确提示:Grok 4.6 的 Reasoning、Knowledge、Math 等类别目前没有足够数据,不应把综合分理解成所有能力的完整画像。
Grok 4.6