Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Grok 4.6 · 官方来源 · 厂商自报

Grok 4.6 官方发布:基准与能力评测

这条证据围绕“Grok 4.6 官方发布:基准与能力评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

官方来源厂商自报编辑日期 2026-09-20

测试条件速查

测试条件
xAI 发布表把 Grok 4.6 定位为长任务 Agent、编码、知识工作和交互式项目;竞品分数来自各自 system card/榜单,Terminal-Bench 版本、推理档位与 harness 不统一。
来源边界
支持引用厂商公布的定位和带条件基准表,并明确软件工程与知识工作分布差异。
不能支持
不支持独立复测、统一横向排名、当前可用性或生产性能保证。

关键数据与适用场景

结论速览

Grok 4.6 的定位是长任务 Agent、编码、知识工作和交互式/视觉项目。官方称其在 Artificial Analysis Intelligence Index 上与 GPT-5.6 Sol 持平,综合分 61;但官方表格同时显示,它在知识工作类评测更强,在 DeepSWE、Terminal-Bench 等软件工程评测上落后于 GPT-5.6 Sol Max。

官方评测表

评测Grok 4.6 HighGrok 4.5 HighGPT-5.6 Sol MaxFable 5 Max
AA Intelligence Index61566162
GDPVal-AA v21753152617281741
CursorBench v3.269.9%66.7%67.2%70.5%
DeepSWE v1.165.9%54%73%70%
FrontierCode v1.1(Extended)61.3%56.6%60.6%63.6%
APEX-Agents57.5%47.1%56.7%59.2%
Terminal-Bench v3.026%15.7%34.6%34.1%
APEX-SWE56.4%53.6%—58.8%
AA-Briefcase1577131315021574
Harvey LAB(Vals)15.8%12.9%2.5%11.3%

官方强调的能力

  • 长任务中保持上下文,在研究、代码库操作和应用构建之间持续推进。

  • 在 GDPVal-AA v2、AA-Briefcase 和 Harvey LAB 等知识工作/法律工作评测中表现突出。

  • 训练覆盖通用编码、知识工作、内核优化、Web 开发和 CAD 等 Agent 环境。

  • 官方称长轨迹中出现更多自测和验证行为。

价格与规格

  • 上下文窗口:500,000 tokens

  • 输入价格:$2 / 1M tokens

  • 输出价格:$6 / 1M tokens

  • 可用渠道:Cursor、Grok Build、API、OpenRouter、Vercel、Cloudflare 等

阅读时的限制

官方注明,竞品分数来自各自开发者发布的 system card 或公开榜单,不是同一实验环境下的四模型重跑。因此,表格适合做方向判断,不应当视为严格的横向实验结论。尤其是 Terminal-Bench 的版本、推理档位和运行 harness 都会影响结果。

能支持的判断

  • 支持引用厂商公布的定位和带条件基准表,并明确软件工程与知识工作分布差异。

不能支持的判断

  • 不支持独立复测、统一横向排名、当前可用性或生产性能保证。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

xAI 官方 News · 作者未公开 · 原文发布日期 2026-08-12 · 本站编辑日期 2026-09-20

打开原始来源

Grok 4.6

在 Tabbit 中比较 Grok 4.6

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Grok 4.6:更新了什么、成本如何、适合谁

从 500K 上下文、基准版本差异到 API 价格,帮助你判断 Grok 4.6 是否值得试用。

模型对比 · 简体中文

Grok 4.7 对比 Grok 4.6:单价没变,账单会变长

Grok 4.7 与 Grok 4.6 的 API 标价同为每百万 token 输入 $2、输出 $6,上下文都是 50 万。xhigh 下智能指数题输出约 8.1 万 token,4.6 约 3.6 万。

相关评测

Artificial Analysis:Grok 4.6 的智能与成本评测这条证据围绕“Artificial Analysis:Grok 4.6 的智能与成本评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。BenchLM:Grok 4.6 的公开成绩、速度与成本这条证据围绕“BenchLM:Grok 4.6 的公开成绩、速度与成本”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。Reddit r/cursor:社区对 Grok 4.6 榜单与体验差异的讨论一部分用户认为 Grok 4.6 相比 4.5 的升级符合榜单趋势,尤其是在 Agentic 和编码任务上;另一部分用户认为过去 Grok 4.5 的公开分数与实际体验并不匹配,因此不愿仅凭 Intelligence Index 推断能力。Reddit r/cursor:Grok 4.6 与 GPT-5.6 Sol 的同任务对比这条证据围绕“Reddit r/cursor:Grok 4.6 与 GPT-5.6 Sol 的同任务对比”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。Reddit r/LoveGrok:项目指令与正向约束实践有用户建议把自定义指令放到 Project instructions,而不是普通设置,因为项目指令的权重和上下文更适合长期写作。 社区反馈认为,单纯堆叠“不要做什么”的负向指令容易失效;应同时说明希望模型采取的正向行为。 长对话可能出现重复和模板化,必要时应重新开始会话。X:Nikolai Yakovenko 讨论单提示可玩游戏范式作者认为,用“一句话提示”制作可玩的游戏已经成为新模型或新 Agent harness 发布时的常见测试标准。评论区展示了一个 Grok 4.6 生成的模拟《梦幻之星 1》并由 AI Agent 操作的案例。 作者同时提醒,游戏生成案例可能存在对特定展示范式过拟合;写作风格和清晰度并不会因为游戏生成能力提升而自动改善。Venice:Grok 4.6 四条提示技巧与模板把“Venice:Grok 4.6 四条提示技巧与模板”整理为可执行的任务入口,明确输入、运行环境、交付格式和验收边界;原始来源与模型状态仍需在使用前复核。X:Matthew Berman 的创作者个人资料卡片提示把“X:Matthew Berman 的创作者个人资料卡片提示”整理为可执行的任务入口,明确输入、运行环境、交付格式和验收边界;原始来源与模型状态仍需在使用前复核。