Grok 4.6

Grok 4.6 · 测评与证据

Grok 4.6,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

这条证据围绕“Grok 4.6 官方发布:基准与能力评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。

xAI 官方 News · 查看证据

这条证据围绕“Artificial Analysis:Grok 4.6 的智能与成本评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。

Artificial Analysis · 查看证据

这条证据围绕“BenchLM:Grok 4.6 的公开成绩、速度与成本”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。

BenchLM.ai · 查看证据

完整测评与相关内容

模型深度阅读

总览 · 简体中文

Grok 4.6:更新了什么、成本如何、适合谁

从 500K 上下文、基准版本差异到 API 价格,帮助你判断 Grok 4.6 是否值得试用。

精选证据

官方厂商自报

Grok 4.6 官方发布:基准与能力评测

这条证据围绕“Grok 4.6 官方发布:基准与能力评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。

来源xAI 官方 News
原文日期2026-08-12
采集2026-08-17

待验证:本次未能重新核实原文。

测试条件
xAI 发布表把 Grok 4.6 定位为长任务 Agent、编码、知识工作和交互式项目;竞品分数来自各自 system card/榜单,Terminal-Bench 版本、推理档位与 harness 不统一。
来源边界
支持引用厂商公布的定位和带条件基准表,并明确软件工程与知识工作分布差异。
不能支持
不支持独立复测、统一横向排名、当前可用性或生产性能保证。
Agent
媒体 / 基准方独立测量

Artificial Analysis:Grok 4.6 的智能与成本评测

这条证据围绕“Artificial Analysis:Grok 4.6 的智能与成本评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。

来源Artificial Analysis
原文日期2026-08-12
采集2026-08-17

待验证:本次未能重新核实原文。

测试条件
Artificial Analysis 记录 Intelligence Index 61、Terminal-Bench v2.1 88.4% 与约 $0.84/任务;该快照的完整样本、推理档位和私有 AA-Briefcase harness 未公开。
来源边界
支持在同一 AA 快照中讨论智能/成本方向;不支持把 v2.1 与 xAI v3.0 或其他 harness 分数直接合并。
不能支持
不支持当前价格、Tabbit 可用性、普遍成功率或生产安全保证。
Agent
媒体 / 基准方独立测量

BenchLM:Grok 4.6 的公开成绩、速度与成本

这条证据围绕“BenchLM:Grok 4.6 的公开成绩、速度与成本”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。

来源BenchLM.ai
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

测试条件
BenchLM 快照记录综合分 63.4/100、约 66 tokens/s、首 token 约 32.3 秒;Reasoning、Knowledge、Math 等类别证据不足。
来源边界
支持在该页面的证据覆盖范围内阅读速度、首 token 与综合分;可用于提出复测问题。
不能支持
不支持把综合分当作完整能力画像,也不支持跨时间价格或未测类别的结论。
Agent
社区个人体验

Reddit r/cursor:Grok 4.6 与 GPT-5.6 Sol 的同任务对比

这条证据围绕“Reddit r/cursor:Grok 4.6 与 GPT-5.6 Sol 的同任务对比”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。

来源Reddit r/cursor
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

测试条件
Cursor 中以 Grok 4.6 Extra High 与 GPT-5.6 Sol Medium 执行同一后端方案,约 2,500 行代码;由 Fable 5 High 做独立评审,任务数为单个。
来源边界
支持一个相同起点的工程案例:成本、上下文污染和复杂逻辑边界值得继续检查。
不能支持
不支持模型总体排名、统计成功率或跨 Cursor/Codex harness 的结论;订阅额度也不等于 API 成本。
能力

全部来源

全部来源

15 / 15
官方厂商自报

Grok 4.6 官方发布:基准与能力评测

这条证据围绕“Grok 4.6 官方发布:基准与能力评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。

来源xAI 官方 News
原文日期2026-08-12
采集2026-08-17

待验证:本次未能重新核实原文。

测试条件
xAI 发布表把 Grok 4.6 定位为长任务 Agent、编码、知识工作和交互式项目;竞品分数来自各自 system card/榜单,Terminal-Bench 版本、推理档位与 harness 不统一。
来源边界
支持引用厂商公布的定位和带条件基准表,并明确软件工程与知识工作分布差异。
不能支持
不支持独立复测、统一横向排名、当前可用性或生产性能保证。
Agent
媒体 / 基准方独立测量

Artificial Analysis:Grok 4.6 的智能与成本评测

这条证据围绕“Artificial Analysis:Grok 4.6 的智能与成本评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。

来源Artificial Analysis
原文日期2026-08-12
采集2026-08-17

待验证:本次未能重新核实原文。

测试条件
Artificial Analysis 记录 Intelligence Index 61、Terminal-Bench v2.1 88.4% 与约 $0.84/任务;该快照的完整样本、推理档位和私有 AA-Briefcase harness 未公开。
来源边界
支持在同一 AA 快照中讨论智能/成本方向;不支持把 v2.1 与 xAI v3.0 或其他 harness 分数直接合并。
不能支持
不支持当前价格、Tabbit 可用性、普遍成功率或生产安全保证。
Agent
媒体 / 基准方独立测量

BenchLM:Grok 4.6 的公开成绩、速度与成本

这条证据围绕“BenchLM:Grok 4.6 的公开成绩、速度与成本”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。

来源BenchLM.ai
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

测试条件
BenchLM 快照记录综合分 63.4/100、约 66 tokens/s、首 token 约 32.3 秒;Reasoning、Knowledge、Math 等类别证据不足。
来源边界
支持在该页面的证据覆盖范围内阅读速度、首 token 与综合分;可用于提出复测问题。
不能支持
不支持把综合分当作完整能力画像,也不支持跨时间价格或未测类别的结论。
Agent
社区个人体验

Reddit r/cursor:Grok 4.6 与 GPT-5.6 Sol 的同任务对比

这条证据围绕“Reddit r/cursor:Grok 4.6 与 GPT-5.6 Sol 的同任务对比”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。

来源Reddit r/cursor
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

测试条件
Cursor 中以 Grok 4.6 Extra High 与 GPT-5.6 Sol Medium 执行同一后端方案,约 2,500 行代码;由 Fable 5 High 做独立评审,任务数为单个。
来源边界
支持一个相同起点的工程案例:成本、上下文污染和复杂逻辑边界值得继续检查。
不能支持
不支持模型总体排名、统计成功率或跨 Cursor/Codex harness 的结论;订阅额度也不等于 API 成本。
能力
媒体 / 基准方编辑分析

Emergent:Grok 4.6 的评测结果拆解

Emergent 认为,Grok 4.6 的公开成绩呈现出明显的能力分布:知识工作评测强,纯软件工程评测相对弱。它的 Intelligence Index 为 61,与 GPT-5.6 Sol 持平;但在 DeepSWE v1.1 和 Terminal-Bench v3.0 上分别落后 GPT-5.6 Sol 7.1 和 8.6 个百分点。

来源Emergent Learn
原文日期2026-08-13
采集2026-08-17

待验证:本次未能重新核实原文。

模型与版本
Grok 4.6;来源标题为“Emergent:Grok 4.6 的评测结果拆解”,不与其他版本或推理档位混并。
任务与 harness
Emergent 认为,Grok 4.6 的公开成绩呈现出明显的能力分布:知识工作评测强,纯软件工程评测相对弱。它的 Intelligence Index 为 61,与 GPT-5.6 Sol 持平;但在 DeepSWE v1.1 和 Terminal-Bench v3.0 上分别落后 GPT-5.6 Sol 7.1 和 8.6 个百分点。 完整任务集、运行参数与复测流程未完全公开。
样本与日期
来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
能力
媒体 / 基准方编辑分析

KIE:Grok 4.6 发布评测与能力拆解

KIE 将 Grok 4.6 的 Intelligence Index 概括为 61,与 GPT-5.6 Sol 持平;价格为输入 $2、输出 $6 / 1M tokens。文章认为它的主要卖点是价格-智能比,而不是在所有单项评测上都领先。

来源KIE.ai Blog
原文日期2026-08-13
采集2026-08-17

待验证:本次未能重新核实原文。

模型与版本
Grok 4.6;来源标题为“KIE:Grok 4.6 发布评测与能力拆解”,不与其他版本或推理档位混并。
任务与 harness
KIE 将 Grok 4.6 的 Intelligence Index 概括为 61,与 GPT-5.6 Sol 持平;价格为输入 $2、输出 $6 / 1M tokens。文章认为它的主要卖点是价格-智能比,而不是在所有单项评测上都领先。 完整任务集、运行参数与复测流程未完全公开。
样本与日期
来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
能力
媒体 / 基准方编辑分析

Medium 逐行解读:Grok 4.6 与 Sol、Fable 的对比

作者基于 xAI 发布的十行评测表做了逐项计数:在与 GPT-5.6 Sol Max 共同有成绩的 9 行中,Grok 4.6 赢 6 行,只输 DeepSWE v1.1 和 Terminal-Bench v3.0;对 Fable 5 Max 的十行比较中,Grok 赢 3 行、输 7 行。

来源Medium / Data Science Collective
原文日期2026-08-13
采集2026-08-17

待验证:本次未能重新核实原文。

模型与版本
Grok 4.6;来源标题为“Medium 逐行解读:Grok 4.6 与 Sol、Fable 的对比”,不与其他版本或推理档位混并。
任务与 harness
作者基于 xAI 发布的十行评测表做了逐项计数:在与 GPT-5.6 Sol Max 共同有成绩的 9 行中,Grok 4.6 赢 6 行,只输 DeepSWE v1.1 和 Terminal-Bench v3.0;对 Fable 5 Max 的十行比较中,Grok 赢 3 行、输 7 行。 完整任务集、运行参数与复测流程未完全公开。
样本与日期
来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
能力
社区个人体验

Reddit r/cursor:社区对 Grok 4.6 榜单与体验差异的讨论

一部分用户认为 Grok 4.6 相比 4.5 的升级符合榜单趋势,尤其是在 Agentic 和编码任务上;另一部分用户认为过去 Grok 4.5 的公开分数与实际体验并不匹配,因此不愿仅凭 Intelligence Index 推断能力。

来源Reddit r/cursor
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

模型与版本
Grok 4.6;来源标题为“Reddit r/cursor:社区对 Grok 4.6 榜单与体验差异的讨论”,不与其他版本或推理档位混并。
任务与 harness
一部分用户认为 Grok 4.6 相比 4.5 的升级符合榜单趋势,尤其是在 Agentic 和编码任务上;另一部分用户认为过去 Grok 4.5 的公开分数与实际体验并不匹配,因此不愿仅凭 Intelligence Index 推断能力。 完整任务集、运行参数与复测流程未完全公开。
样本与日期
来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
Agent
社区个人体验

Reddit r/cursor:Grok 4.6 的非幻觉率与拒答校准

帖子引用 Artificial Analysis 的 AA-Omniscience Non-Hallucination Rate: GPT-5.6 Terra:12.1% 该指标描述的是:在模型不知道答案的情况下,它选择承认不确定而不是编造答案的比例。帖子同时提醒,Grok 4.6 的准确率仍需一起看,不能只用拒答率评价模型。

来源Reddit r/cursor
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

模型与版本
Grok 4.6;来源标题为“Reddit r/cursor:Grok 4.6 的非幻觉率与拒答校准”,不与其他版本或推理档位混并。
任务与 harness
帖子引用 Artificial Analysis 的 AA-Omniscience Non-Hallucination Rate: GPT-5.6 Terra:12.1% 该指标描述的是:在模型不知道答案的情况下,它选择承认不确定而不是编造答案的比例。帖子同时提醒,Grok 4.6 的准确率仍需一起看,不能只用拒答率评价模型。 完整任务集、运行参数与复测流程未完全公开。
样本与日期
来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
能力
社区个人体验

Reddit r/opencodeCLI:Grok 4.6 的 DeepSWE 与 Terminal-Bench 讨论

评论区引用了 Grok 4.6 在 DeepSWE v1.1 上的 65.9%,并指出它高于 DeepSeek V4 Pro 0813 的 62.7%。这说明 Grok 4.6 相比 Grok 4.5 的 54% 有明显进步,但仍低于 GPT-5.6 Sol Max 的 73%。

来源Reddit r/opencodeCLI
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

模型与版本
Grok 4.6;来源标题为“Reddit r/opencodeCLI:Grok 4.6 的 DeepSWE 与 Terminal-Bench 讨论”,不与其他版本或推理档位混并。
任务与 harness
评论区引用了 Grok 4.6 在 DeepSWE v1.1 上的 65.9%,并指出它高于 DeepSeek V4 Pro 0813 的 62.7%。这说明 Grok 4.6 相比 Grok 4.5 的 54% 有明显进步,但仍低于 GPT-5.6 Sol Max 的 73%。 完整任务集、运行参数与复测流程未完全公开。
样本与日期
来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
编程
社区个人体验

Reddit r/singularity:Grok 4.6 基准与真实编码反馈

这个帖子主要围绕 xAI/Artificial Analysis 的成绩单讨论真实使用感受。高互动评论认为 Grok 4.6 在编码上“便宜且快”,并分享了一个 Opus 负责规划、Grok 负责具体小范围修改的工作流。

来源Reddit r/singularity
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

模型与版本
Grok 4.6;来源标题为“Reddit r/singularity:Grok 4.6 基准与真实编码反馈”,不与其他版本或推理档位混并。
任务与 harness
这个帖子主要围绕 xAI/Artificial Analysis 的成绩单讨论真实使用感受。高互动评论认为 Grok 4.6 在编码上“便宜且快”,并分享了一个 Opus 负责规划、Grok 负责具体小范围修改的工作流。 完整任务集、运行参数与复测流程未完全公开。
样本与日期
来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
能力
社区个人体验

X / TypingMind:同一剪纸动画提示下的 Grok 4.6 对比

TypingMind 表示,它把同一个“传统中国剪纸风格动画”提示词分别交给 Grok 4.6、GPT-5.6 Sol、Claude Opus 5 和 Qwen 3.8 Max,用于比较生成结果。推文附带视频,并在后续回复中提供了完整提示词和模型对比链接:https://cloud.typingmind.com/share/0bc76cfe-c0a3-4144-a042-eee5d845ac63。

来源X
原文日期2026-08-13
采集2026-08-17

待验证:本次未能重新核实原文。

模型与版本
Grok 4.6;来源标题为“X / TypingMind:同一剪纸动画提示下的 Grok 4.6 对比”,不与其他版本或推理档位混并。
任务与 harness
TypingMind 表示,它把同一个“传统中国剪纸风格动画”提示词分别交给 Grok 4.6、GPT-5.6 Sol、Claude Opus 5 和 Qwen 3.8 Max,用于比较生成结果。推文附带视频,并在后续回复中提供了完整提示词和模型对比链接:https://cloud.typingmind.com/share/0bc76cfe-c0a3-4144-a042-eee5d845ac63。 完整任务集、运行参数与复测流程未完全公开。
样本与日期
来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
能力
社区个人体验

X:Grok 4.6 与 Opus 5 的同提示成本速度对比

作者表示用同一提示测试 Grok 4.6 和 Opus 5: Grok 4.6:约 $1.74,约 5 分钟完成。 Opus 5:约 9 分钟,消耗其每日用量的 17%。 作者在结论中问读者哪个模型赢了;评论区意见并不一致,有人认为 Opus 5 质量更好,也有人认为 Grok 的速度和价格优势足以改变选择。

来源X
原文日期2026-08-13
采集2026-08-17

待验证:本次未能重新核实原文。

模型与版本
Grok 4.6;来源标题为“X:Grok 4.6 与 Opus 5 的同提示成本速度对比”,不与其他版本或推理档位混并。
任务与 harness
作者表示用同一提示测试 Grok 4.6 和 Opus 5: Grok 4.6:约 $1.74,约 5 分钟完成。 Opus 5:约 9 分钟,消耗其每日用量的 17%。 作者在结论中问读者哪个模型赢了;评论区意见并不一致,有人认为 Opus 5 质量更好,也有人认为 Grok 的速度和价格优势足以改变选择。 完整任务集、运行参数与复测流程未完全公开。
样本与日期
来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
能力
社区个人体验

X:Matthew Berman 的个人资料卡片同提示对比

作者给 Grok 4.6、GPT-5.6 Sol 和 Fable 5 相同提示,让它们为一名创作者生成社交应用个人资料卡片,并比较结果。 原始提示要求在固定的 500×500 像素方形框架内,设计并构建一张包含肖像、姓名、简介、粉丝信息和关注按钮的个人资料卡;视觉设计、详细内容由模型自行决定。

来源X
原文日期2026-08-13
采集2026-08-17

待验证:本次未能重新核实原文。

模型与版本
Grok 4.6;来源标题为“X:Matthew Berman 的个人资料卡片同提示对比”,不与其他版本或推理档位混并。
任务与 harness
作者给 Grok 4.6、GPT-5.6 Sol 和 Fable 5 相同提示,让它们为一名创作者生成社交应用个人资料卡片,并比较结果。 原始提示要求在固定的 500×500 像素方形框架内,设计并构建一张包含肖像、姓名、简介、粉丝信息和关注按钮的个人资料卡;视觉设计、详细内容由模型自行决定。 完整任务集、运行参数与复测流程未完全公开。
样本与日期
来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
能力
社区个人体验

X:Mike P 的 Grok 4.6 与 Opus 5 健身报告长数据任务对比

作者使用 2019 年至今的 Garmin 完整数据和 Apple Health 数据,让模型生成一份涵盖所有运动项目的健身报告,重点分析骑行经历,追踪长期指标、进步和图表,并允许模型自行决定报告的视觉形式。 作者先前比较过 Grok 4.5 和 Opus 5;这次清理上下文后,用完全相同的提示在 Grok Build 中重新运行 Grok 4.6。

来源X 文章
原文日期2026-08-13
采集2026-08-17

待验证:本次未能重新核实原文。

模型与版本
Grok 4.6;来源标题为“X:Mike P 的 Grok 4.6 与 Opus 5 健身报告长数据任务对比”,不与其他版本或推理档位混并。
任务与 harness
作者使用 2019 年至今的 Garmin 完整数据和 Apple Health 数据,让模型生成一份涵盖所有运动项目的健身报告,重点分析骑行经历,追踪长期指标、进步和图表,并允许模型自行决定报告的视觉形式。 作者先前比较过 Grok 4.5 和 Opus 5;这次清理上下文后,用完全相同的提示在 Grok Build 中重新运行 Grok 4.6。 完整任务集、运行参数与复测流程未完全公开。
样本与日期
来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
编程

Grok 4.6

在 Tabbit 中比较 Grok 4.6

客户端中的模型、功能和权限以当前账户为准。