这条证据围绕“Grok 4.6 官方发布:基准与能力评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
xAI 官方 News · 查看证据Grok 4.6 · 测评与证据
Grok 4.6,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
这条证据围绕“Artificial Analysis:Grok 4.6 的智能与成本评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
Artificial Analysis · 查看证据这条证据围绕“BenchLM:Grok 4.6 的公开成绩、速度与成本”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
BenchLM.ai · 查看证据完整测评与相关内容
精选证据
Grok 4.6 官方发布:基准与能力评测
这条证据围绕“Grok 4.6 官方发布:基准与能力评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。
- 测试条件
- xAI 发布表把 Grok 4.6 定位为长任务 Agent、编码、知识工作和交互式项目;竞品分数来自各自 system card/榜单,Terminal-Bench 版本、推理档位与 harness 不统一。
- 来源边界
- 支持引用厂商公布的定位和带条件基准表,并明确软件工程与知识工作分布差异。
- 不能支持
- 不支持独立复测、统一横向排名、当前可用性或生产性能保证。
Artificial Analysis:Grok 4.6 的智能与成本评测
这条证据围绕“Artificial Analysis:Grok 4.6 的智能与成本评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。
- 测试条件
- Artificial Analysis 记录 Intelligence Index 61、Terminal-Bench v2.1 88.4% 与约 $0.84/任务;该快照的完整样本、推理档位和私有 AA-Briefcase harness 未公开。
- 来源边界
- 支持在同一 AA 快照中讨论智能/成本方向;不支持把 v2.1 与 xAI v3.0 或其他 harness 分数直接合并。
- 不能支持
- 不支持当前价格、Tabbit 可用性、普遍成功率或生产安全保证。
BenchLM:Grok 4.6 的公开成绩、速度与成本
这条证据围绕“BenchLM:Grok 4.6 的公开成绩、速度与成本”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。
- 测试条件
- BenchLM 快照记录综合分 63.4/100、约 66 tokens/s、首 token 约 32.3 秒;Reasoning、Knowledge、Math 等类别证据不足。
- 来源边界
- 支持在该页面的证据覆盖范围内阅读速度、首 token 与综合分;可用于提出复测问题。
- 不能支持
- 不支持把综合分当作完整能力画像,也不支持跨时间价格或未测类别的结论。
Reddit r/cursor:Grok 4.6 与 GPT-5.6 Sol 的同任务对比
这条证据围绕“Reddit r/cursor:Grok 4.6 与 GPT-5.6 Sol 的同任务对比”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。
- 测试条件
- Cursor 中以 Grok 4.6 Extra High 与 GPT-5.6 Sol Medium 执行同一后端方案,约 2,500 行代码;由 Fable 5 High 做独立评审,任务数为单个。
- 来源边界
- 支持一个相同起点的工程案例:成本、上下文污染和复杂逻辑边界值得继续检查。
- 不能支持
- 不支持模型总体排名、统计成功率或跨 Cursor/Codex harness 的结论;订阅额度也不等于 API 成本。
全部来源
全部来源
Grok 4.6 官方发布:基准与能力评测
这条证据围绕“Grok 4.6 官方发布:基准与能力评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。
- 测试条件
- xAI 发布表把 Grok 4.6 定位为长任务 Agent、编码、知识工作和交互式项目;竞品分数来自各自 system card/榜单,Terminal-Bench 版本、推理档位与 harness 不统一。
- 来源边界
- 支持引用厂商公布的定位和带条件基准表,并明确软件工程与知识工作分布差异。
- 不能支持
- 不支持独立复测、统一横向排名、当前可用性或生产性能保证。
Artificial Analysis:Grok 4.6 的智能与成本评测
这条证据围绕“Artificial Analysis:Grok 4.6 的智能与成本评测”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。
- 测试条件
- Artificial Analysis 记录 Intelligence Index 61、Terminal-Bench v2.1 88.4% 与约 $0.84/任务;该快照的完整样本、推理档位和私有 AA-Briefcase harness 未公开。
- 来源边界
- 支持在同一 AA 快照中讨论智能/成本方向;不支持把 v2.1 与 xAI v3.0 或其他 harness 分数直接合并。
- 不能支持
- 不支持当前价格、Tabbit 可用性、普遍成功率或生产安全保证。
BenchLM:Grok 4.6 的公开成绩、速度与成本
这条证据围绕“BenchLM:Grok 4.6 的公开成绩、速度与成本”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。
- 测试条件
- BenchLM 快照记录综合分 63.4/100、约 66 tokens/s、首 token 约 32.3 秒;Reasoning、Knowledge、Math 等类别证据不足。
- 来源边界
- 支持在该页面的证据覆盖范围内阅读速度、首 token 与综合分;可用于提出复测问题。
- 不能支持
- 不支持把综合分当作完整能力画像,也不支持跨时间价格或未测类别的结论。
Reddit r/cursor:Grok 4.6 与 GPT-5.6 Sol 的同任务对比
这条证据围绕“Reddit r/cursor:Grok 4.6 与 GPT-5.6 Sol 的同任务对比”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。
- 测试条件
- Cursor 中以 Grok 4.6 Extra High 与 GPT-5.6 Sol Medium 执行同一后端方案,约 2,500 行代码;由 Fable 5 High 做独立评审,任务数为单个。
- 来源边界
- 支持一个相同起点的工程案例:成本、上下文污染和复杂逻辑边界值得继续检查。
- 不能支持
- 不支持模型总体排名、统计成功率或跨 Cursor/Codex harness 的结论;订阅额度也不等于 API 成本。
Emergent:Grok 4.6 的评测结果拆解
Emergent 认为,Grok 4.6 的公开成绩呈现出明显的能力分布:知识工作评测强,纯软件工程评测相对弱。它的 Intelligence Index 为 61,与 GPT-5.6 Sol 持平;但在 DeepSWE v1.1 和 Terminal-Bench v3.0 上分别落后 GPT-5.6 Sol 7.1 和 8.6 个百分点。
待验证:本次未能重新核实原文。
- 模型与版本
- Grok 4.6;来源标题为“Emergent:Grok 4.6 的评测结果拆解”,不与其他版本或推理档位混并。
- 任务与 harness
- Emergent 认为,Grok 4.6 的公开成绩呈现出明显的能力分布:知识工作评测强,纯软件工程评测相对弱。它的 Intelligence Index 为 61,与 GPT-5.6 Sol 持平;但在 DeepSWE v1.1 和 Terminal-Bench v3.0 上分别落后 GPT-5.6 Sol 7.1 和 8.6 个百分点。 完整任务集、运行参数与复测流程未完全公开。
- 样本与日期
- 来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
KIE:Grok 4.6 发布评测与能力拆解
KIE 将 Grok 4.6 的 Intelligence Index 概括为 61,与 GPT-5.6 Sol 持平;价格为输入 $2、输出 $6 / 1M tokens。文章认为它的主要卖点是价格-智能比,而不是在所有单项评测上都领先。
待验证:本次未能重新核实原文。
- 模型与版本
- Grok 4.6;来源标题为“KIE:Grok 4.6 发布评测与能力拆解”,不与其他版本或推理档位混并。
- 任务与 harness
- KIE 将 Grok 4.6 的 Intelligence Index 概括为 61,与 GPT-5.6 Sol 持平;价格为输入 $2、输出 $6 / 1M tokens。文章认为它的主要卖点是价格-智能比,而不是在所有单项评测上都领先。 完整任务集、运行参数与复测流程未完全公开。
- 样本与日期
- 来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
Medium 逐行解读:Grok 4.6 与 Sol、Fable 的对比
作者基于 xAI 发布的十行评测表做了逐项计数:在与 GPT-5.6 Sol Max 共同有成绩的 9 行中,Grok 4.6 赢 6 行,只输 DeepSWE v1.1 和 Terminal-Bench v3.0;对 Fable 5 Max 的十行比较中,Grok 赢 3 行、输 7 行。
待验证:本次未能重新核实原文。
- 模型与版本
- Grok 4.6;来源标题为“Medium 逐行解读:Grok 4.6 与 Sol、Fable 的对比”,不与其他版本或推理档位混并。
- 任务与 harness
- 作者基于 xAI 发布的十行评测表做了逐项计数:在与 GPT-5.6 Sol Max 共同有成绩的 9 行中,Grok 4.6 赢 6 行,只输 DeepSWE v1.1 和 Terminal-Bench v3.0;对 Fable 5 Max 的十行比较中,Grok 赢 3 行、输 7 行。 完整任务集、运行参数与复测流程未完全公开。
- 样本与日期
- 来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
Reddit r/cursor:社区对 Grok 4.6 榜单与体验差异的讨论
一部分用户认为 Grok 4.6 相比 4.5 的升级符合榜单趋势,尤其是在 Agentic 和编码任务上;另一部分用户认为过去 Grok 4.5 的公开分数与实际体验并不匹配,因此不愿仅凭 Intelligence Index 推断能力。
待验证:本次未能重新核实原文。
- 模型与版本
- Grok 4.6;来源标题为“Reddit r/cursor:社区对 Grok 4.6 榜单与体验差异的讨论”,不与其他版本或推理档位混并。
- 任务与 harness
- 一部分用户认为 Grok 4.6 相比 4.5 的升级符合榜单趋势,尤其是在 Agentic 和编码任务上;另一部分用户认为过去 Grok 4.5 的公开分数与实际体验并不匹配,因此不愿仅凭 Intelligence Index 推断能力。 完整任务集、运行参数与复测流程未完全公开。
- 样本与日期
- 来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
Reddit r/cursor:Grok 4.6 的非幻觉率与拒答校准
帖子引用 Artificial Analysis 的 AA-Omniscience Non-Hallucination Rate: GPT-5.6 Terra:12.1% 该指标描述的是:在模型不知道答案的情况下,它选择承认不确定而不是编造答案的比例。帖子同时提醒,Grok 4.6 的准确率仍需一起看,不能只用拒答率评价模型。
待验证:本次未能重新核实原文。
- 模型与版本
- Grok 4.6;来源标题为“Reddit r/cursor:Grok 4.6 的非幻觉率与拒答校准”,不与其他版本或推理档位混并。
- 任务与 harness
- 帖子引用 Artificial Analysis 的 AA-Omniscience Non-Hallucination Rate: GPT-5.6 Terra:12.1% 该指标描述的是:在模型不知道答案的情况下,它选择承认不确定而不是编造答案的比例。帖子同时提醒,Grok 4.6 的准确率仍需一起看,不能只用拒答率评价模型。 完整任务集、运行参数与复测流程未完全公开。
- 样本与日期
- 来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
Reddit r/opencodeCLI:Grok 4.6 的 DeepSWE 与 Terminal-Bench 讨论
评论区引用了 Grok 4.6 在 DeepSWE v1.1 上的 65.9%,并指出它高于 DeepSeek V4 Pro 0813 的 62.7%。这说明 Grok 4.6 相比 Grok 4.5 的 54% 有明显进步,但仍低于 GPT-5.6 Sol Max 的 73%。
待验证:本次未能重新核实原文。
- 模型与版本
- Grok 4.6;来源标题为“Reddit r/opencodeCLI:Grok 4.6 的 DeepSWE 与 Terminal-Bench 讨论”,不与其他版本或推理档位混并。
- 任务与 harness
- 评论区引用了 Grok 4.6 在 DeepSWE v1.1 上的 65.9%,并指出它高于 DeepSeek V4 Pro 0813 的 62.7%。这说明 Grok 4.6 相比 Grok 4.5 的 54% 有明显进步,但仍低于 GPT-5.6 Sol Max 的 73%。 完整任务集、运行参数与复测流程未完全公开。
- 样本与日期
- 来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
Reddit r/singularity:Grok 4.6 基准与真实编码反馈
这个帖子主要围绕 xAI/Artificial Analysis 的成绩单讨论真实使用感受。高互动评论认为 Grok 4.6 在编码上“便宜且快”,并分享了一个 Opus 负责规划、Grok 负责具体小范围修改的工作流。
待验证:本次未能重新核实原文。
- 模型与版本
- Grok 4.6;来源标题为“Reddit r/singularity:Grok 4.6 基准与真实编码反馈”,不与其他版本或推理档位混并。
- 任务与 harness
- 这个帖子主要围绕 xAI/Artificial Analysis 的成绩单讨论真实使用感受。高互动评论认为 Grok 4.6 在编码上“便宜且快”,并分享了一个 Opus 负责规划、Grok 负责具体小范围修改的工作流。 完整任务集、运行参数与复测流程未完全公开。
- 样本与日期
- 来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
X / TypingMind:同一剪纸动画提示下的 Grok 4.6 对比
TypingMind 表示,它把同一个“传统中国剪纸风格动画”提示词分别交给 Grok 4.6、GPT-5.6 Sol、Claude Opus 5 和 Qwen 3.8 Max,用于比较生成结果。推文附带视频,并在后续回复中提供了完整提示词和模型对比链接:https://cloud.typingmind.com/share/0bc76cfe-c0a3-4144-a042-eee5d845ac63。
待验证:本次未能重新核实原文。
- 模型与版本
- Grok 4.6;来源标题为“X / TypingMind:同一剪纸动画提示下的 Grok 4.6 对比”,不与其他版本或推理档位混并。
- 任务与 harness
- TypingMind 表示,它把同一个“传统中国剪纸风格动画”提示词分别交给 Grok 4.6、GPT-5.6 Sol、Claude Opus 5 和 Qwen 3.8 Max,用于比较生成结果。推文附带视频,并在后续回复中提供了完整提示词和模型对比链接:https://cloud.typingmind.com/share/0bc76cfe-c0a3-4144-a042-eee5d845ac63。 完整任务集、运行参数与复测流程未完全公开。
- 样本与日期
- 来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
X:Grok 4.6 与 Opus 5 的同提示成本速度对比
作者表示用同一提示测试 Grok 4.6 和 Opus 5: Grok 4.6:约 $1.74,约 5 分钟完成。 Opus 5:约 9 分钟,消耗其每日用量的 17%。 作者在结论中问读者哪个模型赢了;评论区意见并不一致,有人认为 Opus 5 质量更好,也有人认为 Grok 的速度和价格优势足以改变选择。
待验证:本次未能重新核实原文。
- 模型与版本
- Grok 4.6;来源标题为“X:Grok 4.6 与 Opus 5 的同提示成本速度对比”,不与其他版本或推理档位混并。
- 任务与 harness
- 作者表示用同一提示测试 Grok 4.6 和 Opus 5: Grok 4.6:约 $1.74,约 5 分钟完成。 Opus 5:约 9 分钟,消耗其每日用量的 17%。 作者在结论中问读者哪个模型赢了;评论区意见并不一致,有人认为 Opus 5 质量更好,也有人认为 Grok 的速度和价格优势足以改变选择。 完整任务集、运行参数与复测流程未完全公开。
- 样本与日期
- 来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
X:Matthew Berman 的个人资料卡片同提示对比
作者给 Grok 4.6、GPT-5.6 Sol 和 Fable 5 相同提示,让它们为一名创作者生成社交应用个人资料卡片,并比较结果。 原始提示要求在固定的 500×500 像素方形框架内,设计并构建一张包含肖像、姓名、简介、粉丝信息和关注按钮的个人资料卡;视觉设计、详细内容由模型自行决定。
待验证:本次未能重新核实原文。
- 模型与版本
- Grok 4.6;来源标题为“X:Matthew Berman 的个人资料卡片同提示对比”,不与其他版本或推理档位混并。
- 任务与 harness
- 作者给 Grok 4.6、GPT-5.6 Sol 和 Fable 5 相同提示,让它们为一名创作者生成社交应用个人资料卡片,并比较结果。 原始提示要求在固定的 500×500 像素方形框架内,设计并构建一张包含肖像、姓名、简介、粉丝信息和关注按钮的个人资料卡;视觉设计、详细内容由模型自行决定。 完整任务集、运行参数与复测流程未完全公开。
- 样本与日期
- 来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。
X:Mike P 的 Grok 4.6 与 Opus 5 健身报告长数据任务对比
作者使用 2019 年至今的 Garmin 完整数据和 Apple Health 数据,让模型生成一份涵盖所有运动项目的健身报告,重点分析骑行经历,追踪长期指标、进步和图表,并允许模型自行决定报告的视觉形式。 作者先前比较过 Grok 4.5 和 Opus 5;这次清理上下文后,用完全相同的提示在 Grok Build 中重新运行 Grok 4.6。
待验证:本次未能重新核实原文。
- 模型与版本
- Grok 4.6;来源标题为“X:Mike P 的 Grok 4.6 与 Opus 5 健身报告长数据任务对比”,不与其他版本或推理档位混并。
- 任务与 harness
- 作者使用 2019 年至今的 Garmin 完整数据和 Apple Health 数据,让模型生成一份涵盖所有运动项目的健身报告,重点分析骑行经历,追踪长期指标、进步和图表,并允许模型自行决定报告的视觉形式。 作者先前比较过 Grok 4.5 和 Opus 5;这次清理上下文后,用完全相同的提示在 Grok Build 中重新运行 Grok 4.6。 完整任务集、运行参数与复测流程未完全公开。
- 样本与日期
- 来源笔记采集日期为 2026-09-20;样本数、重复次数或原始日志未公开处保持未知。