Grok 4.6 模型测评导航
汇总 Grok 4.6 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。
官方
1 条已核对来源的资料媒体
5 条已核对来源的资料Artificial Analysis:Grok 4.6 的智能与成本评测
Artificial Analysis 将 Grok 4.6 评为 Intelligence Index 61,与 GPT-5.6 Sol 持平,仅落后 Claude Opus 5 和 Fable 5。该机构的解读是:Grok 4.6 的优势不只在静态推理,而在知识工作、客服工具调用、终端任务等 Agent 场景中的综合表现和成本效率。
BenchLM:Grok 4.6 的公开成绩、速度与成本
BenchLM 综合公开分:63.4 / 100。 Agentic 类别:7 / 130。 Coding 类别:18 / 135。 公开证据行:42 条;其中 Agentic 4/4、Coding 12/12 标记为已验证。 速度:约 66 tokens/s,首 token 约 32.3 秒。
Emergent:Grok 4.6 的评测结果拆解
Emergent 认为,Grok 4.6 的公开成绩呈现出明显的能力分布:知识工作评测强,纯软件工程评测相对弱。它的 Intelligence Index 为 61,与 GPT-5.6 Sol 持平;但在 DeepSWE v1.1 和 Terminal-Bench v3.0 上分别落后 GPT-5.6 Sol 7.1 和 8.6 个百分点。
KIE:Grok 4.6 发布评测与能力拆解
KIE 将 Grok 4.6 的 Intelligence Index 概括为 61,与 GPT-5.6 Sol 持平;价格为输入 $2、输出 $6 / 1M tokens。文章认为它的主要卖点是价格-智能比,而不是在所有单项评测上都领先。
Medium 逐行解读:Grok 4.6 与 Sol、Fable 的对比
作者基于 xAI 发布的十行评测表做了逐项计数:在与 GPT-5.6 Sol Max 共同有成绩的 9 行中,Grok 4.6 赢 6 行,只输 DeepSWE v1.1 和 Terminal-Bench v3.0;对 Fable 5 Max 的十行比较中,Grok 赢 3 行、输 7 行。
社区
9 条已核对来源的资料Reddit r/cursor:社区对 Grok 4.6 榜单与体验差异的讨论
一部分用户认为 Grok 4.6 相比 4.5 的升级符合榜单趋势,尤其是在 Agentic 和编码任务上;另一部分用户认为过去 Grok 4.5 的公开分数与实际体验并不匹配,因此不愿仅凭 Intelligence Index 推断能力。
Reddit r/cursor:Grok 4.6 的非幻觉率与拒答校准
帖子引用 Artificial Analysis 的 AA-Omniscience Non-Hallucination Rate: GPT-5.6 Terra:12.1% 该指标描述的是:在模型不知道答案的情况下,它选择承认不确定而不是编造答案的比例。帖子同时提醒,Grok 4.6 的准确率仍需一起看,不能只用拒答率评价模型。
Reddit r/cursor:Grok 4.6 与 GPT-5.6 Sol 的同任务对比
作者在 Cursor 中用 Grok 4.6 Extra High 和 GPT-5.6 Sol Medium 执行同一个详细后端方案,起点和计划相同,任务规模约 2,500 行代码;由 Fable 5 High 作为独立评审。
Reddit r/opencodeCLI:Grok 4.6 的 DeepSWE 与 Terminal-Bench 讨论
评论区引用了 Grok 4.6 在 DeepSWE v1.1 上的 65.9%,并指出它高于 DeepSeek V4 Pro 0813 的 62.7%。这说明 Grok 4.6 相比 Grok 4.5 的 54% 有明显进步,但仍低于 GPT-5.6 Sol Max 的 73%。
Reddit r/singularity:Grok 4.6 基准与真实编码反馈
这个帖子主要围绕 xAI/Artificial Analysis 的成绩单讨论真实使用感受。高互动评论认为 Grok 4.6 在编码上“便宜且快”,并分享了一个 Opus 负责规划、Grok 负责具体小范围修改的工作流。
X / TypingMind:同一剪纸动画提示下的 Grok 4.6 对比
TypingMind 表示,它把同一个“传统中国剪纸风格动画”提示词分别交给 Grok 4.6、GPT-5.6 Sol、Claude Opus 5 和 Qwen 3.8 Max,用于比较生成结果。推文附带视频,并在后续回复中提供了完整提示词和模型对比链接:https://cloud.typingmind.com/share/0bc76cfe-c0a3-4144-a042-eee5d845ac63。
X:Grok 4.6 与 Opus 5 的同提示成本速度对比
作者表示用同一提示测试 Grok 4.6 和 Opus 5: Grok 4.6:约 $1.74,约 5 分钟完成。 Opus 5:约 9 分钟,消耗其每日用量的 17%。 作者在结论中问读者哪个模型赢了;评论区意见并不一致,有人认为 Opus 5 质量更好,也有人认为 Grok 的速度和价格优势足以改变选择。
X:Matthew Berman 的个人资料卡片同提示对比
作者给 Grok 4.6、GPT-5.6 Sol 和 Fable 5 相同提示,让它们为一名创作者生成社交应用个人资料卡片,并比较结果。 原始提示要求在固定的 500×500 像素方形框架内,设计并构建一张包含肖像、姓名、简介、粉丝信息和关注按钮的个人资料卡;视觉设计、详细内容由模型自行决定。
X:Mike P 的 Grok 4.6 与 Opus 5 健身报告长数据任务对比
作者使用 2019 年至今的 Garmin 完整数据和 Apple Health 数据,让模型生成一份涵盖所有运动项目的健身报告,重点分析骑行经历,追踪长期指标、进步和图表,并允许模型自行决定报告的视觉形式。 作者先前比较过 Grok 4.5 和 Opus 5;这次清理上下文后,用完全相同的提示在 Grok Build 中重新运行 Grok 4.6。
Grok 4.6
在 Tabbit 中使用并对比模型
汇总 Grok 4.6 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。