比较对象:Grok 4.6 与 Kimi K3;文章使用双方官方发布与开发者文档。
Kimi K3:2.8T sparse MoE、1M context、开放权重、$3/M input、$15/M output、缓存 $0.30/M。
Grok 4.6:500K context;低于 200K 时 $2/$6,高于 200K 时 $4/$12,缓存输入 $0.30/M。
文章明确提醒:没有双方在相同 prompt、scaffold、reasoning budget 和模型快照下的独立 head-to-head。
K3 的 vendor-reported agent scores:Terminal-Bench 2.1 88.3、FrontierSWE 81.2、Program Bench 77.8、DeepSWE 67.5,均为 Moonshot harness/max mode 语境。
文章建议的可复用对照设计:20 个 routine、20 个 difficult、10 个 known failure tasks;同一工具权限和停止规则;盲审正确性、无谓修改、引用和可维护性;测量每个 accepted result 的成本与 p50/p95 延迟。
| 工作负载 | 文章建议路由 | 理由/边界 |
|---|---|---|
| 200K 以下、成本敏感 coding agent | Grok 4.6 | 单价更低,但任务成功率未由本文实测 |
| 高吞吐、低延迟 | Grok 4.6 | xAI 定位与价格优势,需自测 |
| 长程 agent-coded benchmark | Kimi K3 | 有较强公开 coding-agent 分数 |
| 自托管/开放权重 | Kimi K3 | K3 权重已发布,Grok 闭源 |
| 视频、多模态或超长 corpus | Kimi K3 | 1M context 与视频输入优势 |
| 200K 以上上下文 | 两者都测 | Grok 进入更高价格档,差距缩小 |
该比较更适合作为路由实验设计,而不是“谁更强”的证明:K3 的开放权重、1M context 和长程 coding 证据对应能力/部署选择,Grok 4.6 的低价/速度对应成本选择;最终应以每个任务的 accepted-result 成本和质量路由。
“Grok 4.6 以约一半参数匹配 K3”是 xAI 定位,不是独立基准结果。
K3 的 benchmark 表来自 Moonshot,Grok 没有同套 Terminal-Bench/FrontierSWE/ProgramBench/DeepSWE 分数。
价格是 token list price;重试、工具调用、输出长度、上下文计费和成功率会改变每任务成本。
文章的 20/20/10 是建议的复现实验设计,不是作者已执行的实验。
准备 20 个日常任务、20 个困难任务和 10 个已知失败任务,保存仓库/数据快照。
在相同 harness、工具权限、停止规则和上下文策略下分别运行两模型。
盲审 correctness、unnecessary edits、citations、maintainability;同时记录 token、重试、p50/p95 latency 和 accepted-result 成本。
分别分析 <200K 与 ≥200K context 的路由效果,再按任务类型而不是总平均分配模型。
原文完整列出两模型价格/context/部署差异、K3 的四项 vendor benchmark 数字和 20+20+10 的复现实验步骤,并多次提醒不同 harness 不可直接比较。
文章说明:“Benchmark figures are labeled as vendor-reported where applicable.”
Kimi K3