Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Kimi K3

Try Friday:Grok 4.6 与 Kimi K3 的成本、能力与路由比较

原始来源

Try Friday AI Research

作者Friday AI Research

原文日期2026-08-12

Tabbit 整理2026-08-19

查看原文

测试环境

  • 比较对象:Grok 4.6 与 Kimi K3;文章使用双方官方发布与开发者文档。

  • Kimi K3:2.8T sparse MoE、1M context、开放权重、$3/M input、$15/M output、缓存 $0.30/M。

  • Grok 4.6:500K context;低于 200K 时 $2/$6,高于 200K 时 $4/$12,缓存输入 $0.30/M。

  • 文章明确提醒:没有双方在相同 prompt、scaffold、reasoning budget 和模型快照下的独立 head-to-head。

输入/配置

  • K3 的 vendor-reported agent scores:Terminal-Bench 2.1 88.3、FrontierSWE 81.2、Program Bench 77.8、DeepSWE 67.5,均为 Moonshot harness/max mode 语境。

  • 文章建议的可复用对照设计:20 个 routine、20 个 difficult、10 个 known failure tasks;同一工具权限和停止规则;盲审正确性、无谓修改、引用和可维护性;测量每个 accepted result 的成本与 p50/p95 延迟。

结果数据

工作负载文章建议路由理由/边界
200K 以下、成本敏感 coding agentGrok 4.6单价更低,但任务成功率未由本文实测
高吞吐、低延迟Grok 4.6xAI 定位与价格优势,需自测
长程 agent-coded benchmarkKimi K3有较强公开 coding-agent 分数
自托管/开放权重Kimi K3K3 权重已发布,Grok 闭源
视频、多模态或超长 corpusKimi K31M context 与视频输入优势
200K 以上上下文两者都测Grok 进入更高价格档,差距缩小

结论

该比较更适合作为路由实验设计,而不是“谁更强”的证明:K3 的开放权重、1M context 和长程 coding 证据对应能力/部署选择,Grok 4.6 的低价/速度对应成本选择;最终应以每个任务的 accepted-result 成本和质量路由。

局限

  • “Grok 4.6 以约一半参数匹配 K3”是 xAI 定位,不是独立基准结果。

  • K3 的 benchmark 表来自 Moonshot,Grok 没有同套 Terminal-Bench/FrontierSWE/ProgramBench/DeepSWE 分数。

  • 价格是 token list price;重试、工具调用、输出长度、上下文计费和成功率会改变每任务成本。

  • 文章的 20/20/10 是建议的复现实验设计,不是作者已执行的实验。

复现步骤

  1. 准备 20 个日常任务、20 个困难任务和 10 个已知失败任务,保存仓库/数据快照。

  2. 在相同 harness、工具权限、停止规则和上下文策略下分别运行两模型。

  3. 盲审 correctness、unnecessary edits、citations、maintainability;同时记录 token、重试、p50/p95 latency 和 accepted-result 成本。

  4. 分别分析 <200K 与 ≥200K context 的路由效果,再按任务类型而不是总平均分配模型。

原始证据与数据

原文完整列出两模型价格/context/部署差异、K3 的四项 vendor benchmark 数字和 20+20+10 的复现实验步骤,并多次提醒不同 harness 不可直接比较。

来源摘录或观察(仅做合规短引)

文章说明:“Benchmark figures are labeled as vendor-reported where applicable.”

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Kimi K3

在 Tabbit 中使用并对比模型

Kimi K3

相关测评

媒体Google / Semgrep

Kimi K3 的代码安全测评:表面强劲,精度不足

媒体Google / MindStudio

Kimi K3 实战编码测评:真的像宣传的那么好吗?

媒体Google / Simon Willison

Kimi K3 与 pelican benchmark:我们还能学到什么

媒体Google / NxCode

Kimi K3 benchmark 详解:coding-agent 测评指南

Kimi K3

相关提示词

媒体Google / Business Compass LLC

Kimi K3 提示词工程指南

媒体Google / Together AI

Kimi K3:完整开发者指南

媒体Google / Kimi API Platform

Kimi 提示词最佳实践

媒体Google / Kimi API Platform

使用 Kimi K3 构建 Agent