Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Kimi K3 · 媒体来源 · 编辑分析

比较文章更适合设计路由实验,不足以宣布赢家

Try Friday 对 Grok 4.6 与 Kimi K3 的价格、上下文和部署条件整理。

媒体来源编辑分析编辑日期 2026-09-20

测试条件速查

条件
发布日期/核查:2026-08-12
条件
K3:1M context、开放权重、$3/$15、缓存 $0.30/M;Grok 按上下文分档
条件
明确无同 prompt、scaffold、reasoning budget 和 snapshot 的 head-to-head
条件
20/20/10 为建议复现实验设计

关键数据与适用场景

测试环境

  • 比较对象:Grok 4.6 与 Kimi K3;文章使用双方官方发布与开发者文档。

  • Kimi K3:2.8T sparse MoE、1M context、开放权重、$3/M input、$15/M output、缓存 $0.30/M。

  • Grok 4.6:500K context;低于 200K 时 $2/$6,高于 200K 时 $4/$12,缓存输入 $0.30/M。

  • 文章明确提醒:没有双方在相同 prompt、scaffold、reasoning budget 和模型快照下的独立 head-to-head。

输入/配置

  • K3 的 vendor-reported agent scores:Terminal-Bench 2.1 88.3、FrontierSWE 81.2、Program Bench 77.8、DeepSWE 67.5,均为 Moonshot harness/max mode 语境。

  • 文章建议的可复用对照设计:20 个 routine、20 个 difficult、10 个 known failure tasks;同一工具权限和停止规则;盲审正确性、无谓修改、引用和可维护性;测量每个 accepted result 的成本与 p50/p95 延迟。

结果数据

工作负载文章建议路由理由/边界
200K 以下、成本敏感 coding agentGrok 4.6单价更低,但任务成功率未由本文实测
高吞吐、低延迟Grok 4.6xAI 定位与价格优势,需自测
长程 agent-coded benchmarkKimi K3有较强公开 coding-agent 分数
自托管/开放权重Kimi K3K3 权重已发布,Grok 闭源
视频、多模态或超长 corpusKimi K31M context 与视频输入优势
200K 以上上下文两者都测Grok 进入更高价格档,差距缩小

结论

该比较更适合作为路由实验设计,而不是“谁更强”的证明:K3 的开放权重、1M context 和长程 coding 证据对应能力/部署选择,Grok 4.6 的低价/速度对应成本选择;最终应以每个任务的 accepted-result 成本和质量路由。

局限

  • “Grok 4.6 以约一半参数匹配 K3”是 xAI 定位,不是独立基准结果。

  • K3 的 benchmark 表来自 Moonshot,Grok 没有同套 Terminal-Bench/FrontierSWE/ProgramBench/DeepSWE 分数。

  • 价格是 token list price;重试、工具调用、输出长度、上下文计费和成功率会改变每任务成本。

  • 文章的 20/20/10 是建议的复现实验设计,不是作者已执行的实验。

复现步骤

  1. 准备 20 个日常任务、20 个困难任务和 10 个已知失败任务,保存仓库/数据快照。

  2. 在相同 harness、工具权限、停止规则和上下文策略下分别运行两模型。

  3. 盲审 correctness、unnecessary edits、citations、maintainability;同时记录 token、重试、p50/p95 latency 和 accepted-result 成本。

  4. 分别分析 <200K 与 ≥200K context 的路由效果,再按任务类型而不是总平均分配模型。

原始证据与数据

原文完整列出两模型价格/context/部署差异、K3 的四项 vendor benchmark 数字和 20+20+10 的复现实验步骤,并多次提醒不同 harness 不可直接比较。

来源摘录或观察(仅做合规短引)

文章说明:“Benchmark figures are labeled as vendor-reported where applicable.”

能支持的判断

  • Try Friday 对 Grok 4.6 与 Kimi K3 的价格、上下文和部署条件整理;K3 为 1M context、$3/$15、缓存 $0.30/M。

不能支持的判断

  • 不支持称为同 prompt 的 head-to-head:没有统一 scaffold、reasoning budget 或 snapshot;20/20/10 只是建议复现实验设计。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Try Friday AI Research · Friday AI Research · 原文发布日期 2026-08-12 · 本站编辑日期 2026-09-20

打开原始来源

Kimi K3

在 Tabbit 中比较 Kimi K3

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

定价 · 简体中文

Kimi K3 价格:API 成本、会员方案与预算计算

用官方费率解释 Kimi K3 的 API 价格、缓存写入、会员方案和三种实际预算场景。

相关评测

Kimi K3 代码安全评估:基准强不等于精度够Semgrep 的 IDOR 代码安全基准;可区分 precision、recall 和 F1。实战编码:简单任务接近,陷阱任务暴露可靠性差距相同 GitHub issue、规划—实现—验证三阶段与 70 分量表的编码 Agent 观察。Coding Agent 证据足够严肃,但不支持“通用最佳”NxCode 对 Kimi K3 公开 coding-agent 基准的口径、配置和可比性整理。知识工作质量接近前沿,但平均每任务成本与耗时很高AA-Briefcase 私有 Agentic knowledge-work benchmark,记录质量、成本、耗时和 token。让 Kimi K3 在 OpenCode 中调用 Firecrawl 获取网页资料把 Kimi K3、OpenCode 与 Firecrawl MCP 连接成可引用的网页研究流程;要求先限定域名、权限和停止条件。把 Kimi API 请求写成可验收任务将官方提示词建议落成角色、背景、约束、格式和验收条件的执行清单。来源没有提供一条可直接复制的完整通用 prompt。把 Kimi K3 的 Agent loop 拆成可控步骤依据 Kimi API 指南,将任务拆解、工具 schema、循环控制、权限和终检串成可复查流程;不会在 Tabbit 中自动配置工具。用九步流程把需求转成可审查代码变更Kimi AI 的编码工作流强调先计划、再实现、再验证;适用于有仓库和验收标准的变更,不等于模型已替你运行测试。