Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Kimi K3 · 媒体来源 · 厂商自报

技术报告提供丰富数字,但跨 harness 不可直接排名

Kimi 团队技术报告 v2 的基准表、推理配置和工具条件。

媒体来源厂商自报编辑日期 2026-09-20

测试条件速查

条件
版本:arXiv 2607.24653v2;2026-08-07 修订
条件
推理:max;temperature 1.0;top-p 按任务
条件
工具:部分视觉/Agent 任务启用工具
条件
限制:不同模型 harness、硬件与防护不同

关键数据与适用场景

测试环境

  • Kimi K3:2.8T 总参数、104B activated、原生视觉、1M context。

  • 主表基线:Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5、GLM-5.2。

  • 默认评测:K3 reasoning_effort=max、temperature=1.0;单步知识/视觉任务 top-p=0.95,Agent 任务 top-p=1.0。

  • Harness:Kimi Code、Claude Code、Codex;PostTrainBench 为 H20 上三次平均,ZeroBench 为五次,其余视觉任务多为三次平均。

输入/配置

  • BrowseComp 使用 300K token 触发 context compaction;完整 1M context 且不做管理时,报告分数为 90.4。

  • OfficeQA Pro 将 PDF 全部渲染为图片且不提供机器可读文本。

  • MCP-Atlas 使用 500 个公开任务、100-turn 限制,Gemini 3.1 Pro 作 judge;AutomationBench 使用 600 个公开任务。

  • 报告明确披露 Fable 5 有 fallback,GPT-5.6 Sol 可能触发 cyberguard,因此表格并非完全同条件盲测。

结果数据

评测Kimi K3读法
GPQA Diamond93.5接近前沿,但 GPT-5.6 Sol 为 94.1
HLE-Full(无工具/有工具)43.5 / 56.0研究级知识任务落后 Fable/Sol
DeepSWE67.5低于 Sol 73.0、Fable 70.0
Terminal-Bench 2.188.3接近 Sol 88.8
FrontierSWE81.2仅次于 Fable 86.6
ProgramBench77.8表中高于 Sol 77.6、Fable 76.8
SWE-Marathon42.0报告表中最高,但任务分支与 harness 需注意
BrowseComp91.2高于 Sol 90.4,配置差异见上
DeepSearchQA F195.0高于 Fable 94.2
GDPval-AA v2 Elo1686低于 Fable 1747、Sol 1736
AA-Briefcase Elo1548低于 Fable 1583
AutomationBench30.8高于 Sol 29.7、Fable 29.1
CharXiv(无工具/有 Python)84.8 / 91.3工具显著改变结果
Math-Vision(无工具/有 Python)94.3 / 97.8需要区分工具条件
ZeroBench-main pass@5(无工具/有 Python)23.0 / 41.0与工具条件不可混比

报告还给出内部 Kimi Webdev Bench:与 Opus 4.8 使用同一 Claude Code harness、盲审总体 Win 58.6%、Tie 13.8%、Lose 27.6%,Win-Lose 为 +31.0;这是内部对照,不是公开 benchmark。

结论

技术报告支持 K3 在长程 coding、web/工具 Agent、Python 辅助视觉任务上处于前沿竞争区间,但在 HLE、GDPval/AA-Briefcase、OfficeQA 等知识工作任务仍落后顶级闭源模型。报告的最大复用价值是把 reasoning、top-p、harness、运行次数和工具条件写清楚,便于按同配置做本地 pilot。

局限

  • 主表由模型提供方发布;内部 benchmark 和案例不能视为独立复核。

  • 不同模型使用不同 harness、fallback、guard 和硬件;分数不能简单当作公平竞赛。

  • 部分第三方分数是引用其他机构的快照;版本日期不同会改变 Elo 和排行榜。

  • 1M context、工具增强和 agent 循环都可能显著改变 token、成本与成功率。

复现步骤

  1. 固定 Kimi K3 版本、max、temperature 1.0,并按任务类型设置 top-p 0.95/1.0。

  2. 记录 Kimi Code/Claude Code/Codex harness、工具权限、context compaction 阈值和硬件。

  3. 对公开 benchmark 按官方版本运行至少三次;视觉任务记录是否启用 Python,ZeroBench 按五次运行。

  4. 把每个 benchmark 的输入、停止规则、失败/拒答、token、成本和结果分开保存,禁止把不同 harness 的数字合并成一个结论。

原始证据与数据

技术报告正文公开了主表、评测配置、第三方引用说明、内部 benchmark 定义、工具条件和结果解释;这些字段足以复核“配置导致的可比性边界”,但不足以复现所有私有内部任务。

来源摘录或观察(仅做合规短引)

报告表头明确写道:“All maxed out on thinking effort: max or xhigh.”

能支持的判断

  • Kimi 团队技术报告 v2(arXiv 2607.24653v2,2026-08-07 修订)的基准表、max 推理、temperature 1.0 和工具条件。

不能支持的判断

  • 限制:不同模型 harness、硬件与防护不同

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

arXiv · Kimi Team(302 位以上作者未在摘要页全部展开) · 原文发布日期 2026-07-27 · 本站编辑日期 2026-09-20

打开原始来源

Kimi K3

在 Tabbit 中比较 Kimi K3

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

定价 · 简体中文

Kimi K3 价格:API 成本、会员方案与预算计算

用官方费率解释 Kimi K3 的 API 价格、缓存写入、会员方案和三种实际预算场景。

相关评测

发布基准很强,但生产选型需拆开能力、成本和部署Enter Pro 的模型综述,涵盖规模、开放权重、基准与部署讨论。把可核验事实与未核验宣传分开Layer3Labs 综述,明确区分模型规格、基准来源与实践建议。前五排名要连同证据标签一起读BenchLM 将 Kimi K3 的 benchmark 行、来源、cohort 和 evidence 状态放在同一账本。能力很强但慢且耗 token:个人判断需留误差条X 上的能力评论,强调最大努力基准、实践表现与闭源前沿的差距。把 Kimi API 请求写成可验收任务将官方提示词建议落成角色、背景、约束、格式和验收条件的执行清单。来源没有提供一条可直接复制的完整通用 prompt。把 Kimi K3 的提示词拆成可执行约束围绕“把 Kimi K3 的提示词拆成可执行约束”整理来源中的任务边界、输入和执行环境;完整步骤与限制见详情。让 Kimi K3 在 OpenCode 中调用 Firecrawl 获取网页资料把 Kimi K3、OpenCode 与 Firecrawl MCP 连接成可引用的网页研究流程;要求先限定域名、权限和停止条件。把 Kimi K3 的 Agent loop 拆成可控步骤依据 Kimi API 指南,将任务拆解、工具 schema、循环控制、权限和终检串成可复查流程;不会在 Tabbit 中自动配置工具。