Kimi K3:2.8T 总参数、104B activated、原生视觉、1M context。
主表基线:Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5、GLM-5.2。
默认评测:K3 reasoning_effort=max、temperature=1.0;单步知识/视觉任务 top-p=0.95,Agent 任务 top-p=1.0。
Harness:Kimi Code、Claude Code、Codex;PostTrainBench 为 H20 上三次平均,ZeroBench 为五次,其余视觉任务多为三次平均。
BrowseComp 使用 300K token 触发 context compaction;完整 1M context 且不做管理时,报告分数为 90.4。
OfficeQA Pro 将 PDF 全部渲染为图片且不提供机器可读文本。
MCP-Atlas 使用 500 个公开任务、100-turn 限制,Gemini 3.1 Pro 作 judge;AutomationBench 使用 600 个公开任务。
报告明确披露 Fable 5 有 fallback,GPT-5.6 Sol 可能触发 cyberguard,因此表格并非完全同条件盲测。
| 评测 | Kimi K3 | 读法 |
|---|---|---|
| GPQA Diamond | 93.5 | 接近前沿,但 GPT-5.6 Sol 为 94.1 |
| HLE-Full(无工具/有工具) | 43.5 / 56.0 | 研究级知识任务落后 Fable/Sol |
| DeepSWE | 67.5 | 低于 Sol 73.0、Fable 70.0 |
| Terminal-Bench 2.1 | 88.3 | 接近 Sol 88.8 |
| FrontierSWE | 81.2 | 仅次于 Fable 86.6 |
| ProgramBench | 77.8 | 表中高于 Sol 77.6、Fable 76.8 |
| SWE-Marathon | 42.0 | 报告表中最高,但任务分支与 harness 需注意 |
| BrowseComp | 91.2 | 高于 Sol 90.4,配置差异见上 |
| DeepSearchQA F1 | 95.0 | 高于 Fable 94.2 |
| GDPval-AA v2 Elo | 1686 | 低于 Fable 1747、Sol 1736 |
| AA-Briefcase Elo | 1548 | 低于 Fable 1583 |
| AutomationBench | 30.8 | 高于 Sol 29.7、Fable 29.1 |
| CharXiv(无工具/有 Python) | 84.8 / 91.3 | 工具显著改变结果 |
| Math-Vision(无工具/有 Python) | 94.3 / 97.8 | 需要区分工具条件 |
| ZeroBench-main pass@5(无工具/有 Python) | 23.0 / 41.0 | 与工具条件不可混比 |
报告还给出内部 Kimi Webdev Bench:与 Opus 4.8 使用同一 Claude Code harness、盲审总体 Win 58.6%、Tie 13.8%、Lose 27.6%,Win-Lose 为 +31.0;这是内部对照,不是公开 benchmark。
技术报告支持 K3 在长程 coding、web/工具 Agent、Python 辅助视觉任务上处于前沿竞争区间,但在 HLE、GDPval/AA-Briefcase、OfficeQA 等知识工作任务仍落后顶级闭源模型。报告的最大复用价值是把 reasoning、top-p、harness、运行次数和工具条件写清楚,便于按同配置做本地 pilot。
主表由模型提供方发布;内部 benchmark 和案例不能视为独立复核。
不同模型使用不同 harness、fallback、guard 和硬件;分数不能简单当作公平竞赛。
部分第三方分数是引用其他机构的快照;版本日期不同会改变 Elo 和排行榜。
1M context、工具增强和 agent 循环都可能显著改变 token、成本与成功率。
固定 Kimi K3 版本、max、temperature 1.0,并按任务类型设置 top-p 0.95/1.0。
记录 Kimi Code/Claude Code/Codex harness、工具权限、context compaction 阈值和硬件。
对公开 benchmark 按官方版本运行至少三次;视觉任务记录是否启用 Python,ZeroBench 按五次运行。
把每个 benchmark 的输入、停止规则、失败/拒答、token、成本和结果分开保存,禁止把不同 harness 的数字合并成一个结论。
技术报告正文公开了主表、评测配置、第三方引用说明、内部 benchmark 定义、工具条件和结果解释;这些字段足以复核“配置导致的可比性边界”,但不足以复现所有私有内部任务。
报告表头明确写道:“All maxed out on thinking effort: max or xhigh.”
Kimi K3