Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Kimi K3

Kimi K3 技术报告:完整基准表与评测配置

原始来源

arXiv

作者Kimi Team(302 位以上作者未在摘要页全部展开)

原文日期2026-07-27

Tabbit 整理2026-08-19

查看原文

测试环境

  • Kimi K3:2.8T 总参数、104B activated、原生视觉、1M context。

  • 主表基线:Claude Fable 5、GPT-5.6 Sol、Claude Opus 4.8、GPT-5.5、GLM-5.2。

  • 默认评测:K3 reasoning_effort=max、temperature=1.0;单步知识/视觉任务 top-p=0.95,Agent 任务 top-p=1.0。

  • Harness:Kimi Code、Claude Code、Codex;PostTrainBench 为 H20 上三次平均,ZeroBench 为五次,其余视觉任务多为三次平均。

输入/配置

  • BrowseComp 使用 300K token 触发 context compaction;完整 1M context 且不做管理时,报告分数为 90.4。

  • OfficeQA Pro 将 PDF 全部渲染为图片且不提供机器可读文本。

  • MCP-Atlas 使用 500 个公开任务、100-turn 限制,Gemini 3.1 Pro 作 judge;AutomationBench 使用 600 个公开任务。

  • 报告明确披露 Fable 5 有 fallback,GPT-5.6 Sol 可能触发 cyberguard,因此表格并非完全同条件盲测。

结果数据

评测Kimi K3读法
GPQA Diamond93.5接近前沿,但 GPT-5.6 Sol 为 94.1
HLE-Full(无工具/有工具)43.5 / 56.0研究级知识任务落后 Fable/Sol
DeepSWE67.5低于 Sol 73.0、Fable 70.0
Terminal-Bench 2.188.3接近 Sol 88.8
FrontierSWE81.2仅次于 Fable 86.6
ProgramBench77.8表中高于 Sol 77.6、Fable 76.8
SWE-Marathon42.0报告表中最高,但任务分支与 harness 需注意
BrowseComp91.2高于 Sol 90.4,配置差异见上
DeepSearchQA F195.0高于 Fable 94.2
GDPval-AA v2 Elo1686低于 Fable 1747、Sol 1736
AA-Briefcase Elo1548低于 Fable 1583
AutomationBench30.8高于 Sol 29.7、Fable 29.1
CharXiv(无工具/有 Python)84.8 / 91.3工具显著改变结果
Math-Vision(无工具/有 Python)94.3 / 97.8需要区分工具条件
ZeroBench-main pass@5(无工具/有 Python)23.0 / 41.0与工具条件不可混比

报告还给出内部 Kimi Webdev Bench:与 Opus 4.8 使用同一 Claude Code harness、盲审总体 Win 58.6%、Tie 13.8%、Lose 27.6%,Win-Lose 为 +31.0;这是内部对照,不是公开 benchmark。

结论

技术报告支持 K3 在长程 coding、web/工具 Agent、Python 辅助视觉任务上处于前沿竞争区间,但在 HLE、GDPval/AA-Briefcase、OfficeQA 等知识工作任务仍落后顶级闭源模型。报告的最大复用价值是把 reasoning、top-p、harness、运行次数和工具条件写清楚,便于按同配置做本地 pilot。

局限

  • 主表由模型提供方发布;内部 benchmark 和案例不能视为独立复核。

  • 不同模型使用不同 harness、fallback、guard 和硬件;分数不能简单当作公平竞赛。

  • 部分第三方分数是引用其他机构的快照;版本日期不同会改变 Elo 和排行榜。

  • 1M context、工具增强和 agent 循环都可能显著改变 token、成本与成功率。

复现步骤

  1. 固定 Kimi K3 版本、max、temperature 1.0,并按任务类型设置 top-p 0.95/1.0。

  2. 记录 Kimi Code/Claude Code/Codex harness、工具权限、context compaction 阈值和硬件。

  3. 对公开 benchmark 按官方版本运行至少三次;视觉任务记录是否启用 Python,ZeroBench 按五次运行。

  4. 把每个 benchmark 的输入、停止规则、失败/拒答、token、成本和结果分开保存,禁止把不同 harness 的数字合并成一个结论。

原始证据与数据

技术报告正文公开了主表、评测配置、第三方引用说明、内部 benchmark 定义、工具条件和结果解释;这些字段足以复核“配置导致的可比性边界”,但不足以复现所有私有内部任务。

来源摘录或观察(仅做合规短引)

报告表头明确写道:“All maxed out on thinking effort: max or xhigh.”

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Kimi K3

在 Tabbit 中使用并对比模型

Kimi K3

相关测评

媒体Google / Semgrep

Kimi K3 的代码安全测评:表面强劲,精度不足

媒体Google / MindStudio

Kimi K3 实战编码测评:真的像宣传的那么好吗?

媒体Google / Simon Willison

Kimi K3 与 pelican benchmark:我们还能学到什么

媒体Google / NxCode

Kimi K3 benchmark 详解:coding-agent 测评指南

Kimi K3

相关提示词

媒体Google / Business Compass LLC

Kimi K3 提示词工程指南

媒体Google / Together AI

Kimi K3:完整开发者指南

媒体Google / Kimi API Platform

Kimi 提示词最佳实践

媒体Google / Kimi API Platform

使用 Kimi K3 构建 Agent