评估对象:Moonshot AI Kimi K3;重点是 cyber capability,不是一般代码质量。
ExploitBench:41 个 V8 引擎、JavaScript/WebAssembly 相关近期漏洞任务,测量从覆盖/崩溃复现到任意代码执行(ACE)的进展。
The Last Ones(TLO):32 步、4 个子网、约 20 台主机的模拟企业网络攻击路径;标准限制 100M tokens。
为减少拒答,闭源美国模型关闭 system-level safeguards;K3 因 hosted setup 只运行选择性 cyber 评测。
K3 的整体 cyber capability 主要由单一 ExploitBench 估计,因此置信区间比其他模型更大。
NIST 页面公开 benchmark 规模、任务性质和置信区间说明,但未公开 K3 的完整 system prompt、工具链或每个轨迹。
| 评测 | Kimi K3 | 对照/边界 |
|---|---|---|
| ExploitBench 总分 | 32% | GLM-5.2 为 24% |
| ExploitBench ACE | 0/41 | 最高严重度结果;最强模型平均 20/41 |
| TLO 平均进度 | 第 17/32 步 | 最强美国模型平均 28.5 步;GLM-5.2 为第 11 步 |
| TLO 完成 | 1/10 次 | 100M-token 限制内完成 |
在这组受限评估中,K3 明显超过 GLM-5.2,但仍落后最强 cyber 模型,且没有在 41 个 ExploitBench 样本中达到 ACE。它可被视为需要严格隔离和授权控制的安全研究候选,不应被描述为已具备稳定的端到端攻击能力。
这是 preliminary assessment,样本小且 K3 只运行选择性评测;整体能力估计的置信区间较宽。
TLO 没有 active defenders、告警惩罚,且存在预设攻击路径,与真实企业网络不同。
关闭闭源模型 safeguard 的结果不能代表用户可直接获得的公共产品行为。
这些数据只回答受控 cyber benchmark 问题,不能外推到所有防御、漏洞审计或生产安全任务。
仅在隔离、授权的实验环境中获取 NIST 所引用的公开 benchmark 和版本说明。
固定模型版本、token 上限、工具权限和评分脚本,先做低风险漏洞识别/修复任务。
记录发现、可复现性、误报、工具调用和停止原因;不要把安全评估扩展为未经授权的真实系统测试。
将 K3 与 GLM-5.2 或其他基线放在同一任务集上,报告置信区间而不是只报一次成功率。
NIST 页面公开 41 个 ExploitBench 任务、32 步 TLO、32%/24%、ACE 0/41、17/32、1/10 和 100M token 限制,并明确解释了 benchmark 与真实环境的差异。
页面的对照结论为:“Kimi K3 outperforms GLM-5.2”。
Kimi K3