Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Kimi K3

NIST/UK AISI/CAISI:Kimi K3 网络安全能力预评估

原始来源

NIST(与 UK AI Security Institute 联合)

作者UK AISI / U.S. CAISI 联合评估团队

Tabbit 整理2026-08-19

查看原文

测试环境

  • 评估对象:Moonshot AI Kimi K3;重点是 cyber capability,不是一般代码质量。

  • ExploitBench:41 个 V8 引擎、JavaScript/WebAssembly 相关近期漏洞任务,测量从覆盖/崩溃复现到任意代码执行(ACE)的进展。

  • The Last Ones(TLO):32 步、4 个子网、约 20 台主机的模拟企业网络攻击路径;标准限制 100M tokens。

  • 为减少拒答,闭源美国模型关闭 system-level safeguards;K3 因 hosted setup 只运行选择性 cyber 评测。

输入/配置

  • K3 的整体 cyber capability 主要由单一 ExploitBench 估计,因此置信区间比其他模型更大。

  • NIST 页面公开 benchmark 规模、任务性质和置信区间说明,但未公开 K3 的完整 system prompt、工具链或每个轨迹。

结果数据

评测Kimi K3对照/边界
ExploitBench 总分32%GLM-5.2 为 24%
ExploitBench ACE0/41最高严重度结果;最强模型平均 20/41
TLO 平均进度第 17/32 步最强美国模型平均 28.5 步;GLM-5.2 为第 11 步
TLO 完成1/10 次100M-token 限制内完成

结论

在这组受限评估中,K3 明显超过 GLM-5.2,但仍落后最强 cyber 模型,且没有在 41 个 ExploitBench 样本中达到 ACE。它可被视为需要严格隔离和授权控制的安全研究候选,不应被描述为已具备稳定的端到端攻击能力。

局限

  • 这是 preliminary assessment,样本小且 K3 只运行选择性评测;整体能力估计的置信区间较宽。

  • TLO 没有 active defenders、告警惩罚,且存在预设攻击路径,与真实企业网络不同。

  • 关闭闭源模型 safeguard 的结果不能代表用户可直接获得的公共产品行为。

  • 这些数据只回答受控 cyber benchmark 问题,不能外推到所有防御、漏洞审计或生产安全任务。

复现步骤

  1. 仅在隔离、授权的实验环境中获取 NIST 所引用的公开 benchmark 和版本说明。

  2. 固定模型版本、token 上限、工具权限和评分脚本,先做低风险漏洞识别/修复任务。

  3. 记录发现、可复现性、误报、工具调用和停止原因;不要把安全评估扩展为未经授权的真实系统测试。

  4. 将 K3 与 GLM-5.2 或其他基线放在同一任务集上,报告置信区间而不是只报一次成功率。

原始证据与数据

NIST 页面公开 41 个 ExploitBench 任务、32 步 TLO、32%/24%、ACE 0/41、17/32、1/10 和 100M token 限制,并明确解释了 benchmark 与真实环境的差异。

来源摘录或观察(仅做合规短引)

页面的对照结论为:“Kimi K3 outperforms GLM-5.2”。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Kimi K3

在 Tabbit 中使用并对比模型

Kimi K3

相关测评

媒体Google / Semgrep

Kimi K3 的代码安全测评:表面强劲,精度不足

媒体Google / MindStudio

Kimi K3 实战编码测评:真的像宣传的那么好吗?

媒体Google / Simon Willison

Kimi K3 与 pelican benchmark:我们还能学到什么

媒体Google / NxCode

Kimi K3 benchmark 详解:coding-agent 测评指南

Kimi K3

相关提示词

媒体Google / Business Compass LLC

Kimi K3 提示词工程指南

媒体Google / Together AI

Kimi K3:完整开发者指南

媒体Google / Kimi API Platform

Kimi 提示词最佳实践

媒体Google / Kimi API Platform

使用 Kimi K3 构建 Agent