Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Kimi K3 · 媒体来源 · 独立测量

受限网络安全评估中超过 GLM-5.2,但 ACE 为 0/41

NIST/UK AISI/CAISI 的 ExploitBench 与 TLO 预评估。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

条件
ExploitBench:41 个 V8/JavaScript/WebAssembly 漏洞任务
条件
TLO:32 步、4 子网、约 20 台主机;100M token 限制
条件
结果:32%;ACE 0/41;平均进度 17/32;完成 1/10
条件
K3 hosted setup;完整 prompt/工具链未公开

关键数据与适用场景

测试环境

  • 评估对象:Moonshot AI Kimi K3;重点是 cyber capability,不是一般代码质量。

  • ExploitBench:41 个 V8 引擎、JavaScript/WebAssembly 相关近期漏洞任务,测量从覆盖/崩溃复现到任意代码执行(ACE)的进展。

  • The Last Ones(TLO):32 步、4 个子网、约 20 台主机的模拟企业网络攻击路径;标准限制 100M tokens。

  • 为减少拒答,闭源美国模型关闭 system-level safeguards;K3 因 hosted setup 只运行选择性 cyber 评测。

输入/配置

  • K3 的整体 cyber capability 主要由单一 ExploitBench 估计,因此置信区间比其他模型更大。

  • NIST 页面公开 benchmark 规模、任务性质和置信区间说明,但未公开 K3 的完整 system prompt、工具链或每个轨迹。

结果数据

评测Kimi K3对照/边界
ExploitBench 总分32%GLM-5.2 为 24%
ExploitBench ACE0/41最高严重度结果;最强模型平均 20/41
TLO 平均进度第 17/32 步最强美国模型平均 28.5 步;GLM-5.2 为第 11 步
TLO 完成1/10 次100M-token 限制内完成

结论

在这组受限评估中,K3 明显超过 GLM-5.2,但仍落后最强 cyber 模型,且没有在 41 个 ExploitBench 样本中达到 ACE。它可被视为需要严格隔离和授权控制的安全研究候选,不应被描述为已具备稳定的端到端攻击能力。

局限

  • 这是 preliminary assessment,样本小且 K3 只运行选择性评测;整体能力估计的置信区间较宽。

  • TLO 没有 active defenders、告警惩罚,且存在预设攻击路径,与真实企业网络不同。

  • 关闭闭源模型 safeguard 的结果不能代表用户可直接获得的公共产品行为。

  • 这些数据只回答受控 cyber benchmark 问题,不能外推到所有防御、漏洞审计或生产安全任务。

复现步骤

  1. 仅在隔离、授权的实验环境中获取 NIST 所引用的公开 benchmark 和版本说明。

  2. 固定模型版本、token 上限、工具权限和评分脚本,先做低风险漏洞识别/修复任务。

  3. 记录发现、可复现性、误报、工具调用和停止原因;不要把安全评估扩展为未经授权的真实系统测试。

  4. 将 K3 与 GLM-5.2 或其他基线放在同一任务集上,报告置信区间而不是只报一次成功率。

原始证据与数据

NIST 页面公开 41 个 ExploitBench 任务、32 步 TLO、32%/24%、ACE 0/41、17/32、1/10 和 100M token 限制,并明确解释了 benchmark 与真实环境的差异。

来源摘录或观察(仅做合规短引)

页面的对照结论为:“Kimi K3 outperforms GLM-5.2”。

能支持的判断

  • NIST/UK AISI/CAISI 的 ExploitBench 与 TLO 预评估:ExploitBench 32%、ACE 0/41、TLO 平均进度 17/32、完成 1/10。

不能支持的判断

  • K3 hosted setup;完整 prompt/工具链未公开

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

NIST(与 UK AI Security Institute 联合) · UK AISI / U.S. CAISI 联合评估团队 · 原文发布日期 Unknown · 本站编辑日期 2026-09-20

打开原始来源

Kimi K3

在 Tabbit 中比较 Kimi K3

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

定价 · 简体中文

Kimi K3 价格:API 成本、会员方案与预算计算

用官方费率解释 Kimi K3 的 API 价格、缓存写入、会员方案和三种实际预算场景。

相关评测

Kimi K3 代码安全评估:基准强不等于精度够Semgrep 的 IDOR 代码安全基准;可区分 precision、recall 和 F1。实战编码:简单任务接近,陷阱任务暴露可靠性差距相同 GitHub issue、规划—实现—验证三阶段与 70 分量表的编码 Agent 观察。Coding Agent 证据足够严肃,但不支持“通用最佳”NxCode 对 Kimi K3 公开 coding-agent 基准的口径、配置和可比性整理。知识工作质量接近前沿,但平均每任务成本与耗时很高AA-Briefcase 私有 Agentic knowledge-work benchmark,记录质量、成本、耗时和 token。把 Kimi K3 的 Agent loop 拆成可控步骤依据 Kimi API 指南,将任务拆解、工具 schema、循环控制、权限和终检串成可复查流程;不会在 Tabbit 中自动配置工具。用九步流程把需求转成可审查代码变更Kimi AI 的编码工作流强调先计划、再实现、再验证;适用于有仓库和验收标准的变更,不等于模型已替你运行测试。配置 Kimi K3 的开发者调用与多模态输入围绕“配置 Kimi K3 的开发者调用与多模态输入”整理来源中的任务边界、输入和执行环境;完整步骤与限制见详情。为网站、代码库和研究任务选择 Kimi K3 工作方式围绕“为网站、代码库和研究任务选择 Kimi K3 工作方式”整理来源中的任务边界、输入和执行环境;完整步骤与限制见详情。