Kimi K3

Kimi K3 · 测评与证据

Kimi K3,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

完整测评与相关内容

模型深度阅读

定价 · 简体中文

Kimi K3 价格:API 成本、会员方案与预算计算

用官方费率解释 Kimi K3 的 API 价格、缓存写入、会员方案和三种实际预算场景。

精选证据

媒体 / 基准方独立测量

Kimi K3 代码安全评估:基准强不等于精度够

Semgrep 的 IDOR 代码安全基准;可区分 precision、recall 和 F1。

来源Google / Semgrep
原文日期未知
采集2026-08-18
条件
模型/版本:Kimi K3;其他模型对照版本以原文为准
条件
任务:真实开源代码仓库中的 IDOR
条件
Harness:pydantic_ai 最小 Agent harness;具体参数按来源
编程
媒体 / 基准方独立测量

实战编码:简单任务接近,陷阱任务暴露可靠性差距

相同 GitHub issue、规划—实现—验证三阶段与 70 分量表的编码 Agent 观察。

来源Google / MindStudio
原文日期未知
采集2026-08-18
条件
模型:Kimi K3、Kimi K2.7、Opus 4.8
条件
流程:规划、实现、验证;同一代码库 issue
条件
结果:简单任务约 64/70,复杂任务略高于 60;陷阱任务 K3 约 36% 失败
编程
媒体 / 基准方编辑分析

Coding Agent 证据足够严肃,但不支持“通用最佳”

NxCode 对 Kimi K3 公开 coding-agent 基准的口径、配置和可比性整理。

来源Google / NxCode
原文日期未知
采集2026-08-18
条件
来源:NxCode;汇总公开 benchmark
条件
条件:不同 benchmark/harness/推理档位混合
条件
边界:有证据支持编码评估,但不等于同 harness 独立复现
编程
媒体 / 基准方独立测量

知识工作质量接近前沿,但平均每任务成本与耗时很高

AA-Briefcase 私有 Agentic knowledge-work benchmark,记录质量、成本、耗时和 token。

来源Artificial Analysis
原文日期未知
采集2026-08-18
条件
任务:spreadsheet、presentation、UI mock-up 等复杂交付
条件
快照:来源正文称 last week;精确发布日期未公开
条件
结果:Elo 1543;pass 51%;$10.57/任务;56.4 分钟;120K 输出 token;83 turns
信息抽取

全部来源

全部来源

17 / 17
媒体 / 基准方独立测量

Kimi K3 代码安全评估:基准强不等于精度够

Semgrep 的 IDOR 代码安全基准;可区分 precision、recall 和 F1。

来源Google / Semgrep
原文日期未知
采集2026-08-18
条件
模型/版本:Kimi K3;其他模型对照版本以原文为准
条件
任务:真实开源代码仓库中的 IDOR
条件
Harness:pydantic_ai 最小 Agent harness;具体参数按来源
编程
媒体 / 基准方独立测量

实战编码:简单任务接近,陷阱任务暴露可靠性差距

相同 GitHub issue、规划—实现—验证三阶段与 70 分量表的编码 Agent 观察。

来源Google / MindStudio
原文日期未知
采集2026-08-18
条件
模型:Kimi K3、Kimi K2.7、Opus 4.8
条件
流程:规划、实现、验证;同一代码库 issue
条件
结果:简单任务约 64/70,复杂任务略高于 60;陷阱任务 K3 约 36% 失败
编程
媒体 / 基准方编辑分析

Coding Agent 证据足够严肃,但不支持“通用最佳”

NxCode 对 Kimi K3 公开 coding-agent 基准的口径、配置和可比性整理。

来源Google / NxCode
原文日期未知
采集2026-08-18
条件
来源:NxCode;汇总公开 benchmark
条件
条件:不同 benchmark/harness/推理档位混合
条件
边界:有证据支持编码评估,但不等于同 harness 独立复现
编程
媒体 / 基准方独立测量

知识工作质量接近前沿,但平均每任务成本与耗时很高

AA-Briefcase 私有 Agentic knowledge-work benchmark,记录质量、成本、耗时和 token。

来源Artificial Analysis
原文日期未知
采集2026-08-18
条件
任务:spreadsheet、presentation、UI mock-up 等复杂交付
条件
快照:来源正文称 last week;精确发布日期未公开
条件
结果:Elo 1543;pass 51%;$10.57/任务;56.4 分钟;120K 输出 token;83 turns
信息抽取
官方厂商自报

官方案例显示长程 Agent 潜力,也暴露复现边界

Kimi 官方发布材料中的长程编码、视觉闭环、知识工作和研究案例。

来源Kimi 官方技术博客
原文日期未知
采集2026-08-18
条件
来源:Kimi/Moonshot 官方技术博客
条件
案例:最多 24 小时 sandbox、48 小时芯片设计、研究/知识工作数字
条件
条件:官方案例,任务与 harness 细节不完整
Agent
媒体 / 基准方个人体验

SVG pelican 单题案例:能看出特征,不能替代 Agent 测评

Simon Willison 使用 OpenRouter 与 llm-openrouter 生成 SVG 并再次进行图片描述;单题、个人体验。

来源Google / Simon Willison
原文日期未知
采集2026-08-18
条件
模型:moonshotai/kimi-k3
条件
客户端:OpenRouter + llm-openrouter
条件
任务:SVG pelican riding a bicycle;输入 95 tokens,输出 16,658 tokens
视觉生成
社区个人体验

能力很强但慢且耗 token:个人判断需留误差条

X 上的能力评论,强调最大努力基准、实践表现与闭源前沿的差距。

来源X
原文日期未知
采集2026-08-18

待验证:本次未能重新核实原文。

条件
来源日期:页面显示 2026-07-20
条件
推理:通常 maximum effort;大量 token
条件
证据:个人综合判断,不是受控复测
推理
社区个人体验

社区实测:研究与拒答体验受提示和 API 路由影响

Reddit 用户对 Kimi K3 日常研究、编码和拒答的个人体验。

来源Reddit / r/LocalLLaMA
原文日期未知
采集2026-08-18

待验证:本次未能重新核实原文。

条件
来源:r/LocalLLaMA;作者与样本未统一控制
条件
环境:OpenRouter/API 与不同使用场景
条件
内容:体验和 benchmark 对照,不是同一 harness 实验
推理
社区个人体验

强大且便宜并非完整结论:社区对成本与能力的分歧

LLMDevs 讨论 Kimi K3 的能力、价格与实践取舍。

来源Reddit / r/LLMDevs
原文日期未知
采集2026-08-18

待验证:本次未能重新核实原文。

条件
来源:r/LLMDevs;评论串
条件
条件:个人客户端、任务和价格口径不统一
条件
结论:讨论性意见,非受控测试
推理
媒体 / 基准方编辑分析

发布基准很强,但生产选型需拆开能力、成本和部署

Enter Pro 的模型综述,涵盖规模、开放权重、基准与部署讨论。

来源Google / Enter Pro
原文日期未知
采集2026-08-18
条件
来源日期:页面标注 2026-07
条件
来源:第三方综述,部分数据为引用
条件
限制:未统一执行所有对照任务
推理
媒体 / 基准方编辑分析

把可核验事实与未核验宣传分开

Layer3Labs 综述,明确区分模型规格、基准来源与实践建议。

来源Google / Layer3Labs
原文日期未知
采集2026-08-18

待验证:本次未能重新核实原文。

条件
页面更新:2026-07-17
条件
内容:规格与公开基准整理
条件
限制:第三方文章,动态事实需刷新
推理
媒体 / 基准方独立测量

可视化编码案例有价值,但不是通用成功率

Puter Developer 的可视化编码页面,包含目标/当前渲染对照与代码案例。

来源Google / Puter Developer
原文日期未知
采集2026-08-18
条件
环境:Puter Developer 页面与浏览器渲染案例
条件
任务:生成/修正可视化页面
条件
证据:案例级观察,非大样本
视觉生成
媒体 / 基准方厂商自报

技术报告提供丰富数字,但跨 harness 不可直接排名

Kimi 团队技术报告 v2 的基准表、推理配置和工具条件。

来源arXiv
原文日期2026-07-27
采集2026-08-18
条件
版本:arXiv 2607.24653v2;2026-08-07 修订
条件
推理:max;temperature 1.0;top-p 按任务
条件
工具:部分视觉/Agent 任务启用工具
推理
媒体 / 基准方编辑分析

前五排名要连同证据标签一起读

BenchLM 将 Kimi K3 的 benchmark 行、来源、cohort 和 evidence 状态放在同一账本。

来源BenchLM
原文日期2026-08-17
采集2026-08-18
条件
数据截至 2026-08-17;218 个模型;44 条可展示 rows
条件
总分 80.5/100,#5/218;AgenticRank/Coding/Knowledge/Multimodal 均列前五
条件
证据混合:Verified、Mixed sources、Provider exact 等
推理
媒体 / 基准方独立测量

受限网络安全评估中超过 GLM-5.2,但 ACE 为 0/41

NIST/UK AISI/CAISI 的 ExploitBench 与 TLO 预评估。

来源NIST(与 UK AI Security Institute 联合)
原文日期未知
采集2026-08-18
条件
ExploitBench:41 个 V8/JavaScript/WebAssembly 漏洞任务
条件
TLO:32 步、4 子网、约 20 台主机;100M token 限制
条件
结果:32%;ACE 0/41;平均进度 17/32;完成 1/10
编程
社区个人体验

同一 K3 在八种 harness 上通过率相差 20 个百分点

Reddit 单模型、单提供商、八种 Agent harness 的 25 任务对照。

来源Reddit r/kimi
原文日期未知
采集2026-08-18
条件
模型:moonshotai/kimi-k3;OpenRouter;Maximum
条件
工具:同一 hosted Composio MCP;8 harness;每个 25 任务
条件
结果:最高 88% vs 最低 68%;任务数口径正文有 25/30 不一致
Agent
媒体 / 基准方编辑分析

比较文章更适合设计路由实验,不足以宣布赢家

Try Friday 对 Grok 4.6 与 Kimi K3 的价格、上下文和部署条件整理。

来源Try Friday AI Research
原文日期2026-08-12
采集2026-08-18
条件
发布日期/核查:2026-08-12
条件
K3:1M context、开放权重、$3/$15、缓存 $0.30/M;Grok 按上下文分档
条件
明确无同 prompt、scaffold、reasoning budget 和 snapshot 的 head-to-head
成本

Kimi K3

在 Tabbit 中比较 Kimi K3

客户端中的模型、功能和权限以当前账户为准。