Semgrep 的 IDOR 代码安全基准;可区分 precision、recall 和 F1。
Google / Semgrep · 查看证据Kimi K3 · 测评与证据
Kimi K3,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
相同 GitHub issue、规划—实现—验证三阶段与 70 分量表的编码 Agent 观察。
Google / MindStudio · 查看证据NxCode 对 Kimi K3 公开 coding-agent 基准的口径、配置和可比性整理。
Google / NxCode · 查看证据完整测评与相关内容
精选证据
Kimi K3 代码安全评估:基准强不等于精度够
Semgrep 的 IDOR 代码安全基准;可区分 precision、recall 和 F1。
- 条件
- 模型/版本:Kimi K3;其他模型对照版本以原文为准
- 条件
- 任务:真实开源代码仓库中的 IDOR
- 条件
- Harness:pydantic_ai 最小 Agent harness;具体参数按来源
实战编码:简单任务接近,陷阱任务暴露可靠性差距
相同 GitHub issue、规划—实现—验证三阶段与 70 分量表的编码 Agent 观察。
- 条件
- 模型:Kimi K3、Kimi K2.7、Opus 4.8
- 条件
- 流程:规划、实现、验证;同一代码库 issue
- 条件
- 结果:简单任务约 64/70,复杂任务略高于 60;陷阱任务 K3 约 36% 失败
Coding Agent 证据足够严肃,但不支持“通用最佳”
NxCode 对 Kimi K3 公开 coding-agent 基准的口径、配置和可比性整理。
- 条件
- 来源:NxCode;汇总公开 benchmark
- 条件
- 条件:不同 benchmark/harness/推理档位混合
- 条件
- 边界:有证据支持编码评估,但不等于同 harness 独立复现
知识工作质量接近前沿,但平均每任务成本与耗时很高
AA-Briefcase 私有 Agentic knowledge-work benchmark,记录质量、成本、耗时和 token。
- 条件
- 任务:spreadsheet、presentation、UI mock-up 等复杂交付
- 条件
- 快照:来源正文称 last week;精确发布日期未公开
- 条件
- 结果:Elo 1543;pass 51%;$10.57/任务;56.4 分钟;120K 输出 token;83 turns
全部来源
全部来源
Kimi K3 代码安全评估:基准强不等于精度够
Semgrep 的 IDOR 代码安全基准;可区分 precision、recall 和 F1。
- 条件
- 模型/版本:Kimi K3;其他模型对照版本以原文为准
- 条件
- 任务:真实开源代码仓库中的 IDOR
- 条件
- Harness:pydantic_ai 最小 Agent harness;具体参数按来源
实战编码:简单任务接近,陷阱任务暴露可靠性差距
相同 GitHub issue、规划—实现—验证三阶段与 70 分量表的编码 Agent 观察。
- 条件
- 模型:Kimi K3、Kimi K2.7、Opus 4.8
- 条件
- 流程:规划、实现、验证;同一代码库 issue
- 条件
- 结果:简单任务约 64/70,复杂任务略高于 60;陷阱任务 K3 约 36% 失败
Coding Agent 证据足够严肃,但不支持“通用最佳”
NxCode 对 Kimi K3 公开 coding-agent 基准的口径、配置和可比性整理。
- 条件
- 来源:NxCode;汇总公开 benchmark
- 条件
- 条件:不同 benchmark/harness/推理档位混合
- 条件
- 边界:有证据支持编码评估,但不等于同 harness 独立复现
知识工作质量接近前沿,但平均每任务成本与耗时很高
AA-Briefcase 私有 Agentic knowledge-work benchmark,记录质量、成本、耗时和 token。
- 条件
- 任务:spreadsheet、presentation、UI mock-up 等复杂交付
- 条件
- 快照:来源正文称 last week;精确发布日期未公开
- 条件
- 结果:Elo 1543;pass 51%;$10.57/任务;56.4 分钟;120K 输出 token;83 turns
官方案例显示长程 Agent 潜力,也暴露复现边界
Kimi 官方发布材料中的长程编码、视觉闭环、知识工作和研究案例。
- 条件
- 来源:Kimi/Moonshot 官方技术博客
- 条件
- 案例:最多 24 小时 sandbox、48 小时芯片设计、研究/知识工作数字
- 条件
- 条件:官方案例,任务与 harness 细节不完整
SVG pelican 单题案例:能看出特征,不能替代 Agent 测评
Simon Willison 使用 OpenRouter 与 llm-openrouter 生成 SVG 并再次进行图片描述;单题、个人体验。
- 条件
- 模型:moonshotai/kimi-k3
- 条件
- 客户端:OpenRouter + llm-openrouter
- 条件
- 任务:SVG pelican riding a bicycle;输入 95 tokens,输出 16,658 tokens
能力很强但慢且耗 token:个人判断需留误差条
X 上的能力评论,强调最大努力基准、实践表现与闭源前沿的差距。
待验证:本次未能重新核实原文。
- 条件
- 来源日期:页面显示 2026-07-20
- 条件
- 推理:通常 maximum effort;大量 token
- 条件
- 证据:个人综合判断,不是受控复测
社区实测:研究与拒答体验受提示和 API 路由影响
Reddit 用户对 Kimi K3 日常研究、编码和拒答的个人体验。
待验证:本次未能重新核实原文。
- 条件
- 来源:r/LocalLLaMA;作者与样本未统一控制
- 条件
- 环境:OpenRouter/API 与不同使用场景
- 条件
- 内容:体验和 benchmark 对照,不是同一 harness 实验
强大且便宜并非完整结论:社区对成本与能力的分歧
LLMDevs 讨论 Kimi K3 的能力、价格与实践取舍。
待验证:本次未能重新核实原文。
- 条件
- 来源:r/LLMDevs;评论串
- 条件
- 条件:个人客户端、任务和价格口径不统一
- 条件
- 结论:讨论性意见,非受控测试
发布基准很强,但生产选型需拆开能力、成本和部署
Enter Pro 的模型综述,涵盖规模、开放权重、基准与部署讨论。
- 条件
- 来源日期:页面标注 2026-07
- 条件
- 来源:第三方综述,部分数据为引用
- 条件
- 限制:未统一执行所有对照任务
把可核验事实与未核验宣传分开
Layer3Labs 综述,明确区分模型规格、基准来源与实践建议。
待验证:本次未能重新核实原文。
- 条件
- 页面更新:2026-07-17
- 条件
- 内容:规格与公开基准整理
- 条件
- 限制:第三方文章,动态事实需刷新
可视化编码案例有价值,但不是通用成功率
Puter Developer 的可视化编码页面,包含目标/当前渲染对照与代码案例。
- 条件
- 环境:Puter Developer 页面与浏览器渲染案例
- 条件
- 任务:生成/修正可视化页面
- 条件
- 证据:案例级观察,非大样本
技术报告提供丰富数字,但跨 harness 不可直接排名
Kimi 团队技术报告 v2 的基准表、推理配置和工具条件。
- 条件
- 版本:arXiv 2607.24653v2;2026-08-07 修订
- 条件
- 推理:max;temperature 1.0;top-p 按任务
- 条件
- 工具:部分视觉/Agent 任务启用工具
前五排名要连同证据标签一起读
BenchLM 将 Kimi K3 的 benchmark 行、来源、cohort 和 evidence 状态放在同一账本。
- 条件
- 数据截至 2026-08-17;218 个模型;44 条可展示 rows
- 条件
- 总分 80.5/100,#5/218;AgenticRank/Coding/Knowledge/Multimodal 均列前五
- 条件
- 证据混合:Verified、Mixed sources、Provider exact 等
受限网络安全评估中超过 GLM-5.2,但 ACE 为 0/41
NIST/UK AISI/CAISI 的 ExploitBench 与 TLO 预评估。
- 条件
- ExploitBench:41 个 V8/JavaScript/WebAssembly 漏洞任务
- 条件
- TLO:32 步、4 子网、约 20 台主机;100M token 限制
- 条件
- 结果:32%;ACE 0/41;平均进度 17/32;完成 1/10
同一 K3 在八种 harness 上通过率相差 20 个百分点
Reddit 单模型、单提供商、八种 Agent harness 的 25 任务对照。
- 条件
- 模型:moonshotai/kimi-k3;OpenRouter;Maximum
- 条件
- 工具:同一 hosted Composio MCP;8 harness;每个 25 任务
- 条件
- 结果:最高 88% vs 最低 68%;任务数口径正文有 25/30 不一致
比较文章更适合设计路由实验,不足以宣布赢家
Try Friday 对 Grok 4.6 与 Kimi K3 的价格、上下文和部署条件整理。
- 条件
- 发布日期/核查:2026-08-12
- 条件
- K3:1M context、开放权重、$3/$15、缓存 $0.30/M;Grok 按上下文分档
- 条件
- 明确无同 prompt、scaffold、reasoning budget 和 snapshot 的 head-to-head