BenchLM 模型档案与 benchmark ledger;页面把每行的分数、对照、权重、cohort 和 evidence 状态放在一起。
页面数据截至 2026-08-17,覆盖 218 个模型的排名视图。
价格:输入 $3/M、输出 $15/M、缓存输入 $0.30/M。
页面显示 44 条可展示来源的 benchmark rows;证据状态有 Verified、Mixed sources、Provider exact、Benchmark exact、Secondary exact 等。
K3 的很多 coding/agentic 数字来自 Kimi 官方发布表;BenchLM 是证据账本和跨模型比较层,不是统一 harness 的重新运行。
| 分类 | Kimi K3 | 排名/证据 |
|---|---|---|
| 总分 | 80.5/100 | #5/218;44 条 source-displayable rows |
| AgenticRank | 73.9 | #5/131,10 个 benchmark,Verified |
| CodingRank | 78.0 | #5/135,13 个 benchmark,Mixed sources |
| Knowledge | 84.8 | #5/57,4 个 benchmark,Verified |
| Multimodal | 87.9 | #4/33,13 个 benchmark,Verified |
| Reasoning/Math/Multilingual/Instruction | 未测量 | 页面无可用 benchmark rows |
关键账本行包括:DeepSWE 67.5(低于 GPT-5.6 Sol 72.7)、Terminal-Bench 2.1 88.3(低于 Sol 91.9)、BrowseComp 91.2(低于 Sol 92.2)、AutomationBench 30.8(低于 GLM-5.3 48.2)、APEX-Agents 37.6(低于 Grok 4.6 57.5)、MathVision 94.3/97.8(无工具/有 Python)、ExploitBench 32(来源链指向 NIST/UK AISI/CAISI)。
BenchLM 的价值不是再宣布一个“第一”,而是把 K3 的排名拆成可追溯来源:Agentic、Coding、Knowledge、Multimodal 均在前五,但若把 Provider exact、Benchmark exact 和 Verified 混在一起,容易误读成全部都是独立复跑结果。
页面没有提供 K3 的统一输入、完整 harness、运行日志或原始输出;不能作为独立受控测评的替代品。
44 行中有不少 provider exact,且某些分类完全未测量;总分不是全能力覆盖。
排名和 Elo/来源会随着新模型、来源更新和 benchmark 版本变化;应保存采集日期。
保存页面快照和每一行的 source link、evidence 状态、日期。
只对 Verified 或 Benchmark exact 行作为候选复核,逐条打开原始 leaderboard/报告。
对实际选型任务建立相同分类的本地 held-out 集,并报告 K3 与基线的相同 harness 结果。
不把 Provider exact 数字写成独立实验结果,保留原始证据标签。
页面公开总分 80.5、#5/218、44 条来源可展示行、分类分数/排名、价格和每个 benchmark 的对照与证据类型;页面链接到 Kimi 官方博客、NIST/UK AISI/CAISI 与具体 benchmark 页面。
页面证据摘要为:“Evidence: Supported; this profile shows 44 source-displayable benchmark rows.”
Kimi K3