BenchLM 的动态账本显示 Kimi K2.5 在 Coding、Agentic、Reasoning、Multimodal 等多类基准有公开来源,但总分/排名是自定义聚合,复核时应按原始 benchmark、工具模式和上下文策略逐项比较。
页面状态:数据截至 2026-08-17;页面显示 21 条 source-displayable rows(动态目录会更新)。
证据:Benchmark exact、Provider exact、Secondary exact 混合;页面包含 SWE-Bench、Terminal-Bench、BrowseComp、MMMU、GPQA 等。
聚合:页面自定义类别分数/权重与总排名,不是一个统一运行。
条目来自 Kimi model card、Fireworks、SWE/Terminal/AA 等 leaderboard;不同 benchmark 的 Thinking、工具、上下文和重复次数不同。使用时优先打开逐行来源,固定 K2.5 snapshot、模式、parser 和 harness。
页面可见代表性结果包括:SWE-Bench Verified 76.8%、SWE-Bench Pro 50.7%、SWE Multilingual 73.0%、Terminal-Bench 2.0 50.8%、BrowseComp 60.6%、BrowseComp(context management)74.9%、Agent Swarm 78.4%、MMMU-Pro 78.5%、LongBench v2 61.0%、AA-LCR 70.0%。
K2.5 的任务优势集中在多模态、Agentic Search、视觉文档和可并行编码;context management、Thinking/non-thinking 和 Swarm 是否启用会显著改变分数,必须按目标产品复跑。
BenchLM 总分和排名受自定义权重、目录更新和来源混合影响,不能替代原始指标。
Kimi 官方数值有内部 prompt/harness 和独立 Swarm 配置;不同来源之间不一定可直接比较。
部分结果来自 provider/二手来源,证据等级必须跟随每一行记录。
先选择目标任务:编码、视觉、搜索、办公、长上下文或 Swarm。
逐项锁定模型模式、temperature/top_p、工具、context management、最大步骤和重复次数。
保存原始 prompt、输入媒体、工具轨迹、输出、score、成本和失败样本。
与至少一个对照模型同 harness 复跑,并将 BenchLM 页面仅作为索引/交叉核对。
Kimi K2.5