官方评测将 K2.5 定位为原生视觉、编码和 Agent Swarm 模型:Thinking/工具配置、上下文和重复次数公开得较详细,但 SWE 等结果仍依赖 Moonshot 自有 harness,需与第三方部署分开看。
模型/模式:Kimi K2.5 Thinking;对比 GPT-5.2 xhigh、Claude Opus 4.5 extended thinking、Gemini 3 Pro high、DeepSeek V3.2 thinking。
一般配置:Kimi temperature=1.0、top_p=0.95、context 256k;HLE/AIME/HMMT/GPQA max completion 96k。
重复:AIME/HMMT avg@32、GPQA avg@8、Vision avg@3、Agentic Search Seal-0/WideSearch avg@4、coding tasks avg@5;SWE-Bench 官方附录说明不同任务使用内部 framework。
工具:search、code interpreter、web browsing;HLE/Agentic Search 使用工具和上下文管理策略。
官方编码评测使用 bash、createfile、insert、view、strreplace、submit 等最小工具,SWE 系列用 Moonshot 内部评估框架和 tailored system prompts;Terminal-Bench 2.0 使用 Terminus-2,且在该实现中以 non-thinking 运行。
HLE-Full:Thinking 30.1,无工具;工具 50.2。
SWE-Bench Verified:76.8;SWE-Pro:50.7;SWE Multilingual:73.0;Terminal Bench 2.0:50.8。
LiveCodeBench v6:85.0;PaperBench:63.5;CyberGym:41.3;SciCode:48.7。
BrowseComp:60.6;BrowseComp context management:74.9;Agent Swarm:78.4。
WideSearch:72.7;Agent Swarm:79.0;DeepSearchQA:77.1;AA-LCR:70.0;LongBench v2:61.0。
视觉:MMMU-Pro 78.5、OCRBench 92.3、OmniDocBench 1.5 88.8、VideoMMMU 86.6、LongVideoBench 79.8。
K2.5 的核心优势是“视觉 + 工具 + 并行 Agent”组合;对于编码、研究检索、长视频/文档和大规模可并行搜索,官方结果支持把它作为开放模型候选。没有工具或严格单 Agent 的任务,不能直接套用 Swarm 成绩。
官方结果自报;部分 benchmark 用内部 harness、tailored system prompts 和非公开评测。
K2.5 官方附录明确某些 coding 最高分来自 non-thinking;不能只看模型名推断 thinking 能力。
对比模型的 effort、工具和服务稳定性不同;官方说 GPT-5.2 xhigh 有约 10% 无输出失败,被计为错误。
Agent Swarm 结果有独立的并行限制/上下文策略,不等于普通 Chat Completion。
固定 K2.5 Thinking、temperature=1、top_p=.95、context 256k 和 max tokens,保存 system prompt/工具定义。
按官方附录分别复跑无工具、工具、单 Agent、Swarm 和视觉任务;记录 avg@32/8/5 等重复策略。
对 coding 使用相同工具集和 parser,单独报告 thinking/non-thinking。
与 GPT/Claude/DeepSeek 使用同样上下文管理、超时和成本口径,对比成功率、延迟和工具错误。
Kimi K2.5