Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Kimi K2.5 · 官方来源 · 厂商自报

Kimi K2.5 官方发布:多模态、Agent Swarm 与编码基准

Kimi 官方发布把 K2.5 定位为视觉、编码和 Agent Swarm 模型,并公开 Thinking、工具、上下文和部分 benchmark 条件。

官方来源厂商自报编辑日期 2026-09-20

测试条件速查

来源具体观察
2026-01-27 Kimi/Moonshot 官方发布;视觉、编码、Agent Swarm 与 Thinking/工具配置。
已公布条件
官方结果依赖 Moonshot 自有 harness,部分 benchmark 的 prompt、重复次数和独立复测不可得。

关键数据与适用场景

一句话结论

官方评测将 K2.5 定位为原生视觉、编码和 Agent Swarm 模型:Thinking/工具配置、上下文和重复次数公开得较详细,但 SWE 等结果仍依赖 Moonshot 自有 harness,需与第三方部署分开看。

测试环境

  • 模型/模式:Kimi K2.5 Thinking;对比 GPT-5.2 xhigh、Claude Opus 4.5 extended thinking、Gemini 3 Pro high、DeepSeek V3.2 thinking。

  • 一般配置:Kimi temperature=1.0、top_p=0.95、context 256k;HLE/AIME/HMMT/GPQA max completion 96k。

  • 重复:AIME/HMMT avg@32、GPQA avg@8、Vision avg@3、Agentic Search Seal-0/WideSearch avg@4、coding tasks avg@5;SWE-Bench 官方附录说明不同任务使用内部 framework。

  • 工具:search、code interpreter、web browsing;HLE/Agentic Search 使用工具和上下文管理策略。

输入/配置

官方编码评测使用 bash、createfile、insert、view、strreplace、submit 等最小工具,SWE 系列用 Moonshot 内部评估框架和 tailored system prompts;Terminal-Bench 2.0 使用 Terminus-2,且在该实现中以 non-thinking 运行。

结果数据

  • HLE-Full:Thinking 30.1,无工具;工具 50.2。

  • SWE-Bench Verified:76.8;SWE-Pro:50.7;SWE Multilingual:73.0;Terminal Bench 2.0:50.8。

  • LiveCodeBench v6:85.0;PaperBench:63.5;CyberGym:41.3;SciCode:48.7。

  • BrowseComp:60.6;BrowseComp context management:74.9;Agent Swarm:78.4。

  • WideSearch:72.7;Agent Swarm:79.0;DeepSearchQA:77.1;AA-LCR:70.0;LongBench v2:61.0。

  • 视觉:MMMU-Pro 78.5、OCRBench 92.3、OmniDocBench 1.5 88.8、VideoMMMU 86.6、LongVideoBench 79.8。

结论

K2.5 的核心优势是“视觉 + 工具 + 并行 Agent”组合;对于编码、研究检索、长视频/文档和大规模可并行搜索,官方结果支持把它作为开放模型候选。没有工具或严格单 Agent 的任务,不能直接套用 Swarm 成绩。

局限

  • 官方结果自报;部分 benchmark 用内部 harness、tailored system prompts 和非公开评测。

  • K2.5 官方附录明确某些 coding 最高分来自 non-thinking;不能只看模型名推断 thinking 能力。

  • 对比模型的 effort、工具和服务稳定性不同;官方说 GPT-5.2 xhigh 有约 10% 无输出失败,被计为错误。

  • Agent Swarm 结果有独立的并行限制/上下文策略,不等于普通 Chat Completion。

复现步骤

  1. 固定 K2.5 Thinking、temperature=1、top_p=.95、context 256k 和 max tokens,保存 system prompt/工具定义。

  2. 按官方附录分别复跑无工具、工具、单 Agent、Swarm 和视觉任务;记录 avg@32/8/5 等重复策略。

  3. 对 coding 使用相同工具集和 parser,单独报告 thinking/non-thinking。

  4. 与 GPT/Claude/DeepSeek 使用同样上下文管理、超时和成本口径,对比成功率、延迟和工具错误。

能支持的判断

  • 支持理解官方能力定位和 harness 边界

不能支持的判断

  • 支持理解官方能力定位和 harness 边界;不支持把发布分数外推为第三方部署或生产成功率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Kimi Tech Blog / Visual Agentic Intelligence · Kimi / Moonshot AI · 原文发布日期 2026-01-27 · 本站编辑日期 2026-09-20

打开原始来源

Kimi K2.5

在 Tabbit 中比较 Kimi K2.5

下载 Tabbit 客户端后检查模型可用性

相关评测

Fireworks 对 Kimi K2.5 官方 API 与部署栈的质量对照Fireworks 用 Kimi 官方 API 做部署复测,指出 chat template、EOS、reasoning_content、采样和负载错误都会改变 tool-call 质量。BenchLM 对 Kimi K2.5 的公开基准账本与任务分层BenchLM 的 Kimi K2.5 动态账本汇总 Coding、Agentic、Reasoning 和 Multimodal 来源,但其总分和排名是自定义聚合。Reddit LocalLLaMA 对 Kimi K2.5 编码与部署的体验Reddit LocalLLaMA 讨论把注意力放在 Kimi K2.5 的工具定义、Agent Swarm 与本地部署差异;所谓“泄露提示词”正文不完整,应以官方 chat template 和 provider 对照复核。Kimi K2.5 的视觉编码与 Agent Swarm 任务提示Kimi 官方将 K2.5 的视觉输入、代码任务和 Agent Swarm 分解连接起来,并要求用完成检查和证据回收约束并行执行。Kimi K2.5 Thinking/Instant 与视觉工具配置Kimi 官方仓库区分 Thinking 与 Instant 的参数和视觉工具配置,提醒部署时同时核对 chat template 与 reasoning_content。