Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Kimi K2.5

Kimi K2.5 官方发布:多模态、Agent Swarm 与编码基准

原始来源

Kimi Tech Blog / Visual Agentic Intelligence

作者Kimi / Moonshot AI

原文日期2026-01-27

Tabbit 整理2026-08-19

查看原文

一句话结论

官方评测将 K2.5 定位为原生视觉、编码和 Agent Swarm 模型:Thinking/工具配置、上下文和重复次数公开得较详细,但 SWE 等结果仍依赖 Moonshot 自有 harness,需与第三方部署分开看。

测试环境

  • 模型/模式:Kimi K2.5 Thinking;对比 GPT-5.2 xhigh、Claude Opus 4.5 extended thinking、Gemini 3 Pro high、DeepSeek V3.2 thinking。

  • 一般配置:Kimi temperature=1.0、top_p=0.95、context 256k;HLE/AIME/HMMT/GPQA max completion 96k。

  • 重复:AIME/HMMT avg@32、GPQA avg@8、Vision avg@3、Agentic Search Seal-0/WideSearch avg@4、coding tasks avg@5;SWE-Bench 官方附录说明不同任务使用内部 framework。

  • 工具:search、code interpreter、web browsing;HLE/Agentic Search 使用工具和上下文管理策略。

输入/配置

官方编码评测使用 bash、createfile、insert、view、strreplace、submit 等最小工具,SWE 系列用 Moonshot 内部评估框架和 tailored system prompts;Terminal-Bench 2.0 使用 Terminus-2,且在该实现中以 non-thinking 运行。

结果数据

  • HLE-Full:Thinking 30.1,无工具;工具 50.2。

  • SWE-Bench Verified:76.8;SWE-Pro:50.7;SWE Multilingual:73.0;Terminal Bench 2.0:50.8。

  • LiveCodeBench v6:85.0;PaperBench:63.5;CyberGym:41.3;SciCode:48.7。

  • BrowseComp:60.6;BrowseComp context management:74.9;Agent Swarm:78.4。

  • WideSearch:72.7;Agent Swarm:79.0;DeepSearchQA:77.1;AA-LCR:70.0;LongBench v2:61.0。

  • 视觉:MMMU-Pro 78.5、OCRBench 92.3、OmniDocBench 1.5 88.8、VideoMMMU 86.6、LongVideoBench 79.8。

结论

K2.5 的核心优势是“视觉 + 工具 + 并行 Agent”组合;对于编码、研究检索、长视频/文档和大规模可并行搜索,官方结果支持把它作为开放模型候选。没有工具或严格单 Agent 的任务,不能直接套用 Swarm 成绩。

局限

  • 官方结果自报;部分 benchmark 用内部 harness、tailored system prompts 和非公开评测。

  • K2.5 官方附录明确某些 coding 最高分来自 non-thinking;不能只看模型名推断 thinking 能力。

  • 对比模型的 effort、工具和服务稳定性不同;官方说 GPT-5.2 xhigh 有约 10% 无输出失败,被计为错误。

  • Agent Swarm 结果有独立的并行限制/上下文策略,不等于普通 Chat Completion。

复现步骤

  1. 固定 K2.5 Thinking、temperature=1、top_p=.95、context 256k 和 max tokens,保存 system prompt/工具定义。

  2. 按官方附录分别复跑无工具、工具、单 Agent、Swarm 和视觉任务;记录 avg@32/8/5 等重复策略。

  3. 对 coding 使用相同工具集和 parser,单独报告 thinking/non-thinking。

  4. 与 GPT/Claude/DeepSeek 使用同样上下文管理、超时和成本口径,对比成功率、延迟和工具错误。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Kimi K2.5

在 Tabbit 中使用并对比模型

Kimi K2.5

相关测评

媒体Fireworks AI

Fireworks 对 Kimi K2.5 官方 API 与部署栈的质量对照

媒体BenchLM2026-08-17

BenchLM 对 Kimi K2.5 的公开基准账本与任务分层

社区Reddit / r/LocalLLaMA2026-01

Reddit LocalLLaMA 对 Kimi K2.5 编码与部署的体验

Kimi K2.5

相关提示词

社区Kimi 官方技术博客与 GitHub 模型仓库2026-01-27

Kimi K2.5 的视觉编码与 Agent Swarm 任务提示

社区GitHub / MoonshotAI/Kimi-K2.5

Kimi K2.5 Thinking/Instant 与视觉工具配置