Kimi K2.5

Kimi K2.5 · 测评与证据

Kimi K2.5,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

Fireworks 用 Kimi 官方 API 做部署复测,指出 chat template、EOS、reasoning_content、采样和负载错误都会改变 tool-call 质量。

Fireworks AI · 查看证据

BenchLM 的 Kimi K2.5 动态账本汇总 Coding、Agentic、Reasoning 和 Multimodal 来源,但其总分和排名是自定义聚合。

BenchLM · 查看证据

精选证据

官方厂商自报

Kimi K2.5 官方发布:多模态、Agent Swarm 与编码基准

Kimi 官方发布把 K2.5 定位为视觉、编码和 Agent Swarm 模型,并公开 Thinking、工具、上下文和部分 benchmark 条件。

来源Kimi Tech Blog / Visual Agentic Intelligence
原文日期2026-01-27
采集2026-09-20
来源具体观察
2026-01-27 Kimi/Moonshot 官方发布;视觉、编码、Agent Swarm 与 Thinking/工具配置。
已公布条件
官方结果依赖 Moonshot 自有 harness,部分 benchmark 的 prompt、重复次数和独立复测不可得。
编程Agent
媒体 / 基准方独立测量

Fireworks 对 Kimi K2.5 官方 API 与部署栈的质量对照

Fireworks 用 Kimi 官方 API 做部署复测,指出 chat template、EOS、reasoning_content、采样和负载错误都会改变 tool-call 质量。

来源Fireworks AI
原文日期未知
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
Fireworks 质量报告;对照 Kimi 官方 API 与 Fireworks 部署栈,具体日期未公开,任务和运行日志按报告可见范围。
已公布条件
观察包含 chat template、EOS/思考边界、reasoning_content null、采样参数和负载错误对 tool call 的影响。
能力
媒体 / 基准方独立测量

BenchLM 对 Kimi K2.5 的公开基准账本与任务分层

BenchLM 的 Kimi K2.5 动态账本汇总 Coding、Agentic、Reasoning 和 Multimodal 来源,但其总分和排名是自定义聚合。

来源BenchLM
原文日期2026-08-17
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
数据截至 2026-08-17;BenchLM 账本按 Coding、Agentic、Reasoning、Multimodal 分层。
已公布条件
页面聚合多个公开 benchmark,原始模型、工具模式和上下文策略并不统一。
能力

全部来源

全部来源

4 / 4
官方厂商自报

Kimi K2.5 官方发布:多模态、Agent Swarm 与编码基准

Kimi 官方发布把 K2.5 定位为视觉、编码和 Agent Swarm 模型,并公开 Thinking、工具、上下文和部分 benchmark 条件。

来源Kimi Tech Blog / Visual Agentic Intelligence
原文日期2026-01-27
采集2026-09-20
来源具体观察
2026-01-27 Kimi/Moonshot 官方发布;视觉、编码、Agent Swarm 与 Thinking/工具配置。
已公布条件
官方结果依赖 Moonshot 自有 harness,部分 benchmark 的 prompt、重复次数和独立复测不可得。
编程Agent
媒体 / 基准方独立测量

Fireworks 对 Kimi K2.5 官方 API 与部署栈的质量对照

Fireworks 用 Kimi 官方 API 做部署复测,指出 chat template、EOS、reasoning_content、采样和负载错误都会改变 tool-call 质量。

来源Fireworks AI
原文日期未知
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
Fireworks 质量报告;对照 Kimi 官方 API 与 Fireworks 部署栈,具体日期未公开,任务和运行日志按报告可见范围。
已公布条件
观察包含 chat template、EOS/思考边界、reasoning_content null、采样参数和负载错误对 tool call 的影响。
能力
媒体 / 基准方独立测量

BenchLM 对 Kimi K2.5 的公开基准账本与任务分层

BenchLM 的 Kimi K2.5 动态账本汇总 Coding、Agentic、Reasoning 和 Multimodal 来源,但其总分和排名是自定义聚合。

来源BenchLM
原文日期2026-08-17
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
数据截至 2026-08-17;BenchLM 账本按 Coding、Agentic、Reasoning、Multimodal 分层。
已公布条件
页面聚合多个公开 benchmark,原始模型、工具模式和上下文策略并不统一。
能力
社区个人体验

Reddit LocalLLaMA 对 Kimi K2.5 编码与部署的体验

Reddit LocalLLaMA 讨论把注意力放在 Kimi K2.5 的工具定义、Agent Swarm 与本地部署差异;所谓“泄露提示词”正文不完整,应以官方 chat template 和 provider 对照复核。

来源Reddit / r/LocalLLaMA
原文日期2026-01
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
Kimi K2.5;来源日期 2026-01;以 Reddit / r/LocalLLaMA 的公开观察为准。
已公布条件
采集日期 2026-09-20;“Reddit LocalLLaMA 对 Kimi K2.5 编码与部署的体验”的样本和 harness 不代表所有部署。
能力

Kimi K2.5

在 Tabbit 中比较 Kimi K2.5

客户端中的模型、功能和权限以当前账户为准。