Kimi 官方发布把 K2.5 定位为视觉、编码和 Agent Swarm 模型,并公开 Thinking、工具、上下文和部分 benchmark 条件。
Kimi Tech Blog / Visual Agentic Intelligence · 查看证据Kimi K2.5 · 测评与证据
Kimi K2.5,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
Fireworks 用 Kimi 官方 API 做部署复测,指出 chat template、EOS、reasoning_content、采样和负载错误都会改变 tool-call 质量。
Fireworks AI · 查看证据BenchLM 的 Kimi K2.5 动态账本汇总 Coding、Agentic、Reasoning 和 Multimodal 来源,但其总分和排名是自定义聚合。
BenchLM · 查看证据精选证据
Kimi K2.5 官方发布:多模态、Agent Swarm 与编码基准
Kimi 官方发布把 K2.5 定位为视觉、编码和 Agent Swarm 模型,并公开 Thinking、工具、上下文和部分 benchmark 条件。
- 来源具体观察
- 2026-01-27 Kimi/Moonshot 官方发布;视觉、编码、Agent Swarm 与 Thinking/工具配置。
- 已公布条件
- 官方结果依赖 Moonshot 自有 harness,部分 benchmark 的 prompt、重复次数和独立复测不可得。
Fireworks 对 Kimi K2.5 官方 API 与部署栈的质量对照
Fireworks 用 Kimi 官方 API 做部署复测,指出 chat template、EOS、reasoning_content、采样和负载错误都会改变 tool-call 质量。
待验证:本次未能重新核实原文。
- 来源具体观察
- Fireworks 质量报告;对照 Kimi 官方 API 与 Fireworks 部署栈,具体日期未公开,任务和运行日志按报告可见范围。
- 已公布条件
- 观察包含 chat template、EOS/思考边界、reasoning_content null、采样参数和负载错误对 tool call 的影响。
BenchLM 对 Kimi K2.5 的公开基准账本与任务分层
BenchLM 的 Kimi K2.5 动态账本汇总 Coding、Agentic、Reasoning 和 Multimodal 来源,但其总分和排名是自定义聚合。
待验证:本次未能重新核实原文。
- 来源具体观察
- 数据截至 2026-08-17;BenchLM 账本按 Coding、Agentic、Reasoning、Multimodal 分层。
- 已公布条件
- 页面聚合多个公开 benchmark,原始模型、工具模式和上下文策略并不统一。
全部来源
全部来源
Kimi K2.5 官方发布:多模态、Agent Swarm 与编码基准
Kimi 官方发布把 K2.5 定位为视觉、编码和 Agent Swarm 模型,并公开 Thinking、工具、上下文和部分 benchmark 条件。
- 来源具体观察
- 2026-01-27 Kimi/Moonshot 官方发布;视觉、编码、Agent Swarm 与 Thinking/工具配置。
- 已公布条件
- 官方结果依赖 Moonshot 自有 harness,部分 benchmark 的 prompt、重复次数和独立复测不可得。
Fireworks 对 Kimi K2.5 官方 API 与部署栈的质量对照
Fireworks 用 Kimi 官方 API 做部署复测,指出 chat template、EOS、reasoning_content、采样和负载错误都会改变 tool-call 质量。
待验证:本次未能重新核实原文。
- 来源具体观察
- Fireworks 质量报告;对照 Kimi 官方 API 与 Fireworks 部署栈,具体日期未公开,任务和运行日志按报告可见范围。
- 已公布条件
- 观察包含 chat template、EOS/思考边界、reasoning_content null、采样参数和负载错误对 tool call 的影响。
BenchLM 对 Kimi K2.5 的公开基准账本与任务分层
BenchLM 的 Kimi K2.5 动态账本汇总 Coding、Agentic、Reasoning 和 Multimodal 来源,但其总分和排名是自定义聚合。
待验证:本次未能重新核实原文。
- 来源具体观察
- 数据截至 2026-08-17;BenchLM 账本按 Coding、Agentic、Reasoning、Multimodal 分层。
- 已公布条件
- 页面聚合多个公开 benchmark,原始模型、工具模式和上下文策略并不统一。
Reddit LocalLLaMA 对 Kimi K2.5 编码与部署的体验
Reddit LocalLLaMA 讨论把注意力放在 Kimi K2.5 的工具定义、Agent Swarm 与本地部署差异;所谓“泄露提示词”正文不完整,应以官方 chat template 和 provider 对照复核。
待验证:本次未能重新核实原文。
- 来源具体观察
- Kimi K2.5;来源日期 2026-01;以 Reddit / r/LocalLLaMA 的公开观察为准。
- 已公布条件
- 采集日期 2026-09-20;“Reddit LocalLLaMA 对 Kimi K2.5 编码与部署的体验”的样本和 harness 不代表所有部署。