Kimi K2.5 模型测评导航
汇总 Kimi K2.5 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。
媒体
3 条已核对来源的资料Kimi K2.5 官方发布:多模态、Agent Swarm 与编码基准
官方评测将 K2.5 定位为原生视觉、编码和 Agent Swarm 模型:Thinking/工具配置、上下文和重复次数公开得较详细,但 SWE 等结果仍依赖 Moonshot 自有 harness,需与第三方部署分开看。
Fireworks 对 Kimi K2.5 官方 API 与部署栈的质量对照
Fireworks 用 Kimi 官方 API 做对照发现,生产质量不仅由模型决定:K2.5 的 chat template、EOS/思考边界、reasoningcontent null、采样参数和负载错误都会改变 tool-call 结果,Fireworks 的代表性分数接近官方但存在细微差异。
BenchLM 对 Kimi K2.5 的公开基准账本与任务分层
BenchLM 的动态账本显示 Kimi K2.5 在 Coding、Agentic、Reasoning、Multimodal 等多类基准有公开来源,但总分/排名是自定义聚合,复核时应按原始 benchmark、工具模式和上下文策略逐项比较。
社区
1 条已核对来源的资料Kimi K2.5
在 Tabbit 中使用并对比模型
汇总 Kimi K2.5 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。