Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Kimi K2.5 · 媒体来源 · 独立测量

BenchLM 对 Kimi K2.5 的公开基准账本与任务分层

BenchLM 的 Kimi K2.5 动态账本汇总 Coding、Agentic、Reasoning 和 Multimodal 来源,但其总分和排名是自定义聚合。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

来源具体观察
数据截至 2026-08-17;BenchLM 账本按 Coding、Agentic、Reasoning、Multimodal 分层。
已公布条件
页面聚合多个公开 benchmark,原始模型、工具模式和上下文策略并不统一。

关键数据与适用场景

一句话结论

BenchLM 的动态账本显示 Kimi K2.5 在 Coding、Agentic、Reasoning、Multimodal 等多类基准有公开来源,但总分/排名是自定义聚合,复核时应按原始 benchmark、工具模式和上下文策略逐项比较。

测试环境

  • 页面状态:数据截至 2026-08-17;页面显示 21 条 source-displayable rows(动态目录会更新)。

  • 证据:Benchmark exact、Provider exact、Secondary exact 混合;页面包含 SWE-Bench、Terminal-Bench、BrowseComp、MMMU、GPQA 等。

  • 聚合:页面自定义类别分数/权重与总排名,不是一个统一运行。

输入/配置

条目来自 Kimi model card、Fireworks、SWE/Terminal/AA 等 leaderboard;不同 benchmark 的 Thinking、工具、上下文和重复次数不同。使用时优先打开逐行来源,固定 K2.5 snapshot、模式、parser 和 harness。

结果数据

页面可见代表性结果包括:SWE-Bench Verified 76.8%、SWE-Bench Pro 50.7%、SWE Multilingual 73.0%、Terminal-Bench 2.0 50.8%、BrowseComp 60.6%、BrowseComp(context management)74.9%、Agent Swarm 78.4%、MMMU-Pro 78.5%、LongBench v2 61.0%、AA-LCR 70.0%。

结论

K2.5 的任务优势集中在多模态、Agentic Search、视觉文档和可并行编码;context management、Thinking/non-thinking 和 Swarm 是否启用会显著改变分数,必须按目标产品复跑。

局限

  • BenchLM 总分和排名受自定义权重、目录更新和来源混合影响,不能替代原始指标。

  • Kimi 官方数值有内部 prompt/harness 和独立 Swarm 配置;不同来源之间不一定可直接比较。

  • 部分结果来自 provider/二手来源,证据等级必须跟随每一行记录。

复现步骤

  1. 先选择目标任务:编码、视觉、搜索、办公、长上下文或 Swarm。

  2. 逐项锁定模型模式、temperature/top_p、工具、context management、最大步骤和重复次数。

  3. 保存原始 prompt、输入媒体、工具轨迹、输出、score、成本和失败样本。

  4. 与至少一个对照模型同 harness 复跑,并将 BenchLM 页面仅作为索引/交叉核对。

能支持的判断

  • 支持按原始 benchmark 分层比较

不能支持的判断

  • 支持按原始 benchmark 分层比较;不支持把 BenchLM 总分当作统一受控排名或当前价格。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

BenchLM · BenchLM · 原文发布日期 2026-08-17 · 本站编辑日期 2026-09-20

打开原始来源

Kimi K2.5

在 Tabbit 中比较 Kimi K2.5

下载 Tabbit 客户端后检查模型可用性

相关评测

Fireworks 对 Kimi K2.5 官方 API 与部署栈的质量对照Fireworks 用 Kimi 官方 API 做部署复测,指出 chat template、EOS、reasoning_content、采样和负载错误都会改变 tool-call 质量。Reddit LocalLLaMA 对 Kimi K2.5 编码与部署的体验Reddit LocalLLaMA 讨论把注意力放在 Kimi K2.5 的工具定义、Agent Swarm 与本地部署差异;所谓“泄露提示词”正文不完整,应以官方 chat template 和 provider 对照复核。Kimi K2.5 官方发布:多模态、Agent Swarm 与编码基准Kimi 官方发布把 K2.5 定位为视觉、编码和 Agent Swarm 模型,并公开 Thinking、工具、上下文和部分 benchmark 条件。Kimi K2.5 的视觉编码与 Agent Swarm 任务提示Kimi 官方将 K2.5 的视觉输入、代码任务和 Agent Swarm 分解连接起来,并要求用完成检查和证据回收约束并行执行。Kimi K2.5 Thinking/Instant 与视觉工具配置Kimi 官方仓库区分 Thinking 与 Instant 的参数和视觉工具配置,提醒部署时同时核对 chat template 与 reasoning_content。