Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Kimi K2.5

BenchLM 对 Kimi K2.5 的公开基准账本与任务分层

原始来源

BenchLM

作者BenchLM

原文日期2026-08-17

Tabbit 整理2026-08-19

查看原文

一句话结论

BenchLM 的动态账本显示 Kimi K2.5 在 Coding、Agentic、Reasoning、Multimodal 等多类基准有公开来源,但总分/排名是自定义聚合,复核时应按原始 benchmark、工具模式和上下文策略逐项比较。

测试环境

  • 页面状态:数据截至 2026-08-17;页面显示 21 条 source-displayable rows(动态目录会更新)。

  • 证据:Benchmark exact、Provider exact、Secondary exact 混合;页面包含 SWE-Bench、Terminal-Bench、BrowseComp、MMMU、GPQA 等。

  • 聚合:页面自定义类别分数/权重与总排名,不是一个统一运行。

输入/配置

条目来自 Kimi model card、Fireworks、SWE/Terminal/AA 等 leaderboard;不同 benchmark 的 Thinking、工具、上下文和重复次数不同。使用时优先打开逐行来源,固定 K2.5 snapshot、模式、parser 和 harness。

结果数据

页面可见代表性结果包括:SWE-Bench Verified 76.8%、SWE-Bench Pro 50.7%、SWE Multilingual 73.0%、Terminal-Bench 2.0 50.8%、BrowseComp 60.6%、BrowseComp(context management)74.9%、Agent Swarm 78.4%、MMMU-Pro 78.5%、LongBench v2 61.0%、AA-LCR 70.0%。

结论

K2.5 的任务优势集中在多模态、Agentic Search、视觉文档和可并行编码;context management、Thinking/non-thinking 和 Swarm 是否启用会显著改变分数,必须按目标产品复跑。

局限

  • BenchLM 总分和排名受自定义权重、目录更新和来源混合影响,不能替代原始指标。

  • Kimi 官方数值有内部 prompt/harness 和独立 Swarm 配置;不同来源之间不一定可直接比较。

  • 部分结果来自 provider/二手来源,证据等级必须跟随每一行记录。

复现步骤

  1. 先选择目标任务:编码、视觉、搜索、办公、长上下文或 Swarm。

  2. 逐项锁定模型模式、temperature/top_p、工具、context management、最大步骤和重复次数。

  3. 保存原始 prompt、输入媒体、工具轨迹、输出、score、成本和失败样本。

  4. 与至少一个对照模型同 harness 复跑,并将 BenchLM 页面仅作为索引/交叉核对。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Kimi K2.5

在 Tabbit 中使用并对比模型

Kimi K2.5

相关测评

媒体Kimi Tech Blog / Visual Agentic Intelligence2026-01-27

Kimi K2.5 官方发布:多模态、Agent Swarm 与编码基准

媒体Fireworks AI

Fireworks 对 Kimi K2.5 官方 API 与部署栈的质量对照

社区Reddit / r/LocalLLaMA2026-01

Reddit LocalLLaMA 对 Kimi K2.5 编码与部署的体验

Kimi K2.5

相关提示词

社区Kimi 官方技术博客与 GitHub 模型仓库2026-01-27

Kimi K2.5 的视觉编码与 Agent Swarm 任务提示

社区GitHub / MoonshotAI/Kimi-K2.5

Kimi K2.5 Thinking/Instant 与视觉工具配置