Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Kimi K2.5 · 媒体来源 · 独立测量

Fireworks 对 Kimi K2.5 官方 API 与部署栈的质量对照

Fireworks 用 Kimi 官方 API 做部署复测,指出 chat template、EOS、reasoning_content、采样和负载错误都会改变 tool-call 质量。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

来源具体观察
Fireworks 质量报告;对照 Kimi 官方 API 与 Fireworks 部署栈,具体日期未公开,任务和运行日志按报告可见范围。
已公布条件
观察包含 chat template、EOS/思考边界、reasoning_content null、采样参数和负载错误对 tool call 的影响。

关键数据与适用场景

一句话结论

Fireworks 用 Kimi 官方 API 做对照发现,生产质量不仅由模型决定:K2.5 的 chat template、EOS/思考边界、reasoning_content null、采样参数和负载错误都会改变 tool-call 结果,Fireworks 的代表性分数接近官方但存在细微差异。

测试环境

  • 对照:Kimi model card、Kimi official API measured by Fireworks、Fireworks API。

  • 质量层:prompt formatting、stream/non-stream tool calling、grammar-constrained generation、numerical correctness、超时/断开/错误码、SDK/proxy 兼容。

  • 评测层:deterministic unit tests、one-turn、agentic multi-turn、multimodal、周期回归;KVV、SWE-Agent、Terminus-2、Eval Protocol。

  • 重复:大多数结果 avg@3;Tau-Bench avg@4;SWE-Bench avg@2。

输入/配置

Fireworks 报告:SWE-Bench 使用 SWE-Agent;Terminal-Bench 2 使用 Terminus 2;AIME/MMMU/OCR/K2VV 使用 Kimi KVV。SWE-Bench Fireworks 将 max output 提高到 32k,且官方 harness 未明确 max_tokens;Terminal-Bench 强制 non-thinking。

结果数据

评测Kimi Model Card官方 API(Fireworks 测)Fireworks API
SWE-Bench76.876.876.8
Terminal-Bench 2(non-thinking)50.8未公开50.6
Tau2 Airline未公开6568
AIME 202596.195.795.0
K2VV ToolCall F1(non-thinking)84.0未公开83.9
MMMU Pro Vision77.4未公开77.9
OCRBench91.0未公开91.7

结论

Fireworks 的实测支持“正确部署可接近官方结果”,但也发现必须处理思考阶段 EOS、null reasoning_content、采样参数、空 200 响应和多轮工具调用;生产选型应评估完整 serving stack 而非只比较模型卡。

局限

  • Fireworks 具有 provider 立场,代码/修复细节与官方 KVV 结果部分依赖其自有服务。

  • 分数多为少量重复(2–4 次),不能代表所有任务方差。

  • “1/10 成本、2–3×速度”等宣传比较依赖 provider 条件,不是普遍价格/吞吐保证。

  • Terminal non-thinking、SWE custom harness 与官方 API 条件不一致,跨列比较需谨慎。

复现步骤

  1. 对同一 prompt、模型 snapshot、工具 schema、采样和 max tokens,分别调用官方 API、Fireworks 和自托管 endpoint。

  2. 运行单轮/多轮、stream/non-stream、Thinking/Instant、视觉和 grammar-constrained tool tests。

  3. 验证 chat template、reasoning_content null 过滤、EOS guard、HTTP 429/空 200、超时与重试。

  4. 按每个 harness 报告 score、调用成功率、错误类型、延迟和成本,避免用一次 SWE 分数概括部署质量。

能支持的判断

  • 支持把 provider/harness 配置纳入 K2.5 复测

不能支持的判断

  • 支持把 provider/harness 配置纳入 K2.5 复测;不支持将其代表所有云端或本地部署。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Fireworks AI · Fireworks AI · 原文发布日期 Unknown · 本站编辑日期 2026-09-20

打开原始来源

Kimi K2.5

在 Tabbit 中比较 Kimi K2.5

下载 Tabbit 客户端后检查模型可用性

相关评测

BenchLM 对 Kimi K2.5 的公开基准账本与任务分层BenchLM 的 Kimi K2.5 动态账本汇总 Coding、Agentic、Reasoning 和 Multimodal 来源,但其总分和排名是自定义聚合。Reddit LocalLLaMA 对 Kimi K2.5 编码与部署的体验Reddit LocalLLaMA 讨论把注意力放在 Kimi K2.5 的工具定义、Agent Swarm 与本地部署差异;所谓“泄露提示词”正文不完整,应以官方 chat template 和 provider 对照复核。Kimi K2.5 官方发布:多模态、Agent Swarm 与编码基准Kimi 官方发布把 K2.5 定位为视觉、编码和 Agent Swarm 模型,并公开 Thinking、工具、上下文和部分 benchmark 条件。Kimi K2.5 的视觉编码与 Agent Swarm 任务提示Kimi 官方将 K2.5 的视觉输入、代码任务和 Agent Swarm 分解连接起来,并要求用完成检查和证据回收约束并行执行。Kimi K2.5 Thinking/Instant 与视觉工具配置Kimi 官方仓库区分 Thinking 与 Instant 的参数和视觉工具配置,提醒部署时同时核对 chat template 与 reasoning_content。