Kimi K2.6 是 Moonshot 面向通用任务的多模态模型,定位包括长链路编程、图片与视频理解、工具调用和 Agent 工作流。原生 API 使用 kimi-k2.6,官方指南列出文本、图片、视频输入,以及思考和非思考模式。它不是 Kimi K2.7 Code,也不是 Kimi K3 的低价别名。
最值得作为决策锚点的是一个容易被误读的数字:Moonshot 称 K2.6 Agent 在本地部署 Qwen3.5-0.8B 的案例中连续运行超过 12 小时,完成 4,000 多次工具调用,并把吞吐从约 15 提高到约 193 token/s。这说明它瞄准的是长时间、多步骤任务,但不是你的 harness 会复现的时延或成功率。先看 Kimi K2.6 模型页,再核对真实账户中的路线。
先看结论
需要长上下文、视觉输入、视频或工具的通用 Agent,可以从 K2.6 开始试。
原生 API 使用
kimi-k2.6,记录思考模式、工具调用和 token 用量。主要任务是仓库实现时,比较编码专用的 K2.7 Code。
需要 K3 的旗舰能力或 1M 上下文时,单独评估 K3。
4,000 次调用案例和厂商 benchmark 只是待验证假设,不是生产保证。
长任务必须使用固定仓库、最小权限、停止条件和回滚点。
Kimi K2.6 规格一览
| 项目 | 2026-09-20 核对内容 | 实际边界 |
|---|---|---|
| 原生模型 ID | kimi-k2.6 | 供应商别名可能不同。 |
| 定位 | 通用多模态 Agent 模型 | K2.7 Code 是独立的编码路线。 |
| 上下文 | 指南为 256K,价格表为 262,144 | 仍需确认客户端有效上限。 |
| 输入 | 原生指南列出文本、图片、视频 | 供应商可能不开放全部模态。 |
| 模式 | 思考与非思考 | token 用量和行为会变化。 |
| API 价格 | 缓存命中输入 $0.16/M,未命中 $0.95/M,输出 $4/M | 税费、工具、重试和供应商条款另算。 |
| 开放权重 | modified-MIT、原生 INT4、vLLM/SGLang/KTransformers | 仍需核对硬件、吞吐和许可。 |
什么是 Agent 浏览器可帮助区分浏览器会话与模型 API。产品层面可参考 AI 浏览器比较 和 Tabbit Browser 实践,再给 Agent 写入权限。
它到底是什么
Moonshot 将 K2.6 定位为比 K2.5 更擅长长时间代码编写、指令遵循、自我修正和自主 Agent 执行的通用模型。模型卡列出 1T 总参数、32B 激活参数、384 个专家、每 token 选择 8 个专家、MLA 注意力、400M MoonViT 视觉编码器和 256K 上下文。官方 API 指南还给出了图片和视频调用示例。
这些资料能回答“它是什么”,不能回答“它一定能修好我的仓库”。4,000 次调用案例之所以有用,是因为它包含了小众语言、反复 profiling 和 14 次迭代;也正因此,工具状态、验收标准和停止条件比单轮演示更重要。测试时记录 ID、模式、工具、输入/输出 token、重试和人工修正。
相对 K2.5 的变化
| 方向 | K2.6 的公开信息 | 试点应验证什么 |
|---|---|---|
| 长链路编程 | 官方称覆盖 Rust、Go、Python、前端、DevOps 和性能优化 | 多次编辑后能否保持架构一致? |
| 多模态 | 原生指南支持文本、图片和视频 | 选定供应商是否真的开放相同输入? |
| Agent Swarm | 发布材料称可扩展到 300 个子 Agent、4,000 个协同步骤 | harness 能否限制扇出、费用和权限? |
| 持续执行 | 官方展示持续数天的主动 Agent | 工具失败、循环或上下文增长时如何停止? |
| 设计驱动编程 | 官方展示视觉和轻量全栈工作流 | 结果是否同时通过视觉和功能验收? |
Kimi K2.7 Code 总览覆盖编码专用兄弟模型。K2.7 Code 有独立 ID、强制思考和 highspeed 价格,不是 K2.6 的价格捷径。Kimi K3 价格指南则负责 K3 的 1M 上下文、缓存写入和订阅/API 区分。
benchmark 应该怎样读
Moonshot 发布页报告 K2.6 在 SWE-Bench Pro 为 58.6、Terminal-Bench 2.0 为 66.7、HLE with tools 为 54.0、BrowseComp 为 83.2、DeepSearchQA F1 为 92.5、OSWorld-Verified 为 73.1、LiveCodeBench v6 为 89.6。Hugging Face 卡片还列出 SWE-Bench Verified 80.2、SWE-Bench Multilingual 76.7、Toolathlon 50.0 等结果。
这些数字使用不同任务、工具、版本和评测方。CodingFleet 的比较指出,Kimi 与 GLM-5.1 的 SWE-Bench Pro 是 58.6 对 58.4,0.2 分差距不该决定产品策略。Artificial Analysis 的独立页面则提醒 K2.6 在其快照中输出速度约 35.8 token/s,回答偏慢且偏长;页面目前标记为 deprecated,只继续更新默认 10K 输入工作负载。具体条件应看 Kimi reviews,不要把它们合成一个总分。
比较稳妥的结论是:K2.6 值得作为长上下文、多模态和 Agent 编程候选测试,但 benchmark 不能证明通用胜出、固定延迟或你的 harness 成功率。
获取方式不要混淆
Moonshot API:选择
kimi-k2.6,记录缓存命中、思考模式、工具调用和输出 token。Kimi.ai、Kimi App、Kimi Code:官方列为可用入口,但订阅额度和 CLI 配额不是 API token 账单。
开放权重:按 Hugging Face 卡片使用合适引擎,单独检查 modified-MIT、显存和量化质量。
托管供应商:模型 ID、价格、模态、数据政策和 fallback 可能不同。DeepInfra 页面明确列出自己的费率,并称其 API 不开放图片输入。
Tabbit Browser:是否可用是账户级产品事实,不由公开模型卡自动推导。
官方 API 页的图片、视频和工具示例适合用于复现可控任务,但不要复制第三方系统提示词,也不要假设每个网关都保留相同字段。任务设计可同时参考浏览器自动化指南和Kimi prompts 资源。
社区证据与风险
一篇 r/kimi 负面案例描述了中国交通法规谜题:作者称 K2.6 思考 27 分钟后开始搜索相关谜题,超过 10 次,32 分钟后仍未回答。它提醒我们要测试工具循环和配额消耗,不代表每个推理任务都会失败。
另一篇模型比较讨论中,有人认为 Kimi 更适合多模态前端,有人偏好 GLM 的文本/后端表现,也有人建议在带版本控制的真实项目里比较。它们没有共同 fixture、harness 或锁定版本。
| 场景 | 第一个可回滚测试 | 验收 |
|---|---|---|
| 仓库修改 | 小问题、固定测试、临时分支 | diff 有限、测试通过、工具按计划停止。 |
| 截图转代码 | 公开 mockup 和视觉清单 | 布局、交互和素材分开验收。 |
| 视频理解 | 有已知事件的短视频 | 每项结论指向时间戳,未知项保留。 |
| Agent Swarm | 先限制为两三个子任务 | 扇出、权限和总 token 有上限。 |
| 长文研究 | 有日期的语料和引用格式 | 同时检查召回、引用和停止条件。 |
主要未知项是供应商一致性、长循环成本、冗长输出、本地吞吐、中英文任务差异和数据合规。256K 上下文不保证每个 token 都能被连贯使用;开放权重也不是硬件报价。
Tabbit 能证明什么
本文没有运行已认证的 Kimi K2.6 Tabbit 任务,也没有 4–8 张合格截图。因此不对 Tabbit 的实时选择器、配额、延迟、有效上下文、供应商路线或 K2.6 质量作结论。若账户显示该模型,先用公开图片或可丢弃仓库做小任务,要求引用并逐项验收;首次不要上传机密代码或授予广泛写权限。
结论
Kimi K2.6 是值得试点的通用路线,适合长上下文编程、多模态任务和工具驱动 Agent。4,000 次调用案例说明了长时间执行的目标,但仍是厂商展示。需要控制模式和用量时使用原生 kimi-k2.6;仓库实现优先比较 K2.7 Code,需要旗舰上下文和经济模型时再看 K3。最终用可回滚 fixture,而不是榜单标题做决定。
来源
常见问题
Kimi K2.6 是什么?
Kimi K2.6 是 Moonshot 的通用多模态 Agent 模型,API 名称为 `kimi-k2.6`。官方指南列出文本、图片和视频输入、思考与非思考模式、工具调用以及 256K 上下文。
Kimi K2.6 最值得关注的能力是什么?
Moonshot 发布案例称模型连续运行超过 12 小时并完成 4,000 多次工具调用。这是厂商展示的长链路执行案例,不是你的项目必然获得的时延、成功率或运行时保证。
Kimi K2.6 多少钱?
2026 年 9 月 20 日核对的原生 Kimi API 表格列出缓存命中输入每百万 0.16 美元、未命中 0.95 美元、输出 4 美元,并列出 262,144 token 上下文。税费、供应商加价、工具费用和订阅计划另算。
它和 K2.7 Code、K3 一样吗?
不一样。K2.6 是通用路线;K2.7 Code 是强制思考的编码专用路线;K3 是拥有独立 1M 上下文和价格体系的新旗舰。不能把它们的 benchmark 或价格直接套到 K2.6。
如何获取 Kimi K2.6?
Moonshot 表示 K2.6 可通过 Kimi.ai、Kimi App、原生 API 和 Kimi Code 使用。Hugging Face 也提供 modified-MIT 权重和部署路径,但供应商可能暴露不同模态、价格和限制。
能在 Tabbit 使用 Kimi K2.6 吗?
本文没有执行已认证的 Kimi K2.6 Tabbit 任务。请查看实时模型选择器和账户条款,再用可回滚的小任务验证,不要预先假设模型、配额、延迟或能力可用。