Kimi K2.7 Code

Kimi K2.7 Code · 测评与证据

Kimi K2.7 Code,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

Kimi K2.7 Code 是基于 MoE 架构(1T 总参数 / 32B 激活)的长程代码与 Agent 专用模型,原生集成 MoonViT 多模态视觉编码器与原生 INT4 量化,相较 K2.6 在保持编码能力跃升的同时降低约 30% 思考 Token 消耗。

Hugging Face / Moonshot AI 官方 Model Card · 查看证据

在严格受控的同提示词实测中,Kimi K2.7 在从零脚手架生成可运行项目(FastAPI)中因组件完整、无依赖遗漏以 53/60 击败 GLM 5.2(48/60);而在超大仓库全貌解构(Saleor)中,GLM 5.2 凭借 1M 上下文对深度细节的挖掘更胜一筹。

Unsiloed AI Engineering Blog / Reddit r/LangChain · 查看证据

在 Devin 团队针对真实软件工程任务构建的 FrontierCode Extended 独立基准中,Kimi K2.7 Code 取得 39.5% 的通过率,跻身与顶级闭源模型同台竞技的竞争梯队,在独立 UI 与自包含功能生成上表现出色,但在长序列多文件重构中受限于上下文窗口与记忆跨度。

Reddit r/windsurf / Devin.ai (Cognition) · 查看证据

完整测评与相关内容

模型深度阅读

总览 · 简体中文

Kimi K2.7 Code:它是什么、成本如何、适合谁

从官方 $4/M 输出价格、256K 多模态代码模型,到 K2.6/K3 边界和受控试用,完整梳理 Kimi K2.7 Code。

精选证据

媒体 / 基准方厂商自报

Kimi K2.7 Code:Hugging Face 官方模型规格与全量基准数据

Kimi K2.7 Code 是基于 MoE 架构(1T 总参数 / 32B 激活)的长程代码与 Agent 专用模型,原生集成 MoonViT 多模态视觉编码器与原生 INT4 量化,相较 K2.6 在保持编码能力跃升的同时降低约 30% 思考 Token 消耗。

来源Hugging Face / Moonshot AI 官方 Model Card
原文日期2026-06-12
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
Kimi-K2.7-Code;来源日期:2026-06-12。
harness/任务
基础架构:MoE 架构,共 61 层(含 1 个 Dense 层),384 个专家,每 Token 激活 8 个路由专家 + 1 个共享专家。;注意力与激活:MLA(Multi-Head Latent Attention)机制,SwiGLU 激活函数,词表大小 160K,上下文窗口 256K。
样本/缺口
局限记录:官方表格中的部分基准为 Moonshot 内部构建的评估集(如 Kimi Code Bench v2, Kimi Claw 24/7),需要结合第三方开源基准交叉验证。;强制要求保留 `reasoningcontent`,对不支持思考字段回传的第三方客户端和代理网关存在兼容门槛。
编程Agent
社区独立测量

Unsiloed 评测:Kimi K2.7 Code 与 GLM 5.2 真实代码生成与大型仓库分析受控对比

在严格受控的同提示词实测中,Kimi K2.7 在从零脚手架生成可运行项目(FastAPI)中因组件完整、无依赖遗漏以 53/60 击败 GLM 5.2(48/60);而在超大仓库全貌解构(Saleor)中,GLM 5.2 凭借 1M 上下文对深度细节的挖掘更胜一筹。

来源Unsiloed AI Engineering Blog / Reddit r/LangChain
原文日期2026-07-20
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
Kimi-K2.7-Code;来源日期:2026-07-20。
harness/任务
Kimi K2.7 Code:MoE 1T 总参数 / 32B 激活,256K 上下文,官方 API 价格 $0.95 输入 ($0.19 缓存) / $4.00 输出 每百万 Token。;GLM 5.2:MoE 744B-753B 总参数 / 40B 激活,1M 上下文,官方 API 价格 $1.40 输入 ($0.26 缓存) / $4.40 输出 每百万 Token。
样本/缺口
局限记录:该测试采用单轮零样本/少样本提示词对比,未评估多轮 Agent 自动纠错(如自运行 pytest 修复遗漏)下的最终收敛表现。;价格对比仅基于官方 API 标准定价,未计入第三方聚合平台或特定订阅计划折扣。
编程Agent
社区独立测量

Devin 团队:FrontierCode Extended 基准与长程工程任务实测表现

在 Devin 团队针对真实软件工程任务构建的 FrontierCode Extended 独立基准中,Kimi K2.7 Code 取得 39.5% 的通过率,跻身与顶级闭源模型同台竞技的竞争梯队,在独立 UI 与自包含功能生成上表现出色,但在长序列多文件重构中受限于上下文窗口与记忆跨度。

来源Reddit r/windsurf / Devin.ai (Cognition)
原文日期2026-06-24
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
Kimi-K2.7-Code;来源日期:2026-06-24。
harness/任务
评测基准:FrontierCode Extended(Devin / Cognition 团队用于衡量真实端到端软件工程任务的综合评测集)。;运行环境:Devin Desktop 与 Devin CLI 真实 Agent 执行环境。
样本/缺口
局限记录:FrontierCode Extended 包含 Devin 平台特定的 Agent 工具集与执行反馈机制,换用其他 Agent 框架(如 SWE-agent 或 Aider)可能产生不同通过率。;客户端在测试时限制了 200K 上下文,未完全发挥模型原生的 256K 潜力。
编程Agent
社区个人体验

OpenCode 社区:真实 Agent 编码成本与工具循环效率实测对比

在 OpenCode Agent 编码实测中,Kimi K2.7 Code 尽管标称 Token 单价高出 DeepSeek V4 Flash 近 7 倍,但在成功任务平均成本上却实现更低支出($0.87 vs $1.48);其核心原因在于 K2.7 工具调用决策果断、不易陷入无效反复循环,在复杂 Agent 工作流中展现出显著的“Token 消耗收敛优势”。

来源Reddit r/opencode
原文日期2026-08-04
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
Kimi-K2.7-Code;来源日期:2026-08-04。
harness/任务
测试平台:OpenCode CLI / OpenCode Go Agent 环境。;Kimi K2.7 Code:输入 $0.95 / M,输出 $4.00 / M。
样本/缺口
局限记录:成本数据高度受 Agent 框架的 Prompt 设计、系统护栏(Loop Detection)以及上下文截断策略影响;在配备了强制去重与循环拦截的高级 Harness 中,两者的成本差可能会缩小。;数据来源于社区真实开发用量统计与 LiveBench 聚合测试,存在样本分布差异。
编程Agent

全部来源

全部来源

6 / 6
媒体 / 基准方厂商自报

Kimi K2.7 Code:Hugging Face 官方模型规格与全量基准数据

Kimi K2.7 Code 是基于 MoE 架构(1T 总参数 / 32B 激活)的长程代码与 Agent 专用模型,原生集成 MoonViT 多模态视觉编码器与原生 INT4 量化,相较 K2.6 在保持编码能力跃升的同时降低约 30% 思考 Token 消耗。

来源Hugging Face / Moonshot AI 官方 Model Card
原文日期2026-06-12
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
Kimi-K2.7-Code;来源日期:2026-06-12。
harness/任务
基础架构:MoE 架构,共 61 层(含 1 个 Dense 层),384 个专家,每 Token 激活 8 个路由专家 + 1 个共享专家。;注意力与激活:MLA(Multi-Head Latent Attention)机制,SwiGLU 激活函数,词表大小 160K,上下文窗口 256K。
样本/缺口
局限记录:官方表格中的部分基准为 Moonshot 内部构建的评估集(如 Kimi Code Bench v2, Kimi Claw 24/7),需要结合第三方开源基准交叉验证。;强制要求保留 `reasoningcontent`,对不支持思考字段回传的第三方客户端和代理网关存在兼容门槛。
编程Agent
社区独立测量

Unsiloed 评测:Kimi K2.7 Code 与 GLM 5.2 真实代码生成与大型仓库分析受控对比

在严格受控的同提示词实测中,Kimi K2.7 在从零脚手架生成可运行项目(FastAPI)中因组件完整、无依赖遗漏以 53/60 击败 GLM 5.2(48/60);而在超大仓库全貌解构(Saleor)中,GLM 5.2 凭借 1M 上下文对深度细节的挖掘更胜一筹。

来源Unsiloed AI Engineering Blog / Reddit r/LangChain
原文日期2026-07-20
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
Kimi-K2.7-Code;来源日期:2026-07-20。
harness/任务
Kimi K2.7 Code:MoE 1T 总参数 / 32B 激活,256K 上下文,官方 API 价格 $0.95 输入 ($0.19 缓存) / $4.00 输出 每百万 Token。;GLM 5.2:MoE 744B-753B 总参数 / 40B 激活,1M 上下文,官方 API 价格 $1.40 输入 ($0.26 缓存) / $4.40 输出 每百万 Token。
样本/缺口
局限记录:该测试采用单轮零样本/少样本提示词对比,未评估多轮 Agent 自动纠错(如自运行 pytest 修复遗漏)下的最终收敛表现。;价格对比仅基于官方 API 标准定价,未计入第三方聚合平台或特定订阅计划折扣。
编程Agent
社区独立测量

Devin 团队:FrontierCode Extended 基准与长程工程任务实测表现

在 Devin 团队针对真实软件工程任务构建的 FrontierCode Extended 独立基准中,Kimi K2.7 Code 取得 39.5% 的通过率,跻身与顶级闭源模型同台竞技的竞争梯队,在独立 UI 与自包含功能生成上表现出色,但在长序列多文件重构中受限于上下文窗口与记忆跨度。

来源Reddit r/windsurf / Devin.ai (Cognition)
原文日期2026-06-24
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
Kimi-K2.7-Code;来源日期:2026-06-24。
harness/任务
评测基准:FrontierCode Extended(Devin / Cognition 团队用于衡量真实端到端软件工程任务的综合评测集)。;运行环境:Devin Desktop 与 Devin CLI 真实 Agent 执行环境。
样本/缺口
局限记录:FrontierCode Extended 包含 Devin 平台特定的 Agent 工具集与执行反馈机制,换用其他 Agent 框架(如 SWE-agent 或 Aider)可能产生不同通过率。;客户端在测试时限制了 200K 上下文,未完全发挥模型原生的 256K 潜力。
编程Agent
社区个人体验

OpenCode 社区:真实 Agent 编码成本与工具循环效率实测对比

在 OpenCode Agent 编码实测中,Kimi K2.7 Code 尽管标称 Token 单价高出 DeepSeek V4 Flash 近 7 倍,但在成功任务平均成本上却实现更低支出($0.87 vs $1.48);其核心原因在于 K2.7 工具调用决策果断、不易陷入无效反复循环,在复杂 Agent 工作流中展现出显著的“Token 消耗收敛优势”。

来源Reddit r/opencode
原文日期2026-08-04
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
Kimi-K2.7-Code;来源日期:2026-08-04。
harness/任务
测试平台:OpenCode CLI / OpenCode Go Agent 环境。;Kimi K2.7 Code:输入 $0.95 / M,输出 $4.00 / M。
样本/缺口
局限记录:成本数据高度受 Agent 框架的 Prompt 设计、系统护栏(Loop Detection)以及上下文截断策略影响;在配备了强制去重与循环拦截的高级 Harness 中,两者的成本差可能会缩小。;数据来源于社区真实开发用量统计与 LiveBench 聚合测试,存在样本分布差异。
编程Agent
社区个人体验

Reddit 社区:Kimi K2.7 Code 与 K2.6/K2.5 的选型边界

这篇帖子可复用的价值是建立模型分工假设,而不是证明 K2.7 Code 在现实任务中必胜:编码专用模型承担仓库任务,K2.6 处理泛用多模态 Agent,K2.5 负责低成本普通工作,并用缓存控制重复上下文成本。

来源Reddit,r/kimi
原文日期未知
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
Kimi-K2.7-Code;来源日期:2026-08-18。
harness/任务
文章作者主动澄清:这是基于 Kimi/Moonshot 官方页面的文档拆解,不是 hands-on benchmark。;比较对象:K2.7 Code、K2.6、K2.5 与 Moonshot V1;没有统一任务集和运行日志。
样本/缺口
局限记录:“K2.7 Code 更适合完整仓库”是选型建议,没有实测通过率、延迟或错误样本。;不能把“输出 token 更贵”解释为所有 provider 的统一账单规则。
编程Agent
社区个人体验

Reddit 社区:Harness 适配陷阱与思维链传递失效实操分析

社区开发者反馈 Kimi K2.7 在部分第三方客户端中出现“中途无故中断、陷入重复读文件死循环、编译破坏”等负面体验,深度排查表明根本原因在于客户端未正确处理 `reasoningcontent` 的上下文回传与缓存对齐,将特定框架的适配缺陷误判为模型能力劣化。

来源Reddit r/kimi
原文日期2026-06-23
采集2026-09-20

待验证:本次未能重新核实原文。

模型/版本
Kimi-K2.7-Code;来源日期:2026-06-23。
harness/任务
问题客户端环境:Allegreto、自建简易 Agent 循环、未适配 Kimi 思维链回传协议的通用代理网关。;涉及开发栈:React 前端、C 后端工程。
样本/缺口
局限记录:该贴反映的是模型发布初期第三方生态尚未完全适配 Kimi 新协议时的真实踩坑记录,具有很高的避坑指导价值,但不能代表模型在标准环境下的真实上限。
编程Agent

Kimi K2.7 Code

在 Tabbit 中比较 Kimi K2.7 Code

客户端中的模型、功能和权限以当前账户为准。