在 Devin 团队针对真实软件工程任务构建的 FrontierCode Extended 独立基准中,Kimi K2.7 Code 取得 39.5% 的通过率,跻身与顶级闭源模型同台竞技的竞争梯队,在独立 UI 与自包含功能生成上表现出色,但在长序列多文件重构中受限于上下文窗口与记忆跨度。
评测基准:FrontierCode Extended(Devin / Cognition 团队用于衡量真实端到端软件工程任务的综合评测集)。
运行环境:Devin Desktop 与 Devin CLI 真实 Agent 执行环境。
模型对比组:Claude Opus 4.8、GPT-5.5、GLM 5.2、Kimi K2.7 Code。
客户端限制:Devin 客户端在实测期间对 K2.7 / GLM 5.2 分配的上下文上限约为 200K tokens。
FrontierCode Extended 官方发布成绩(通过率):
| 模型 | 模型类型 | FrontierCode Extended 成绩 |
|---|---|---|
| Claude Opus 4.8 | 闭源前沿旗舰 | 51.8% |
| GPT-5.5 | 闭源前沿旗舰 | 44.8% |
| GLM 5.2 | 开源权重 MoE | 43.0% |
| Kimi K2.7 Code | 开源权重 MoE | 39.5% |
社区开发者在真实工程中的反馈分布:
自包含功能 / UI 任务:Kimi K2.7 生成速度极快,响应敏捷,代码直接可用度高。
大型长程重构(>15 个文件连续修改):当 Agent 需要在处理第 915 个文件时保持对前 18 个文件修改状态的精确记忆时,表现出现衰减。
开源模型进入第一梯队:Kimi K2.7 Code(39.5%)与 GLM 5.2(43.0%)在真实复杂工程任务上展现出了接近顶级闭源模型(GPT-5.5 44.8%)的解决能力。
任务适用分水岭:
高胜率场景:单功能完整开发、独立模块重构、UI/前端页面实现、单元测试补全。
挑战场景:涉及 15 个以上关联文件的长程级联重构、跨多仓库依赖同步修改。
FrontierCode Extended 包含 Devin 平台特定的 Agent 工具集与执行反馈机制,换用其他 Agent 框架(如 SWE-agent 或 Aider)可能产生不同通过率。
客户端在测试时限制了 200K 上下文,未完全发挥模型原生的 256K 潜力。
在 Devin Desktop / CLI 中选择 Kimi K2.7 Code 作为底层执行模型。
设定包含独立功能创建和多文件重构的两类工程任务。
记录任务执行轮数、工具调用成功率、最终编译/测试通过状态以及 Token 消耗。
Devin 团队工程师 theodormarcu 在官方公告中发布了上述具体百分比分数,并明确了对比基准为 FrontierCode Extended。
官方公告:“GLM 5.2 scores 43.0% and Kimi K2.7 scores 39.5% on FrontierCode Extended — placing them in a competitive tier alongside GPT-5.5 (44.8%) and Claude Opus 4.8 (51.8%).”
社区资深开发者观察:“200k covers most single-feature work but shows up on large refactors — when you're touching 15 files in sequence and need the model to hold what changed in files 1-8 while working on 9-15, the ceiling matters.”
Kimi K2.7 Code