K2.7 Code 应按“始终思考 + 保留 reasoning_content + 自动工具调用”的方式接入,采样参数使用官方固定值,避免把旧模型的关闭思考或自定义温度配置带过来。
适合的任务:多轮代码 Agent、长上下文仓库修改、视觉/视频输入结合工具调用、复杂调试。
不适合的任务:必须关闭 thinking、依赖任意 temperature/top_p/n 或需要多个候选结果的接口。
适用的模型版本:kimi-k2.7-code;高速变体为 kimi-k2.7-code-highspeed。
适用的客户端、Agent 或 API:Kimi API 的 OpenAI 兼容接口、Kimi Code、支持 tool calling 的自建 Agent。
推荐的推理档位和参数:保持默认;thinking 必须 enabled,temperature=1.0、top_p=0.95、n=1,默认 max_tokens=32768;tool_choice 只用 auto 或 none。
Task: [要完成的代码或仓库任务]
Context: [仓库结构、相关文件、约束、已知复现步骤]
Plan: 先检查现状并列出短计划,再按阶段实施。
Tools: 只在能推进任务时调用;每次工具返回后核对结果,不要重复无效调用。
Constraints: 不修改无关文件;保留 reasoning_content;遇到失败先说明原因和下一步。
Verification: 每个阶段运行聚焦测试,最后汇总改动、测试结果和剩余风险。用 OpenAI SDK 指向 Kimi API,模型设为 kimi-k2.7-code。
在第一轮给出任务、仓库上下文、工具边界和验收标准。
发送工具调用时,把上一轮 assistant 的 reasoning_content 连同 tool call 保留在上下文。
不要传 thinking: {type: "disabled"},也不要传非固定采样参数;先用默认配置建立基线。
对重复上下文启用自动缓存,按输入缓存命中、输出 token、工具轮数和最终测试结果评估成本。
官方文档:模型支持 256K context,默认 thinking enabled,禁用 thinking 会报错。
官方固定参数:temperature 1.0、top_p 0.95、n 1、presence/frequency penalty 0;其他值会报错。
多轮工具调用必须保留当前轮的 reasoning_content,否则会报错。
官方文档给出的 API 价格为缓存命中输入 $0.19/M、未命中 $0.95/M、输出 $4.00/M。
参数约束来自当前 Kimi API 文档;第三方托管方可能有不同兼容层。
“保留推理内容”是接口上下文要求,不等于把内部思维链作为用户可见产物输出。
长程编码效果仍取决于 harness 的工具定义、上下文压缩和测试质量。
官方文档明确写明:“Kimi K2.7 Code does not support non-thinking mode.”
官方建议使用默认参数,而不是手动配置这些模型的采样字段。
Kimi K2.7 Code