模型:moonshotai/kimi-k3。
提供商:OpenRouter。
推理:Maximum。
工具:同一套 hosted Composio MCP,覆盖 Gmail、Google Calendar、Google Sheets、Airtable、GitHub、Slack、Notion、Linear、PagerDuty。
任务:每个 harness 25 个有效任务;页面正文另称 30 个 complex tasks,存在口径不一致;总计 200 次计分运行。
harness:Oh My Pi、Kimi Code、Hermes Agent、Claude Code、Pi Agent、OpenCode、Grok Build、Codex。
每个 harness 保持模型、提供商、工具和任务不变,只更换 harness。
每个任务只运行一次;任务覆盖商业应用数据读取和修改,难度从简单到长工作流。
成本按 2026-07-30 OpenRouter 标价计算;页面未公开完整任务输入、harness 版本或 MCP 配置文件。
| Harness | 通过 | 通过率 | 中位完成时间 | 工具调用 | 每次成功成本 |
|---|---|---|---|---|---|
| Oh My Pi | 22/25 | 88% | 231.7s | 248 | $0.52 |
| Kimi Code | 21/25 | 84% | 281.9s | 301 | $0.64 |
| Hermes Agent | 20/25 | 80% | 164.0s | 262 | $0.46 |
| Claude Code | 19/25 | 76% | 330.5s | 293 | $1.96 |
| Pi Agent | 18/25 | 72% | 156.2s | 223 | $0.57 |
| OpenCode | 18/25 | 72% | 270.5s | 299 | $0.72 |
| Grok Build | 18/25 | 72% | 196.2s | 402 | $0.66 |
| Codex | 17/25 | 68% | 233.4s | 297 | $0.66 |
最高与最低通过率相差 20 个百分点;作者还观察到工具调用更多不等于结果更好,Grok Build 402 次调用与 Pi Agent 223 次调用都通过 18 个任务。
Kimi K3 的 Agent 结果不能只归因于模型本身:system instructions、工具结果回传、长任务 context 管理、重试、停止规则和终检都会改变同一模型的成功率、速度和成本。部署 K3 时应把 harness 作为可测量的产品组件,不能只比较模型排行榜。
单模型、单提供商、单次/任务,25 个任务的一个任务就会改变 4 个百分点;结果不具备严谨统计显著性。
任务集中在商业应用 MCP 工作流,不能外推到 coding、视觉或研究任务。
作者使用 Composio MCP,存在工具生态和作者选择偏差;完整任务列表与版本未公开。
同一 harness 搭配其原生模型可能表现不同;不能由此断言 Kimi Code 永远优于 Claude Code/Codex。
复制同一组授权的业务应用任务,固定 K3 路由、工具 schema、权限和停止规则。
在 8 个 harness 中只改变 harness,记录版本、system prompt、context 压缩、重试和终检策略。
每个任务至少重复三次,记录通过率、p50/p95 时间、token、工具调用、失败类型和每成功成本。
单独报告“简单/中等/困难”任务,避免 25 个任务的平均数掩盖难题失败。
Reddit 原帖公开了模型、提供商、Maximum 推理、同一 MCP 工具、25 任务/每 harness、200 次运行和完整通过/耗时/工具调用/成功成本表,并明确列出研究局限。
作者报告:“The gap between the highest and lowest pass rates was 20 percentage points”。
Kimi K3