Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区Kimi K3

Reddit:Kimi K3 在八种 Agent Harness 上的同模型对照

原始来源

Reddit r/kimi

作者u/LimpComedian1317

Tabbit 整理2026-08-19

查看原文

测试环境

  • 模型:moonshotai/kimi-k3。

  • 提供商:OpenRouter。

  • 推理:Maximum。

  • 工具:同一套 hosted Composio MCP,覆盖 Gmail、Google Calendar、Google Sheets、Airtable、GitHub、Slack、Notion、Linear、PagerDuty。

  • 任务:每个 harness 25 个有效任务;页面正文另称 30 个 complex tasks,存在口径不一致;总计 200 次计分运行。

  • harness:Oh My Pi、Kimi Code、Hermes Agent、Claude Code、Pi Agent、OpenCode、Grok Build、Codex。

输入/配置

  • 每个 harness 保持模型、提供商、工具和任务不变,只更换 harness。

  • 每个任务只运行一次;任务覆盖商业应用数据读取和修改,难度从简单到长工作流。

  • 成本按 2026-07-30 OpenRouter 标价计算;页面未公开完整任务输入、harness 版本或 MCP 配置文件。

结果数据

Harness通过通过率中位完成时间工具调用每次成功成本
Oh My Pi22/2588%231.7s248$0.52
Kimi Code21/2584%281.9s301$0.64
Hermes Agent20/2580%164.0s262$0.46
Claude Code19/2576%330.5s293$1.96
Pi Agent18/2572%156.2s223$0.57
OpenCode18/2572%270.5s299$0.72
Grok Build18/2572%196.2s402$0.66
Codex17/2568%233.4s297$0.66

最高与最低通过率相差 20 个百分点;作者还观察到工具调用更多不等于结果更好,Grok Build 402 次调用与 Pi Agent 223 次调用都通过 18 个任务。

结论

Kimi K3 的 Agent 结果不能只归因于模型本身:system instructions、工具结果回传、长任务 context 管理、重试、停止规则和终检都会改变同一模型的成功率、速度和成本。部署 K3 时应把 harness 作为可测量的产品组件,不能只比较模型排行榜。

局限

  • 单模型、单提供商、单次/任务,25 个任务的一个任务就会改变 4 个百分点;结果不具备严谨统计显著性。

  • 任务集中在商业应用 MCP 工作流,不能外推到 coding、视觉或研究任务。

  • 作者使用 Composio MCP,存在工具生态和作者选择偏差;完整任务列表与版本未公开。

  • 同一 harness 搭配其原生模型可能表现不同;不能由此断言 Kimi Code 永远优于 Claude Code/Codex。

复现步骤

  1. 复制同一组授权的业务应用任务,固定 K3 路由、工具 schema、权限和停止规则。

  2. 在 8 个 harness 中只改变 harness,记录版本、system prompt、context 压缩、重试和终检策略。

  3. 每个任务至少重复三次,记录通过率、p50/p95 时间、token、工具调用、失败类型和每成功成本。

  4. 单独报告“简单/中等/困难”任务,避免 25 个任务的平均数掩盖难题失败。

原始证据与数据

Reddit 原帖公开了模型、提供商、Maximum 推理、同一 MCP 工具、25 任务/每 harness、200 次运行和完整通过/耗时/工具调用/成功成本表,并明确列出研究局限。

来源摘录或观察(仅做合规短引)

作者报告:“The gap between the highest and lowest pass rates was 20 percentage points”。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Kimi K3

在 Tabbit 中使用并对比模型

Kimi K3

相关测评

媒体Google / Semgrep

Kimi K3 的代码安全测评:表面强劲,精度不足

媒体Google / MindStudio

Kimi K3 实战编码测评:真的像宣传的那么好吗?

媒体Google / Simon Willison

Kimi K3 与 pelican benchmark:我们还能学到什么

媒体Google / NxCode

Kimi K3 benchmark 详解:coding-agent 测评指南

Kimi K3

相关提示词

媒体Google / Business Compass LLC

Kimi K3 提示词工程指南

媒体Google / Together AI

Kimi K3:完整开发者指南

媒体Google / Kimi API Platform

Kimi 提示词最佳实践

媒体Google / Kimi API Platform

使用 Kimi K3 构建 Agent