Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Kimi K3 · 社区来源 · 个人体验

同一 K3 在八种 harness 上通过率相差 20 个百分点

Reddit 单模型、单提供商、八种 Agent harness 的 25 任务对照。

社区来源个人体验编辑日期 2026-09-20

测试条件速查

条件
模型:moonshotai/kimi-k3;OpenRouter;Maximum
条件
工具:同一 hosted Composio MCP;8 harness;每个 25 任务
条件
结果:最高 88% vs 最低 68%;任务数口径正文有 25/30 不一致
条件
成本按 2026-07-30 OpenRouter 标价

关键数据与适用场景

测试环境

  • 模型:moonshotai/kimi-k3。

  • 提供商:OpenRouter。

  • 推理:Maximum。

  • 工具:同一套 hosted Composio MCP,覆盖 Gmail、Google Calendar、Google Sheets、Airtable、GitHub、Slack、Notion、Linear、PagerDuty。

  • 任务:每个 harness 25 个有效任务;页面正文另称 30 个 complex tasks,存在口径不一致;总计 200 次计分运行。

  • harness:Oh My Pi、Kimi Code、Hermes Agent、Claude Code、Pi Agent、OpenCode、Grok Build、Codex。

输入/配置

  • 每个 harness 保持模型、提供商、工具和任务不变,只更换 harness。

  • 每个任务只运行一次;任务覆盖商业应用数据读取和修改,难度从简单到长工作流。

  • 成本按 2026-07-30 OpenRouter 标价计算;页面未公开完整任务输入、harness 版本或 MCP 配置文件。

结果数据

Harness通过通过率中位完成时间工具调用每次成功成本
Oh My Pi22/2588%231.7s248$0.52
Kimi Code21/2584%281.9s301$0.64
Hermes Agent20/2580%164.0s262$0.46
Claude Code19/2576%330.5s293$1.96
Pi Agent18/2572%156.2s223$0.57
OpenCode18/2572%270.5s299$0.72
Grok Build18/2572%196.2s402$0.66
Codex17/2568%233.4s297$0.66

最高与最低通过率相差 20 个百分点;作者还观察到工具调用更多不等于结果更好,Grok Build 402 次调用与 Pi Agent 223 次调用都通过 18 个任务。

结论

Kimi K3 的 Agent 结果不能只归因于模型本身:system instructions、工具结果回传、长任务 context 管理、重试、停止规则和终检都会改变同一模型的成功率、速度和成本。部署 K3 时应把 harness 作为可测量的产品组件,不能只比较模型排行榜。

局限

  • 单模型、单提供商、单次/任务,25 个任务的一个任务就会改变 4 个百分点;结果不具备严谨统计显著性。

  • 任务集中在商业应用 MCP 工作流,不能外推到 coding、视觉或研究任务。

  • 作者使用 Composio MCP,存在工具生态和作者选择偏差;完整任务列表与版本未公开。

  • 同一 harness 搭配其原生模型可能表现不同;不能由此断言 Kimi Code 永远优于 Claude Code/Codex。

复现步骤

  1. 复制同一组授权的业务应用任务,固定 K3 路由、工具 schema、权限和停止规则。

  2. 在 8 个 harness 中只改变 harness,记录版本、system prompt、context 压缩、重试和终检策略。

  3. 每个任务至少重复三次,记录通过率、p50/p95 时间、token、工具调用、失败类型和每成功成本。

  4. 单独报告“简单/中等/困难”任务,避免 25 个任务的平均数掩盖难题失败。

原始证据与数据

Reddit 原帖公开了模型、提供商、Maximum 推理、同一 MCP 工具、25 任务/每 harness、200 次运行和完整通过/耗时/工具调用/成功成本表,并明确列出研究局限。

来源摘录或观察(仅做合规短引)

作者报告:“The gap between the highest and lowest pass rates was 20 percentage points”。

能支持的判断

  • Reddit 单模型、单提供商、八种 Agent harness 的 25 任务对照;报告最高 88%、最低 68%。

不能支持的判断

  • 不支持消除来源自身的 25/30 任务口径冲突,也不能外推到 coding、视觉或研究;成本随 2026-07-30 标价变化。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Reddit r/kimi · u/LimpComedian1317 · 原文发布日期 Unknown · 本站编辑日期 2026-09-20

打开原始来源

Kimi K3

在 Tabbit 中比较 Kimi K3

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

定价 · 简体中文

Kimi K3 价格:API 成本、会员方案与预算计算

用官方费率解释 Kimi K3 的 API 价格、缓存写入、会员方案和三种实际预算场景。

相关评测

官方案例显示长程 Agent 潜力,也暴露复现边界Kimi 官方发布材料中的长程编码、视觉闭环、知识工作和研究案例。Kimi K3 代码安全评估:基准强不等于精度够Semgrep 的 IDOR 代码安全基准;可区分 precision、recall 和 F1。实战编码:简单任务接近,陷阱任务暴露可靠性差距相同 GitHub issue、规划—实现—验证三阶段与 70 分量表的编码 Agent 观察。Coding Agent 证据足够严肃,但不支持“通用最佳”NxCode 对 Kimi K3 公开 coding-agent 基准的口径、配置和可比性整理。把 Kimi K3 的 Agent loop 拆成可控步骤依据 Kimi API 指南,将任务拆解、工具 schema、循环控制、权限和终检串成可复查流程;不会在 Tabbit 中自动配置工具。用九步流程把需求转成可审查代码变更Kimi AI 的编码工作流强调先计划、再实现、再验证;适用于有仓库和验收标准的变更,不等于模型已替你运行测试。让 Kimi K3 在 OpenCode 中调用 Firecrawl 获取网页资料把 Kimi K3、OpenCode 与 Firecrawl MCP 连接成可引用的网页研究流程;要求先限定域名、权限和停止条件。搭建 Kimi K3 API 与 Agent loop围绕“搭建 Kimi K3 API 与 Agent loop”整理来源中的任务边界、输入和执行环境;完整步骤与限制见详情。