Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Kimi K3 · 媒体来源 · 独立测量

知识工作质量接近前沿,但平均每任务成本与耗时很高

AA-Briefcase 私有 Agentic knowledge-work benchmark,记录质量、成本、耗时和 token。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

条件
任务:spreadsheet、presentation、UI mock-up 等复杂交付
条件
快照:来源正文称 last week;精确发布日期未公开
条件
结果:Elo 1543;pass 51%;$10.57/任务;56.4 分钟;120K 输出 token;83 turns
条件
服务:Kimi first-party API

关键数据与适用场景

测试环境

  • 基准:AA-Briefcase,Artificial Analysis 的私有 Agentic knowledge-work benchmark。

  • 任务:真实风格的复杂输入文件,交付物包括 spreadsheet、presentation 和 UI mock-up。

  • 评分:按 correctness、analytical quality、presentation quality 合成 Elo;页面未公开完整任务、提示词或数据集。

  • 服务:使用 Kimi first-party API;价格按 Kimi K3 $3/$15、缓存输入 $0.30/M 计算。

输入/配置

  • 页面未公开单个任务的完整输入、system prompt、工具清单或 harness 版本。

  • 记录了每任务 turns、输出 token、成本和时间,可用于任务级成本判断。

结果数据

指标Kimi K3对照/解释
AA-Briefcase Elo1543第二,仅次于 Fable 5 的 1574;高于 GPT-5.6 Sol 1501、Opus 4.8 1347
Rubric pass rate51%仅次于 Fable 5 的 56%
Analytical quality Elo1754与 Fable 5 的 1744 接近
Presentation quality Elo1471低于 Sol 1660、Opus 4.8 1492
平均成本/任务$10.57页面称约为 K2.6 的 10 倍量级
平均耗时/任务56.4 分钟约为 Fable 5 的 2.5 倍、Grok 4.5 high 的 3.8 倍
平均输出 token120KK2.6 为 42K
平均 turns83Fable 5 为 67,Sol 为 50

结论

Kimi K3 在复杂资料到可交付物的分析质量上很强,但它通过更多轮次和更长输出换取质量;如果工作流重视“正确分析”而非视觉呈现,K3 值得试用,若每个任务需要快速、廉价、精美交付,则应把耗时、展示质量和每任务成本纳入路由条件。

局限

  • AA-Briefcase 是私有数据集,读者不能独立重放原任务;这份文档只能复核指标和评测定义,不能声称完整复现。

  • 这是一个 agentic knowledge-work benchmark,不代表短问答、代码修复或普通聊天。

  • 成本和耗时依赖 first-party API、模型版本、工具调用和任务分布;不能从单一平均数推导所有用户的账单。

  • Kimi 团队技术报告的后续快照列 AA-Briefcase Elo 1548;本文快照为 1543,应保留日期差异而非强行统一。

复现步骤

  1. 建立包含 PDF/表格/演示素材的自有任务集,定义 correctness、analysis、presentation 三套 rubric。

  2. 用 Kimi K3 first-party API 固定价格快照,记录每轮输入/输出 token、turn 数、工具调用、总耗时和人工返工。

  3. 将同一任务交给基线模型,盲审交付物并分别打三类分数。

  4. 报告均值、分位数和每任务成本;不要只报告最终 Elo。

原始证据与数据

AA 页面公开了 benchmark 任务形态、评分维度、1543 Elo、51% rubric pass、1754 analytical Elo、1471 presentation Elo、$10.57、56.4 分钟、120K 输出 token 和 83 turns。

来源摘录或观察(仅做合规短引)

页面摘要称:“second only to Fable 5 … but averaging nearly an hour per task”。

能支持的判断

  • AA-Briefcase 私有 Agentic knowledge-work benchmark:Elo 1543、51% pass、$10.57/任务、56.4 分钟、120K 输出 token、83 turns。

不能支持的判断

  • 不支持外推到公开可复现的通用知识工作成功率:任务集为私有 benchmark,来源只写 last week,精确发布日期未公开。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Artificial Analysis · Artificial Analysis · 原文发布日期 Unknown · 本站编辑日期 2026-09-20

打开原始来源

Kimi K3

在 Tabbit 中比较 Kimi K3

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

定价 · 简体中文

Kimi K3 价格:API 成本、会员方案与预算计算

用官方费率解释 Kimi K3 的 API 价格、缓存写入、会员方案和三种实际预算场景。

相关评测

Kimi K3 代码安全评估:基准强不等于精度够Semgrep 的 IDOR 代码安全基准;可区分 precision、recall 和 F1。实战编码:简单任务接近,陷阱任务暴露可靠性差距相同 GitHub issue、规划—实现—验证三阶段与 70 分量表的编码 Agent 观察。Coding Agent 证据足够严肃,但不支持“通用最佳”NxCode 对 Kimi K3 公开 coding-agent 基准的口径、配置和可比性整理。SVG pelican 单题案例:能看出特征,不能替代 Agent 测评Simon Willison 使用 OpenRouter 与 llm-openrouter 生成 SVG 并再次进行图片描述;单题、个人体验。让 Kimi K3 在 OpenCode 中调用 Firecrawl 获取网页资料把 Kimi K3、OpenCode 与 Firecrawl MCP 连接成可引用的网页研究流程;要求先限定域名、权限和停止条件。把 Kimi API 请求写成可验收任务将官方提示词建议落成角色、背景、约束、格式和验收条件的执行清单。来源没有提供一条可直接复制的完整通用 prompt。把 Kimi K3 的 Agent loop 拆成可控步骤依据 Kimi API 指南,将任务拆解、工具 schema、循环控制、权限和终检串成可复查流程;不会在 Tabbit 中自动配置工具。用九步流程把需求转成可审查代码变更Kimi AI 的编码工作流强调先计划、再实现、再验证;适用于有仓库和验收标准的变更,不等于模型已替你运行测试。