Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Kimi K3

Artificial Analysis AA-Briefcase:Kimi K3 的知识工作质量、成本与耗时

原始来源

Artificial Analysis

作者Artificial Analysis

Tabbit 整理2026-08-19

查看原文

测试环境

  • 基准:AA-Briefcase,Artificial Analysis 的私有 Agentic knowledge-work benchmark。

  • 任务:真实风格的复杂输入文件,交付物包括 spreadsheet、presentation 和 UI mock-up。

  • 评分:按 correctness、analytical quality、presentation quality 合成 Elo;页面未公开完整任务、提示词或数据集。

  • 服务:使用 Kimi first-party API;价格按 Kimi K3 $3/$15、缓存输入 $0.30/M 计算。

输入/配置

  • 页面未公开单个任务的完整输入、system prompt、工具清单或 harness 版本。

  • 记录了每任务 turns、输出 token、成本和时间,可用于任务级成本判断。

结果数据

指标Kimi K3对照/解释
AA-Briefcase Elo1543第二,仅次于 Fable 5 的 1574;高于 GPT-5.6 Sol 1501、Opus 4.8 1347
Rubric pass rate51%仅次于 Fable 5 的 56%
Analytical quality Elo1754与 Fable 5 的 1744 接近
Presentation quality Elo1471低于 Sol 1660、Opus 4.8 1492
平均成本/任务$10.57页面称约为 K2.6 的 10 倍量级
平均耗时/任务56.4 分钟约为 Fable 5 的 2.5 倍、Grok 4.5 high 的 3.8 倍
平均输出 token120KK2.6 为 42K
平均 turns83Fable 5 为 67,Sol 为 50

结论

Kimi K3 在复杂资料到可交付物的分析质量上很强,但它通过更多轮次和更长输出换取质量;如果工作流重视“正确分析”而非视觉呈现,K3 值得试用,若每个任务需要快速、廉价、精美交付,则应把耗时、展示质量和每任务成本纳入路由条件。

局限

  • AA-Briefcase 是私有数据集,读者不能独立重放原任务;这份文档只能复核指标和评测定义,不能声称完整复现。

  • 这是一个 agentic knowledge-work benchmark,不代表短问答、代码修复或普通聊天。

  • 成本和耗时依赖 first-party API、模型版本、工具调用和任务分布;不能从单一平均数推导所有用户的账单。

  • Kimi 团队技术报告的后续快照列 AA-Briefcase Elo 1548;本文快照为 1543,应保留日期差异而非强行统一。

复现步骤

  1. 建立包含 PDF/表格/演示素材的自有任务集,定义 correctness、analysis、presentation 三套 rubric。

  2. 用 Kimi K3 first-party API 固定价格快照,记录每轮输入/输出 token、turn 数、工具调用、总耗时和人工返工。

  3. 将同一任务交给基线模型,盲审交付物并分别打三类分数。

  4. 报告均值、分位数和每任务成本;不要只报告最终 Elo。

原始证据与数据

AA 页面公开了 benchmark 任务形态、评分维度、1543 Elo、51% rubric pass、1754 analytical Elo、1471 presentation Elo、$10.57、56.4 分钟、120K 输出 token 和 83 turns。

来源摘录或观察(仅做合规短引)

页面摘要称:“second only to Fable 5 … but averaging nearly an hour per task”。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Kimi K3

在 Tabbit 中使用并对比模型

Kimi K3

相关测评

媒体Google / Semgrep

Kimi K3 的代码安全测评:表面强劲,精度不足

媒体Google / MindStudio

Kimi K3 实战编码测评:真的像宣传的那么好吗?

媒体Google / Simon Willison

Kimi K3 与 pelican benchmark:我们还能学到什么

媒体Google / NxCode

Kimi K3 benchmark 详解:coding-agent 测评指南

Kimi K3

相关提示词

媒体Google / Business Compass LLC

Kimi K3 提示词工程指南

媒体Google / Together AI

Kimi K3:完整开发者指南

媒体Google / Kimi API Platform

Kimi 提示词最佳实践

媒体Google / Kimi API Platform

使用 Kimi K3 构建 Agent