基准:AA-Briefcase,Artificial Analysis 的私有 Agentic knowledge-work benchmark。
任务:真实风格的复杂输入文件,交付物包括 spreadsheet、presentation 和 UI mock-up。
评分:按 correctness、analytical quality、presentation quality 合成 Elo;页面未公开完整任务、提示词或数据集。
服务:使用 Kimi first-party API;价格按 Kimi K3 $3/$15、缓存输入 $0.30/M 计算。
页面未公开单个任务的完整输入、system prompt、工具清单或 harness 版本。
记录了每任务 turns、输出 token、成本和时间,可用于任务级成本判断。
| 指标 | Kimi K3 | 对照/解释 |
|---|---|---|
| AA-Briefcase Elo | 1543 | 第二,仅次于 Fable 5 的 1574;高于 GPT-5.6 Sol 1501、Opus 4.8 1347 |
| Rubric pass rate | 51% | 仅次于 Fable 5 的 56% |
| Analytical quality Elo | 1754 | 与 Fable 5 的 1744 接近 |
| Presentation quality Elo | 1471 | 低于 Sol 1660、Opus 4.8 1492 |
| 平均成本/任务 | $10.57 | 页面称约为 K2.6 的 10 倍量级 |
| 平均耗时/任务 | 56.4 分钟 | 约为 Fable 5 的 2.5 倍、Grok 4.5 high 的 3.8 倍 |
| 平均输出 token | 120K | K2.6 为 42K |
| 平均 turns | 83 | Fable 5 为 67,Sol 为 50 |
Kimi K3 在复杂资料到可交付物的分析质量上很强,但它通过更多轮次和更长输出换取质量;如果工作流重视“正确分析”而非视觉呈现,K3 值得试用,若每个任务需要快速、廉价、精美交付,则应把耗时、展示质量和每任务成本纳入路由条件。
AA-Briefcase 是私有数据集,读者不能独立重放原任务;这份文档只能复核指标和评测定义,不能声称完整复现。
这是一个 agentic knowledge-work benchmark,不代表短问答、代码修复或普通聊天。
成本和耗时依赖 first-party API、模型版本、工具调用和任务分布;不能从单一平均数推导所有用户的账单。
Kimi 团队技术报告的后续快照列 AA-Briefcase Elo 1548;本文快照为 1543,应保留日期差异而非强行统一。
建立包含 PDF/表格/演示素材的自有任务集,定义 correctness、analysis、presentation 三套 rubric。
用 Kimi K3 first-party API 固定价格快照,记录每轮输入/输出 token、turn 数、工具调用、总耗时和人工返工。
将同一任务交给基线模型,盲审交付物并分别打三类分数。
报告均值、分位数和每任务成本;不要只报告最终 Elo。
AA 页面公开了 benchmark 任务形态、评分维度、1543 Elo、51% rubric pass、1754 analytical Elo、1471 presentation Elo、$10.57、56.4 分钟、120K 输出 token 和 83 turns。
页面摘要称:“second only to Fable 5 … but averaging nearly an hour per task”。
Kimi K3