Artificial Analysis 的独立测评显示,Claude Haiku 5.5 在 max effort 下取得 43 分并进入小模型第一梯队,知识工作和终端使用明显超过 Haiku 4.5,但其 Intelligence Index 每项任务加权平均约 162k output tokens,且安全拒答问题可能压低了 AutomationBench-AA 得分。
适合的任务:高频知识工作、摘要与压缩、窄范围 Agent 子任务、终端操作和成本敏感的批处理;AA-Briefcase 与 Terminal-Bench 4.0 是较相关的参考方向。
不适合的任务:没有人工核验的事实密集型任务、需要完整 SaaS 自动化覆盖的流程,以及对每任务 token 和延迟有严格上限的 Agent。
适用的模型版本:Claude Haiku 5.5,Artificial Analysis 于 2026-10-07 文章中的评测部署。
适用的客户端、Agent 或 API:Artificial Analysis Intelligence Index 与其私有 AA-Briefcase harness;文章未公开完整 API 调用、工具 schema 或逐任务输出。
推荐的推理档位和参数:需要最高能力时使用 max;若希望控制 token,可优先比较 high 与 max。文章显示 Haiku 5.5(high)与 GPT-6 Luna(max)同为 38 分,但 token 用量分别约 55k 与 50k/任务。
评测主体:Artificial Analysis Intelligence Index,涵盖知识工作、Agent 终端使用、自动化、编码和事实知识等任务。
主要评测:AA-Briefcase(真实知识工作任务)、Terminal-Bench 4.0(Agent 终端使用)、AA-Omniscience(事实知识与幻觉)、AutomationBench-AA(Agent SaaS 工作流)。
完整指数构成:配图标为 Intelligence Index v4.3.2,共 10 项:AA-Briefcase v1.1、GDPval-AA v2.1、AutomationBench-AA、Terminal-Bench 4.0、SciCode、Humanity’s Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。AA-Briefcase Elo 综合 rubric pass rate、分析质量和展示质量。
推理档位:文章比较 low、medium、high、xhigh、max;Haiku 5.5 是首个支持 Anthropic effort settings 与 adaptive thinking 的 Haiku。
上下文与模态:文章记录 1M token context window(Haiku 4.5 为 200k),支持 text 与 image 输入、text 输出。
分数边界:AutomationBench-AA 预发布测试中出现过度拒答;Artificial Analysis 认为 35% 结果可能被低估,并计划修复后重跑。
价格边界:不超过 100k token 的输入/输出价格为 $0.10/$0.50 每百万 token;超过 100k 后升至 $0.50/$2.50。文章称当时站点尚未支持分层价格,临时成本数据没有计入阶梯涨价。
| 评测 | Claude Haiku 5.5 | 对照或说明 |
|---|---|---|
| Artificial Analysis Intelligence Index(max) | 43 | GLM-5.3 Flash 为 42,Gemini 3.8 Flash 为 41,GPT-6 Luna 为 38;Kimi K3 为 44,Claude Sonnet 5.5(max)为 56 |
| AA-Briefcase(max) | 1578 Elo | 高于文章列出的 Kimi K3 与 GLM-5.3;与 Muse Spark 1.3(max)接近,并落在 GPT-6 Astra(max)与 Claude Fable 5.1(high)的置信区间内 |
| Terminal-Bench 4.0 | 33% | Haiku 4.5 为 0%;GLM-5.3 Flash 同为 33%,Gemini 3.8 Flash 为 20%,GPT-6 Luna 为 13% |
| AA-Omniscience 准确率 | 36% | Gemini 3.8 Flash 为 55%,GPT-6 Luna 为 44% |
| AA-Omniscience 幻觉率 | 40% | Gemini 3.8 Flash 为 55%,GPT-6 Luna 为 77%;该指标越低越好 |
| AutomationBench-AA | 35% | GPT-6 Luna、Gemini 3.8 Flash 与 GLM-5.3 Flash 为 53%–60%;文章认为 Haiku 结果受过度拒答影响 |
输出 token:Haiku 5.5(max)在 Intelligence Index 每项任务加权平均约 162k output tokens,约为 GPT-6 Luna(max,约 50k)的 3 倍;文章称其甚至高于 Opus 5.5(max)。这不是每道题固定消耗。
effort 增益:从 xhigh 升到 max 多 2 分,但约增加到 1.8 倍 token 用量。Haiku 5.5(high)为 38 分、约 55k token/任务;GPT-6 Luna(max)也是 38 分、约 50k token/任务。
分层价格:输入/输出在不超过 100k token 时为 $0.10/$0.50,超过 100k 时为 $0.50/$2.50;cache read 为 $0.01/$0.05,5 分钟 cache write 为 $0.125/$0.625,斜杠前后分别对应不超过或超过 100k token。
Artificial Analysis 的结果支持把 Haiku 5.5 视为高吞吐的小模型:它在 AA-Briefcase 上达到 1578 Elo,在 Terminal-Bench 4.0 上从 Haiku 4.5 的 0% 提升到 33%,并在 Intelligence Index 以 43 分超过多款同级模型。实际部署需要同时看 token 预算:max 档每项任务加权平均约 162k output tokens,会削弱低单价带来的成本优势。事实知识准确率只有 36%,AutomationBench-AA 还受到过度拒答影响,因此复杂自动化和高风险知识任务应保留更强模型或人工复核。
这是 Artificial Analysis 的独立测评文章,不是公开代码、数据集和完整 prompt 都齐备的可重复实验;文章未公布各评测样本量、逐题输入、温度、完整系统提示词、工具实现、token 上限、运行次数和置信区间。
AA-Briefcase 是 Artificial Analysis 的私有评测,外部无法仅凭文章重建同一任务集;文章中的“置信区间内”也没有公开区间端点。
AutomationBench-AA 的 35% 可能被预发布安全拒答压低,修复后的结果应视为待更新数据,不能与其他模型当前分数做最终结论。
Intelligence Index、AA-Briefcase、Terminal-Bench、AA-Omniscience 和 AutomationBench-AA 使用不同任务、评分和工具条件,不能把分数解释成统一成功率。
阶梯定价发布时尚未完整反映在 Artificial Analysis 的成本图中,超过 100k token 的实际成本应按 provider 的实时计费规则重算。
原文正文写 Sonnet 5.5(max)为 56 分,但所附 Intelligence Index 图的最高柱为 46 且未显示 Sonnet 5.5;正文说 AA-Briefcase 与 GPT-6 Astra、Claude Fable 5.1 的置信区间重叠,配图却未显示这两个对照模型。本记录保留正文数据并标注图文不一致,不能把配图当作这些对照结论的独立验证。
AA-Omniscience 正文的 40% 是幻觉率,配图的约 60% 是非幻觉率(1 - hallucination rate),两者是互补口径。
固定 Claude Haiku 5.5 的公开 API snapshot、provider、effort、adaptive thinking、工具权限、context window 和 token 上限。
在同一 Agent harness 中分别运行 Terminal-Bench 4.0、AA-Briefcase 风格知识工作、AutomationBench-AA 风格 SaaS 流程和 AA-Omniscience 风格事实问答;对无法获得的私有数据集明确标记为近似复测。
为每个任务保存输入、工具调用、拒答、输出 token、reasoning token、延迟、成本和人工修正;至少重复多次以估计方差。
分别报告事实答错、承认未知和安全拒答,不把低幻觉率直接等同于高知识准确率。
比较 high 与 max 的能力增益和 token 增量,并按不超过/超过 100k token 两档重新计算实际成本。
文章的关键观察是 Haiku 5.5 在小模型中达到 43 分,但 max 档在 Intelligence Index 每项任务加权平均约消耗 162k output tokens;这组结论需要与阶梯价格和预发布拒答问题一起引用。
Claude Haiku 5.5