Anthropic 将 Claude Haiku 5.5 定位为面向摘要、压缩、数据库查询、分类、实时客服、浏览器操作和编码子代理的高吞吐模型;发布页给出的官方对照显示,它在部分知识工作、电脑使用、多学科推理、终端编码和视觉推理基准上明显高于 Haiku 4.5,但复杂的 Agent 编码仍应优先考虑更大的模型。
适合判断的任务:高频摘要和压缩、分类、数据库查询、浏览器操作、实时客服、短任务子代理,以及成本敏感的批量知识工作。
不适合外推的任务:把发布页分数当作所有生产任务的保证;把 Haiku 5.5 的结果直接外推到复杂的长流程 Agent 编码;用不同工具环境或不同推理档位的结果做无条件比较。
适用的模型版本:Claude Haiku 5.5;页面同时列出 Haiku 4.5、GPT-6 Luna 和 Claude Sonnet 5.5 作为对照。
测试环境或客户端:Anthropic 发布页列出 GDPval-AA v2.1、AA-Briefcase v1.1、OSWorld 2.1、Humanity’s Last Exam、Terminal-Bench 4.0、FrontierCode 1.1 (Main) 和 Chartography;页面未公开完整运行环境。
推理档位和参数:Haiku 5.5 支持可调 effort,页面图表展示 Low、Med、High、Xhigh、Max;未公开每项结果对应的完整参数。
这是 Anthropic 在模型发布页上的官方基准汇总,不是独立机构重跑。页面按知识工作、电脑使用、多学科推理、Agent 编码和视觉推理列出模型分数,并在部分项目中注明测试条件:
OSWorld 2.1 的结果标为 Offline subset;页面说明该基准衡量 Agent 操作真实电脑完成长流程、多步骤任务的能力。
Humanity’s Last Exam 同时给出 no tools 和 with tools 两种结果。
FrontierCode 1.1 使用页面标注的 Main 子集;对照表中 Sonnet 5.5 的结果标注为 Xhigh。
页面另提供 OSWorld 2.1、GDPval-AA 和 Humanity’s Last Exam 在不同 effort 档位下的成绩与单次成本曲线;OSWorld 的纵轴是 partial-credit score,并非统一的准确率指标。页面没有逐点列出完整数值。
页面将完整评估细节指向 Haiku 5.5 System Card;本条只采集发布页直接展示的内容。
| 评测类别 | 基准 | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|---|
| 知识工作 | GDPval-AA v2.1 | 1620 | 735 | 1437 | 1840 |
| 知识工作 | AA-Briefcase v1.1 | 1578 | 614 | 1336 | 1824 |
| 电脑使用 | OSWorld 2.1(Offline subset) | 72.4% | 15.7% | 48.9% | 83.9% |
| 多学科推理 | Humanity’s Last Exam(no tools) | 45.9% | 10.2% | — | 56.9% |
| 多学科推理 | Humanity’s Last Exam(with tools) | 57.4% | 18.7% | — | 64.5% |
| Agent 编码 | Terminal-Bench 4.0 | 39.2% | 0.0% | 16.4% | 70.6% |
| Agent 编码 | FrontierCode 1.1 (Main) | 46.4% | — | 42.4% | 52.1%(Xhigh) |
| 视觉推理 | Chartography(no tools) | 46.4% | 6.4% | 29.1% | 61.6% |
页面还给出了成本与能力曲线,但没有在正文中提供每个 effort 档位的完整表格。页面对 OSWorld 2.1 的说明是:该评测测量 Agent 在真实电脑上完成长流程、多步骤任务的能力。
Anthropic 发布页给出的每百万 token 价格如下。Haiku 5.5 的输入、输出和缓存读取价格分为提示词不超过或超过 100k token 两档:
| 项目 | Haiku 5.5(≤100k / >100k) | Haiku 4.5 | Sonnet 5.5 |
|---|---|---|---|
| Cache reads | $0.01 / $0.05 | $0.10 | $0.10 |
| Cache writes | $0.125 / $0.625 | $1.25 | $2.50 |
| Input tokens | $0.10 / $0.50 | $1.00 | $2.00 |
| Output tokens | $0.50 / $2.50 | $5.00 | $10.00 |
页面称 Haiku 5.5 对不超过 100k token 的请求定价比 Haiku 4.5 低 90%,对超过 100k token 的请求低 50%;其脚注称 Haiku 4.5 约 90% 的请求落在不超过 100k 档,新 tokenizer 也会改变单项任务 token 用量。Anthropic 据此给出平均运行成本约低 75% 的估计。页面称 Haiku 5.5 在各模型的标准速度下是当时最快的模型,Opus Fast Mode 可能更快;它建议将 Haiku 用于子代理、压缩、摘要等边界较窄的工作。
基准名称:GDPval-AA v2.1、AA-Briefcase v1.1、OSWorld 2.1、Humanity’s Last Exam、Terminal-Bench 4.0、FrontierCode 1.1 (Main)、Chartography。
Haiku 5.5 数值:1620、1578、72.4%、45.9%(no tools)、57.4%(with tools)、39.2%、46.4%、46.4%。
页面明确条件:OSWorld 2.1 为 Offline subset;Humanity’s Last Exam 分 no tools / with tools;Chartography 为 no tools;Sonnet 5.5 的 FrontierCode 结果标注 Xhigh。
成本数据:Haiku 5.5 的 cache reads 为 $0.01 / $0.05、cache writes 为 $0.125 / $0.625、输入为 $0.10 / $0.50、输出为 $0.50 / $2.50,单位均为每百万 token,斜杠前后分别对应提示词不超过或超过 100k token。
未公开字段:发布页没有给出每项 benchmark 的样本数量、逐题输入、随机种子、完整系统提示词、工具实现、硬件、token 上限、运行次数、置信区间或原始日志。
发布页支持的结论是:Haiku 5.5 相比 Haiku 4.5 在 Anthropic 列出的这组官方基准上都有明显提升,且官方把它放在速度、价格和高频窄任务的交集上。Terminal-Bench 4.0 中 Haiku 5.5 为 39.2%,低于同表的 Sonnet 5.5(70.6%),因此页面本身也把 Sonnet 5.5 和 Opus 5.5 作为复杂 Agent 编码的更合适选择。
这些结果是厂商发布页的快照。页面没有公开足够信息来独立复现实验,也不能据此估计目标业务的准确率、延迟、总成本或稳定性。尤其是不同 effort、工具条件、数据子集和未披露的运行配置,都会影响横向比较;生产选型仍需在自己的输入、工具和成本约束下重跑。
将模型固定为 Claude Haiku 5.5,并记录 API 或客户端中的具体模型 ID、effort 档位、工具配置和 token 预算。
优先选择页面列出的 OSWorld 2.1、GDPval-AA、Humanity’s Last Exam、Terminal-Bench 4.0、FrontierCode 1.1 (Main) 和 Chartography;记录数据子集以及 no tools / with tools 条件。
为每个基准保存完整输入、评分脚本、运行次数、失败类型、输入输出 token、延迟和成本;页面未提供的配置不能凭空补齐。
将 Haiku 5.5 与对照模型放在同一 harness、同一数据版本和同一 effort 档位下比较,并单独报告不同工具条件的结果。
用业务自己的摘要、分类、浏览器操作和子代理任务做补充验收,不把官方发布页分数当作生产承诺。
Claude Haiku 5.5