官方模型概览给出了 Claude Haiku 5.5 在各平台的当前模型 ID、1M 上下文、128K 最大输出、按输入长度分层的价格,以及默认 medium effort 的调用基线。
适合的任务:为高吞吐、低延迟的分类、路由、信息提取和 subagent 请求选择模型,并为 API、Amazon Bedrock、Google Cloud、Microsoft Foundry 或 Claude Platform on AWS 建立统一配置表。
不适合的任务:用本页代替从 Haiku 4.5 迁移时的兼容性检查、业务质量评测或平台 SDK 的错误处理;迁移差异见 官方迁移配置指南。
适用的模型版本:Claude Haiku 5.5;多数平台的模型 ID 为 claude-haiku-5-5,Amazon Bedrock 使用带 anthropic. 前缀的 ID。
适用的客户端、Agent 或 API:Claude API Messages API,以及页面列出的 Amazon Bedrock、Google Cloud、Microsoft Foundry 和 Claude Platform on AWS。
推荐的推理档位和参数:保留 adaptive thinking,默认 output_config.effort 为 medium;按质量、延迟和成本评测后再调整 effort。页面还要求省略 temperature、top_p 和 top_k,因为非默认值会返回 400。
| 平台 | Claude Haiku 5.5 模型 ID |
|---|---|
| Claude API | claude-haiku-5-5 |
| Amazon Bedrock | anthropic.claude-haiku-5-5 |
| Google Cloud | claude-haiku-5-5 |
| Microsoft Foundry | claude-haiku-5-5 |
| Claude Platform on AWS | claude-haiku-5-5 |
| 项目 | 官方值 |
|---|---|
| 上下文窗口 | 1M tokens |
| 最大输出 | 128K tokens |
| Message Batches API 最大输出 | 300K tokens(beta,需要 output-300k-2026-03-24 beta 标头) |
| thinking | Adaptive,默认开启 |
| 默认 effort | medium |
| 输入输出类型 | 文本与图像 → 文本 |
| 对比延迟 | Fastest |
| 知识截止时间 | 2026 年 6 月 |
| 训练数据截止时间 | 2026 年 6 月 |
官方页面说明,使用 effort 参数控制自适应思考深度。max_tokens 包含思考 token,因此不能只按可见文本长度设置;应为目标任务预留足够上限。
页面还说明 Haiku 5.5 使用新版 tokenizer,同样文本相比 Haiku 4.5 约多计 30% token,迁移时应重新估算长度和成本。thinking blocks 只可在生成它们的账户或关联账户中使用;跨账户回放对话须检查这一限制。
以下价格均为每百万 token(MTok):
| 项目 | 提示不超过 100,000 tokens | 提示超过 100,000 tokens |
|---|---|---|
| 输入 | $0.10 / MTok | $0.50 / MTok |
| 输出 | $0.50 / MTok | $2.50 / MTok |
| 5 分钟缓存写入 | $0.125 / MTok | $0.625 / MTok |
| 1 小时缓存写入 | $0.20 / MTok | $1.00 / MTok |
| 缓存读取 | $0.01 / MTok | $0.05 / MTok |
Batch API 对输入和输出提供 50% 折扣。实际账单还应按平台的价格页与请求是否命中缓存核对。
下面是按模型概览中的模型 ID、adaptive thinking 和默认 effort 整理的最小请求骨架。messages 内容需替换为业务输入;页面没有要求固定的 max_tokens 数值,因此示例只展示配置关系。
import anthropic
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-haiku-5-5",
max_tokens=8192,
thinking={"type": "adaptive"},
output_config={"effort": "medium"},
messages=[
{"role": "user", "content": "把这里替换成业务输入"},
],
)不要在该请求中设置 temperature、top_p 或 top_k。若使用 Batch API 的 300K 输出 beta 能力,还需按照官方页面加入 output-300k-2026-03-24 beta 标头,并确认客户端已经支持该 beta 接口。
根据部署平台从上表选择模型 ID,并在配置中心记录平台、模型 ID、上下文上限和价格阶梯。
默认使用 adaptive thinking 与 effort=medium,为每类业务分别测量质量、首 token 延迟、总延迟、输出 token 和单请求成本。
对输入长度超过 100,000 tokens 的请求单独统计成本;不要用低阶价格估算长上下文任务。
若启用 prompt caching,分别记录 5 分钟写入、1 小时写入和缓存读取命中,避免把缓存读取价格误当作普通输入价格。
如果使用 Batch API,确认 50% 输入输出折扣与 300K 输出 beta 标头是否同时适用于当前平台和 SDK。
通过 Models API 查询账户可用的模型、能力和限制;不要把本文采集到的状态当作永久可用性承诺。
这是 Anthropic 在 2026-10-09 采集到的官方模型概览配置,不是独立性能测评,也不保证业务任务达到特定准确率、延迟或成本。
页面将 Claude Haiku 5.5 标为 Active (latest),并写明不早于 2027-10-07 退役;实际平台可用性仍取决于账户、区域、配额和供应商发布状态。
“Fastest”是官方页面的相对延迟描述,没有附带统一硬件、并发量、输入长度或统计区间,不能直接换算为毫秒 SLA。
价格按提示是否超过 100,000 tokens 分层;思考 token、缓存命中、Batch API 和不同云平台的计费细节应以实际账单与平台价格页复核。
本页只记录当前模型页的调用、容量和价格基线;assistant prefill、工具集、消息回放和其他版本兼容变化属于迁移工作,应按 迁移配置指南 逐项检查。
模型 ID:页面的 Specifications 列出 Claude API 为 claude-haiku-5-5,Amazon Bedrock 为 anthropic.claude-haiku-5-5,其余列出的平台为 claude-haiku-5-5。
容量:页面的 at-a-glance 和 Capabilities 均列出 1M context window、128K max output;Message Batches API 另列 300K beta 上限。
价格:页面按 100,000 tokens 分界列出输入、输出、5 分钟缓存写入、1 小时缓存写入和缓存读取价格,并列出 Batch API 输入输出 50% 折扣。
effort:页面列出 Thinking 为 Adaptive、Default effort 为 medium,并说明可用 effort 控制思考深度。
参数限制:页面的 Good to know 明确要求省略 temperature、top_p 和 top_k,因为设置非默认值会返回 400。
Claude Haiku 5.5