Claude Sonnet 5.5 当前官方配置为 1M token 上下文、128K 标准最大输出、默认 high effort 和 adaptive thinking,输入价格 $2、输出价格 $10;五个平台中只有 Bedrock 的模型 ID 带 anthropic. 前缀。
适合的任务:需要较快响应、较长上下文、文本或图像输入、Agent 工具调用和可调 effort 的 Claude API 工作流。
不适合的任务:把 128K 标准输出上限与 Message Batches API 的 300K beta 上限混用;把模型页列出的默认 high effort 当作所有客户端的默认值;向模型传入非默认 temperature、top_p 或 top_k。
适用的模型版本:Claude Sonnet 5.5,状态为 Active (latest),模型 ID 为 claude-sonnet-5-5 及各平台对应 ID。
适用的客户端、Agent 或 API:Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS。Message Batches API 的 300K 输出是单独的 beta 能力,需要 beta header。
推荐的推理档位和参数:模型页将默认 effort 标为 high;between_tools 只在 high 或更低 effort 可用。其他档位和请求字段需结合对应 API 文档核对,并按工作负载权衡质量、延迟和成本。
| 平台 | 官方模型 ID |
|---|---|
| Claude API | claude-sonnet-5-5 |
| Amazon Bedrock | anthropic.claude-sonnet-5-5 |
| Google Cloud | claude-sonnet-5-5 |
| Microsoft Foundry | claude-sonnet-5-5 |
| Claude Platform on AWS | claude-sonnet-5-5 |
页面将 claude-sonnet-5-5 作为模型页主 ID,并将 Amazon Bedrock 的 anthropic. 前缀列为平台差异。调用时应使用目标平台的对应 ID。
| 项目 | 官方值 |
|---|---|
| Context window | 1M tokens |
| Max output | 128K tokens |
| Max output(Message Batches API,beta) | 300K tokens |
| Thinking | Adaptive |
| Default effort | high |
| Comparative latency | Fast |
| 输入 → 输出 | Text and images → text |
| Reliable knowledge cutoff | 2026-06 |
| Training data cutoff | 2026-06 |
| 项目 | 价格(每百万 token) |
|---|---|
| Input | $2 |
| Output | $10 |
| 5 分钟 cache write | $2.50 |
| 1 小时 cache write | $4 |
| Cache read | $0.10 |
| Message Batches API | 输入和输出 50% discount |
模型页的 Message Batches API 300K 输出上限需要 output-300k-2026-03-24 beta header。批量折扣和 300K 输出能力属于 API 能力,不能直接套用到普通 Messages API 请求。
Sonnet 5.5 默认启用 adaptive thinking;模型页将默认 effort 标为 high。以下是按模型页规格整理的非完整请求示意,并非 overview 原文示例;实际字段写法须按当前 Messages API 与 effort 文档核对:
{
"model": "claude-sonnet-5-5",
"max_tokens": 128000,
"output_config": {
"effort": "high"
}
}这里的 max_tokens: 128000 表示页面公布的标准最大输出上限;实际请求还需要提供 messages 等 Messages API 必需字段。页面没有声称每个请求都应使用最大值,max_tokens 应按任务和成本预算设置。
模型页说明,Sonnet 5.5 的最低思考设置为 between_tools,在 high 或更低 effort 下可用;它用于关闭预先思考,工具调用之间的进度更新仍会以 thinking blocks 返回:
{
"thinking": {
"type": "between_tools"
},
"output_config": {
"effort": "medium"
}
}模型页没有给出 between_tools 的完整请求示例。页面只明确写出它在 high 或更低 effort 下可用;因此不要将此示意直接套用于更高档位。其他 thinking 请求写法须按当前 API 文档核对。
如果使用 Message Batches API,并且目标请求需要超过普通 128K 的输出上限,页面列出的 beta header 是:
output-300k-2026-03-24这只是页面列出的 header 名称和 300K 能力说明;具体 header 传递方式、SDK 版本和批量请求结构应按当前 API reference 核对。
temperature、top_p 或 top_k 设置为非默认值会返回 400;不要把旧模型的采样参数直接迁移过来。
prompt caching 的最低可缓存长度是 512 tokens。
adaptive thinking 默认开启;若要关闭预先思考,使用 between_tools,并保持 effort 在 high 或更低。
页面摘要列出五个 Sonnet 5 代码迁移重点:between_tools、forced tool use、thinking blocks 与模型和会话绑定、Claude API / Google Cloud 的 computer use tool 变化,以及 advisor tool 的兼容模型变化。
另一个不会让请求失败但会改变 response shape 的变化是:工具调用之间的文本会回到 thinking blocks;若客户端只渲染 text blocks,工具调用期间可能看起来没有输出。
| 项目 | 官方值 |
|---|---|
| 状态 | Active (latest) |
| 发布日期 | 2026-09-28 |
| Retirement | Not sooner than 2027-09-28 |
| Platforms | Claude API、Amazon Bedrock、Google Cloud、Microsoft Foundry、Claude Platform on AWS |
模型页将 Sonnet 5.5 描述为 speed 和 intelligence 的组合,并在同页比较中列出:上下文 1M、最大输出 128K、Adaptive thinking、high 默认 effort、Fast comparative latency。这里的比较标签是官方模型概览信息,不是独立速度基准。
这份 overview 适合作为接入 Sonnet 5.5 时的当前配置表:先按平台选择正确 model ID,再按 1M 上下文、128K 普通输出、价格、缓存和默认 high effort 设计请求。需要更长批量输出时,单独核对 Message Batches API 的 300K beta 能力。
模型页的 Fast、默认 high、Adaptive thinking、价格和生命周期是 Anthropic 当前官方配置声明。它没有提供完整 SDK 示例、逐平台延迟数据或所有 beta 能力的运行样本。max_tokens 上限、between_tools 和非默认采样参数的规则需要结合具体 API 请求与错误处理验证。
可使用 Models API 或平台控制台核对模型状态,再分别向 Claude API、Bedrock、Google Cloud、Microsoft Foundry 和 Claude Platform on AWS 发送最小请求,确认 model ID、默认 effort、上下文与输出限制、cache 价格和 400 参数错误。要验证 300K 批量输出,还需固定 Message Batches API、beta header、SDK 版本和请求大小;这些行为不会由模型 overview 页面单独证明。
Claude Sonnet 5.5