Haiku 4.5 适合做高并发、低延迟的子任务和实时助手:官方模型表给出 $1/$5 每百万输入/输出 token、200k 上下文、64k 最大输出,但复杂任务应由更大模型规划和复核。
适合的任务:分类/抽取、短摘要、客服、代码补全、并行子任务、实时多轮交互。
不适合的任务:把它作为唯一规划器处理高风险长链路重构或深层安全推理。
适用的模型版本:Claude Haiku 4.5;API 名称 claude-haiku-4-5。
适用的客户端、Agent 或 API:Claude API、Bedrock、Vertex AI、Claude Code;平台 alias/区域支持需核验。
推荐的推理档位和参数:没有统一 adaptive thinking;如果任务确需思考,测试 extended thinking 预算并设置硬 max_tokens,日常高吞吐优先关闭额外思考。
{
"model": "claude-haiku-4-5",
"max_tokens": 2048,
"system": "你是批量任务子代理。只完成分配的子任务,输出严格 JSON。缺少证据时返回 null,不要猜测。",
"messages": [
{
"role": "user",
"content": "<task>\n提取订单状态与金额。\n</task>\n<document>\n...\n</document>\n<output_schema>{status:string|null, amount:number|null, evidence:string[]}</output_schema>"
}
]
}推荐的路由工作流:大模型生成任务计划和验收标准 → 并行 Haiku 子代理执行抽取/检索/草拟 → 服务端 schema/权限校验 → 大模型或规则引擎合并与复核。
用真实批量数据分别测试 1、4、8 个并行 Haiku worker;固定输入、超时、输出 schema 和重试规则。
记录每条任务的成功率、p95 延迟、token、费用、重试次数和人工修正率。
对困难样本加入升级队列,让 Sonnet/Opus 复核,而不是无限重试 Haiku。
评估 prompt caching、Batch API 或 provider-specific batching 是否改变成本;价格以当前官方页面为准。
Anthropic 发布页:Haiku 4.5 价格 $1 输入/$5 输出每百万 token;称其为 Sonnet 4 级编码性能、三分之一成本和超过两倍速度,但这些是发布方比较。
官方模型表:Haiku 4.5 context window 200k、max output 64k、比较延迟为 fastest、extended thinking 支持、adaptive thinking 不支持。
官方模型表列出所有当前模型支持文本/图像输入、文本输出、多语言和 vision;具体 Haiku 能力仍需以 endpoint 规格核对。
官方发布页建议 Sonnet 4.5 可规划复杂问题,再并行编排多个 Haiku 4.5 子任务。
“三分之一成本/两倍速度”是相对 Sonnet 4 的官方发布表述,未公开完整 workload、吞吐与置信区间。
1/$5 价格不包含缓存、批量、区域/云平台差异或长上下文额外计价;部署前看当前价格表。
并行 worker 会放大工具、限流、重复写入和数据泄露风险;必须有幂等 ID、权限和审计。
64k max output 不代表任务会稳定生成 64k;max_tokens 仍应按任务设置以控制成本。
官方的产品定位是“fastest model with near-frontier intelligence”(合规短引);这里的取舍是吞吐优先,不是复杂推理无条件最优。
Claude Haiku 4.5