Claude Haiku 4.5 · configuration
围绕“Claude Haiku 4.5 的价格、上下文与批量 Agent 配置”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。
配置:
model: {{MODEL_ID}}
max_tokens: 2048
batch_size: {{BATCH_SIZE}}
output_schema: {{OUTPUT_SCHEMA}}
escalation_rule: {{ESCALATION_RULE}}
并行写入前增加幂等、权限、超时、重试上限和审计记录。运行前仍需替换: {{MODEL_ID}}, {{BATCH_SIZE}}, {{OUTPUT_SCHEMA}}, {{ESCALATION_RULE}}
准备当前 endpoint、模型 ID、价格页版本、批量数据、并发上限、输出 schema 和升级规则;部署时重新核对缓存、批量和云平台费用。
固定 model、max_tokens、输入文档和 schema,用 1、4、8 worker 跑小样本。
逐任务记录成功状态、p95 延迟、输入/输出 token、重试、费用和人工修正。
困难样本送 Sonnet/Opus 或人工复核;并行写入使用幂等 ID、权限和审计。
按 token、费率、失败重试复算成本;预算或 schema 失败时降低 max_tokens、拆分或升级,不把 64k 上限当作稳定产出。
官方表和发布说明给出定位与历史价格,但动态费率、alias、配额和性能比较需重开;案例数字是发布方口径。
Haiku 4.5 适合做高并发、低延迟的子任务和实时助手:官方模型表给出 $1/$5 每百万输入/输出 token、200k 上下文、64k 最大输出,但复杂任务应由更大模型规划和复核。
适合的任务:分类/抽取、短摘要、客服、代码补全、并行子任务、实时多轮交互。
不适合的任务:把它作为唯一规划器处理高风险长链路重构或深层安全推理。
适用的模型版本:Claude Haiku 4.5;API 名称 claude-haiku-4-5。
适用的客户端、Agent 或 API:Claude API、Bedrock、Vertex AI、Claude Code;平台 alias/区域支持需核验。
推荐的推理档位和参数:没有统一 adaptive thinking;如果任务确需思考,测试 extended thinking 预算并设置硬 max_tokens,日常高吞吐优先关闭额外思考。
{
"model": "claude-haiku-4-5",
"max_tokens": 2048,
"system": "你是批量任务子代理。只完成分配的子任务,输出严格 JSON。缺少证据时返回 null,不要猜测。",
"messages": [
{
"role": "user",
"content": "<task>\n提取订单状态与金额。\n</task>\n<document>\n...\n</document>\n<output_schema>{status:string|null, amount:number|null, evidence:string[]}</output_schema>"
}
]
}推荐的路由工作流:大模型生成任务计划和验收标准 → 并行 Haiku 子代理执行抽取/检索/草拟 → 服务端 schema/权限校验 → 大模型或规则引擎合并与复核。
用真实批量数据分别测试 1、4、8 个并行 Haiku worker;固定输入、超时、输出 schema 和重试规则。
记录每条任务的成功率、p95 延迟、token、费用、重试次数和人工修正率。
对困难样本加入升级队列,让 Sonnet/Opus 复核,而不是无限重试 Haiku。
评估 prompt caching、Batch API 或 provider-specific batching 是否改变成本;价格以当前官方页面为准。
Anthropic 发布页:Haiku 4.5 价格 $1 输入/$5 输出每百万 token;称其为 Sonnet 4 级编码性能、三分之一成本和超过两倍速度,但这些是发布方比较。
官方模型表:Haiku 4.5 context window 200k、max output 64k、比较延迟为 fastest、extended thinking 支持、adaptive thinking 不支持。
官方模型表列出所有当前模型支持文本/图像输入、文本输出、多语言和 vision;具体 Haiku 能力仍需以 endpoint 规格核对。
官方发布页建议 Sonnet 4.5 可规划复杂问题,再并行编排多个 Haiku 4.5 子任务。
“三分之一成本/两倍速度”是相对 Sonnet 4 的官方发布表述,未公开完整 workload、吞吐与置信区间。
1/$5 价格不包含缓存、批量、区域/云平台差异或长上下文额外计价;部署前看当前价格表。
并行 worker 会放大工具、限流、重复写入和数据泄露风险;必须有幂等 ID、权限和审计。
64k max output 不代表任务会稳定生成 64k;max_tokens 仍应按任务设置以控制成本。
官方的产品定位是“fastest model with near-frontier intelligence”(合规短引);这里的取舍是吞吐优先,不是复杂推理无条件最优。
Claude Platform Docs / Models overview 与 Anthropic 发布说明 · 原文日期: 2025-10-15 · 编辑日期: 2026-09-20
阅读原始来源Claude Haiku 4.5
请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。