Anthropic 将 Haiku 4.5 定位为实时助手、客服、pair programming、Claude Code 子 Agent 和电脑使用的低成本高速模型,强调接近 Sonnet 4 的编码质量,但 Sonnet 4.5 仍是复杂编码前沿模型。
模型/入口:Claude Haiku 4.5;Claude API、Claude Code、应用、Amazon Bedrock、Google Vertex AI。
成本:$1/百万输入、$5/百万输出 token。
基准与案例:SWE-bench Verified、Augment agentic coding、instruction-following for slide text、电脑使用、内部安全评估;不同项目 harness 不同。
安全:Anthropic 发布 ASL-2 分类和系统卡链接,说明在自动对齐评估中表现出较低问题行为率。
发布页没有公开每个基准的完整 prompt、模型参数、样本数、重复次数和错误明细;称 Augment agentic coding evaluation 中达到 Sonnet 4.5 的 90% 性能,且在幻觉/速度/成本方向有产品案例。
Anthropic 定性称 Haiku 4.5 提供类似 Sonnet 4 的编码水平,成本约三分之一、速度超过两倍。
Augment agentic coding evaluation:Haiku 4.5 达到 Sonnet 4.5 性能的 90%(发布方引用)。
Anthropic 称 Haiku 4.5 在电脑使用任务上超过 Sonnet 4,并在实时助手、客服、pair programming 和多 Agent 项目中更响应。
发布页引用 slide text instruction-following 案例:Haiku 4.5 65%,高级模型 44%;未公开完整任务集与评分规则。
对于短响应、批量抽取、实时交互和可拆分子任务,Haiku 4.5 的成本/延迟优势有明确产品价值;难题规划、跨文件架构和关键决策仍需 Sonnet/Opus 或独立复核。
所有数字来自 Anthropic 或合作方/客户案例,属于官方或合作方报告,缺少完整公开 harness。
“90% of Sonnet 4.5”是相对性能,不是 90% 绝对成功率。
电脑使用和网页任务存在 prompt injection、权限与误操作风险;发布页的安全评估不能代替生产隔离。
发布日价格/性能不能保证长期稳定,模型 alias、云平台和限流可能变化。
固定 claude-haiku-4-5 snapshot、API provider、max_tokens、工具权限和任务集。
选择短问答、批量抽取、代码补全、电脑表单和子 Agent 五类任务,与 Sonnet 4.5 对照。
记录正确率/逐题 resolved、p50/p95 延迟、输入输出 token、调用次数、费用和安全事件。
在关键任务加入升级/人工复核,分别报告 Haiku 单独结果和路由后的最终结果。
Claude Haiku 4.5