Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Claude Haiku 4.5 · 媒体来源 · 厂商自报

Claude Haiku 4.5 官方发布:速度、成本、编码与电脑使用

Anthropic 2025-10-15 发布说明覆盖 Haiku 4.5 的 SWE-bench、Augment coding、slide text 和 computer-use 案例,但各项目 prompt、参数、样本和 harness 未完整公开;相对性能是厂商/合作方口径。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源厂商自报编辑日期 2026-09-20

测试条件速查

来源
Anthropic 发布说明;厂商/合作方报告
任务
SWE-bench、Augment coding、slide text、computer use
配置
prompt、参数、样本和 harness 未完整公开
日期
2025-10-15 发布;价格和可用性需重开

关键数据与适用场景

一句话结论

Anthropic 将 Haiku 4.5 定位为实时助手、客服、pair programming、Claude Code 子 Agent 和电脑使用的低成本高速模型,强调接近 Sonnet 4 的编码质量,但 Sonnet 4.5 仍是复杂编码前沿模型。

测试环境

  • 模型/入口:Claude Haiku 4.5;Claude API、Claude Code、应用、Amazon Bedrock、Google Vertex AI。

  • 成本:$1/百万输入、$5/百万输出 token。

  • 基准与案例:SWE-bench Verified、Augment agentic coding、instruction-following for slide text、电脑使用、内部安全评估;不同项目 harness 不同。

  • 安全:Anthropic 发布 ASL-2 分类和系统卡链接,说明在自动对齐评估中表现出较低问题行为率。

输入/配置

发布页没有公开每个基准的完整 prompt、模型参数、样本数、重复次数和错误明细;称 Augment agentic coding evaluation 中达到 Sonnet 4.5 的 90% 性能,且在幻觉/速度/成本方向有产品案例。

结果数据

  • Anthropic 定性称 Haiku 4.5 提供类似 Sonnet 4 的编码水平,成本约三分之一、速度超过两倍。

  • Augment agentic coding evaluation:Haiku 4.5 达到 Sonnet 4.5 性能的 90%(发布方引用)。

  • Anthropic 称 Haiku 4.5 在电脑使用任务上超过 Sonnet 4,并在实时助手、客服、pair programming 和多 Agent 项目中更响应。

  • 发布页引用 slide text instruction-following 案例:Haiku 4.5 65%,高级模型 44%;未公开完整任务集与评分规则。

结论

对于短响应、批量抽取、实时交互和可拆分子任务,Haiku 4.5 的成本/延迟优势有明确产品价值;难题规划、跨文件架构和关键决策仍需 Sonnet/Opus 或独立复核。

局限

  • 所有数字来自 Anthropic 或合作方/客户案例,属于官方或合作方报告,缺少完整公开 harness。

  • “90% of Sonnet 4.5”是相对性能,不是 90% 绝对成功率。

  • 电脑使用和网页任务存在 prompt injection、权限与误操作风险;发布页的安全评估不能代替生产隔离。

  • 发布日价格/性能不能保证长期稳定,模型 alias、云平台和限流可能变化。

复现步骤

  1. 固定 claude-haiku-4-5 snapshot、API provider、max_tokens、工具权限和任务集。

  2. 选择短问答、批量抽取、代码补全、电脑表单和子 Agent 五类任务,与 Sonnet 4.5 对照。

  3. 记录正确率/逐题 resolved、p50/p95 延迟、输入输出 token、调用次数、费用和安全事件。

  4. 在关键任务加入升级/人工复核,分别报告 Haiku 单独结果和路由后的最终结果。

能支持的判断

  • 支持说明官方发布的任务定位、相对性能和安全边界。

不能支持的判断

  • 不支持绝对成功率、统一 harness 或生产隔离结论。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Anthropic News / Introducing Claude Haiku 4.5 · Anthropic · 原文发布日期 2025-10-15 · 本站编辑日期 2026-09-20

打开原始来源

Claude Haiku 4.5

在 Tabbit 中比较 Claude Haiku 4.5

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Claude Haiku 4.5 是什么、多少钱,什么时候值得用?

用可核对来源说明 Claude Haiku 4.5 的 20 万上下文、1/5 美元 API 价格、速度、获取渠道、生命周期和升级边界。

相关评测

BenchLM 对 Claude Haiku 4.5 的六项公开证据BenchLM 截至 2026-08-17 展示 Haiku 4.5 的六条 source-displayable rows,涵盖 SWE-bench、VulcanBench、EEBench、JobBench 与 FrontierMath;各行条件不同,不能用聚合分数替代任务级判断。Reddit 用户对 Claude Haiku 4.5 的真实体验与限额边界Reddit 多位 Claude.ai/Claude Code 用户报告 Haiku 4.5 的短写作、翻译、长文本、轻量编码和 web search 体验,但正负反馈冲突且没有统一 prompt、snapshot、工具或重复次数;配额随账号和时间变化。Claude Haiku 4.5:Claude Haiku 4.5 的低延迟任务清晰指令与工具边界围绕“Claude Haiku 4.5 的低延迟任务清晰指令与工具边界”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。Claude Haiku 4.5:Claude Haiku 4.5 的价格、上下文与批量 Agent 配置围绕“Claude Haiku 4.5 的价格、上下文与批量 Agent 配置”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。