Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
媒体Claude Haiku 5.5

Claude Haiku 5.5 官方基准:高吞吐任务的成本与能力定位

原始来源

Anthropic

作者Anthropic

原文日期2026-10-07

Tabbit 整理2026-10-07

查看原文

一句话结论

Anthropic 将 Claude Haiku 5.5 定位为面向摘要、压缩、数据库查询、分类、实时客服、浏览器操作和编码子代理的高吞吐模型;发布页给出的官方对照显示,它在部分知识工作、电脑使用、多学科推理、终端编码和视觉推理基准上明显高于 Haiku 4.5,但复杂的 Agent 编码仍应优先考虑更大的模型。

适用场景

  • 适合判断的任务:高频摘要和压缩、分类、数据库查询、浏览器操作、实时客服、短任务子代理,以及成本敏感的批量知识工作。

  • 不适合外推的任务:把发布页分数当作所有生产任务的保证;把 Haiku 5.5 的结果直接外推到复杂的长流程 Agent 编码;用不同工具环境或不同推理档位的结果做无条件比较。

  • 适用的模型版本:Claude Haiku 5.5;页面同时列出 Haiku 4.5、GPT-6 Luna 和 Claude Sonnet 5.5 作为对照。

  • 测试环境或客户端:Anthropic 发布页列出 GDPval-AA v2.1、AA-Briefcase v1.1、OSWorld 2.1、Humanity’s Last Exam、Terminal-Bench 4.0、FrontierCode 1.1 (Main) 和 Chartography;页面未公开完整运行环境。

  • 推理档位和参数:Haiku 5.5 支持可调 effort,页面图表展示 Low、Med、High、Xhigh、Max;未公开每项结果对应的完整参数。

测评方法

这是 Anthropic 在模型发布页上的官方基准汇总,不是独立机构重跑。页面按知识工作、电脑使用、多学科推理、Agent 编码和视觉推理列出模型分数,并在部分项目中注明测试条件:

  1. OSWorld 2.1 的结果标为 Offline subset;页面说明该基准衡量 Agent 操作真实电脑完成长流程、多步骤任务的能力。

  2. Humanity’s Last Exam 同时给出 no tools 和 with tools 两种结果。

  3. FrontierCode 1.1 使用页面标注的 Main 子集;对照表中 Sonnet 5.5 的结果标注为 Xhigh。

  4. 页面另提供 OSWorld 2.1、GDPval-AA 和 Humanity’s Last Exam 在不同 effort 档位下的成绩与单次成本曲线;OSWorld 的纵轴是 partial-credit score,并非统一的准确率指标。页面没有逐点列出完整数值。

  5. 页面将完整评估细节指向 Haiku 5.5 System Card;本条只采集发布页直接展示的内容。

关键结果

官方对照表

评测类别基准Haiku 5.5Haiku 4.5GPT-6 LunaSonnet 5.5
知识工作GDPval-AA v2.1162073514371840
知识工作AA-Briefcase v1.1157861413361824
电脑使用OSWorld 2.1(Offline subset)72.4%15.7%48.9%83.9%
多学科推理Humanity’s Last Exam(no tools)45.9%10.2%—56.9%
多学科推理Humanity’s Last Exam(with tools)57.4%18.7%—64.5%
Agent 编码Terminal-Bench 4.039.2%0.0%16.4%70.6%
Agent 编码FrontierCode 1.1 (Main)46.4%—42.4%52.1%(Xhigh)
视觉推理Chartography(no tools)46.4%6.4%29.1%61.6%

页面还给出了成本与能力曲线,但没有在正文中提供每个 effort 档位的完整表格。页面对 OSWorld 2.1 的说明是:该评测测量 Agent 在真实电脑上完成长流程、多步骤任务的能力。

价格与官方定位

Anthropic 发布页给出的每百万 token 价格如下。Haiku 5.5 的输入、输出和缓存读取价格分为提示词不超过或超过 100k token 两档:

项目Haiku 5.5(≤100k / >100k)Haiku 4.5Sonnet 5.5
Cache reads$0.01 / $0.05$0.10$0.10
Cache writes$0.125 / $0.625$1.25$2.50
Input tokens$0.10 / $0.50$1.00$2.00
Output tokens$0.50 / $2.50$5.00$10.00

页面称 Haiku 5.5 对不超过 100k token 的请求定价比 Haiku 4.5 低 90%,对超过 100k token 的请求低 50%;其脚注称 Haiku 4.5 约 90% 的请求落在不超过 100k 档,新 tokenizer 也会改变单项任务 token 用量。Anthropic 据此给出平均运行成本约低 75% 的估计。页面称 Haiku 5.5 在各模型的标准速度下是当时最快的模型,Opus Fast Mode 可能更快;它建议将 Haiku 用于子代理、压缩、摘要等边界较窄的工作。

原始数据

  • 基准名称:GDPval-AA v2.1、AA-Briefcase v1.1、OSWorld 2.1、Humanity’s Last Exam、Terminal-Bench 4.0、FrontierCode 1.1 (Main)、Chartography。

  • Haiku 5.5 数值:1620、1578、72.4%、45.9%(no tools)、57.4%(with tools)、39.2%、46.4%、46.4%。

  • 页面明确条件:OSWorld 2.1 为 Offline subset;Humanity’s Last Exam 分 no tools / with tools;Chartography 为 no tools;Sonnet 5.5 的 FrontierCode 结果标注 Xhigh。

  • 成本数据:Haiku 5.5 的 cache reads 为 $0.01 / $0.05、cache writes 为 $0.125 / $0.625、输入为 $0.10 / $0.50、输出为 $0.50 / $2.50,单位均为每百万 token,斜杠前后分别对应提示词不超过或超过 100k token。

  • 未公开字段:发布页没有给出每项 benchmark 的样本数量、逐题输入、随机种子、完整系统提示词、工具实现、硬件、token 上限、运行次数、置信区间或原始日志。

结论与边界

发布页支持的结论是:Haiku 5.5 相比 Haiku 4.5 在 Anthropic 列出的这组官方基准上都有明显提升,且官方把它放在速度、价格和高频窄任务的交集上。Terminal-Bench 4.0 中 Haiku 5.5 为 39.2%,低于同表的 Sonnet 5.5(70.6%),因此页面本身也把 Sonnet 5.5 和 Opus 5.5 作为复杂 Agent 编码的更合适选择。

这些结果是厂商发布页的快照。页面没有公开足够信息来独立复现实验,也不能据此估计目标业务的准确率、延迟、总成本或稳定性。尤其是不同 effort、工具条件、数据子集和未披露的运行配置,都会影响横向比较;生产选型仍需在自己的输入、工具和成本约束下重跑。

复现说明

  1. 将模型固定为 Claude Haiku 5.5,并记录 API 或客户端中的具体模型 ID、effort 档位、工具配置和 token 预算。

  2. 优先选择页面列出的 OSWorld 2.1、GDPval-AA、Humanity’s Last Exam、Terminal-Bench 4.0、FrontierCode 1.1 (Main) 和 Chartography;记录数据子集以及 no tools / with tools 条件。

  3. 为每个基准保存完整输入、评分脚本、运行次数、失败类型、输入输出 token、延迟和成本;页面未提供的配置不能凭空补齐。

  4. 将 Haiku 5.5 与对照模型放在同一 harness、同一数据版本和同一 effort 档位下比较,并单独报告不同工具条件的结果。

  5. 用业务自己的摘要、分类、浏览器操作和子代理任务做补充验收,不把官方发布页分数当作生产承诺。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Haiku 5.5

在 Tabbit 中使用并对比模型

Claude Haiku 5.5

相关测评

媒体Artificial Analysis2026-10-07

Artificial Analysis:Claude Haiku 5.5 的智能指数与 Agent 任务独立测评

社区Reddit / r/ClaudeCode2026-10-08

Reddit ClaudeCode 小样本编码 Agent 对照测试:Haiku 5.5 Medium 是否足够做主力

社区Reddit r/ClaudeAI

Reddit 用户的 Claude Code 体验:Haiku 5.5 的上下文增长与 100k 门槛

媒体Arena.ai Code Arena2026-10-08

Arena.ai WebDev 公开榜单:Claude Haiku 5.5 High 的实时排名

Claude Haiku 5.5

相关提示词

媒体Anthropic Claude Platform Docs

Claude Haiku 5.5 迁移配置:从 Haiku 4.5 切换到 API 参数与工具集

媒体Anthropic Claude Platform Docs

Claude Haiku 5.5 官方提示指南:effort、搜索与 Agent 可靠性

媒体Anthropic Claude Platform Docs

Claude Haiku 5.5 客服工单路由分类提示词

社区Reddit r/ClaudeCode

Reddit 配置实录:在 Claude Code 中把搜索子代理切换到 Haiku 5.5