Claude Haiku 4.5 · 媒体来源 · 独立测量
BenchLM 截至 2026-08-17 展示 Haiku 4.5 的六条 source-displayable rows,涵盖 SWE-bench、VulcanBench、EEBench、JobBench 与 FrontierMath;各行条件不同,不能用聚合分数替代任务级判断。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
BenchLM 页面仅展示 6 条有来源的 Haiku 4.5 结果:SWE-bench Verified 73.3%、VulcanBench v3 78.3%、JobBench 16.0%,说明“快速小模型”不能用单一编码成绩代替全任务评估。
数据时间:2026-08-17。
目录状态:页面给出 6 条 source-displayable benchmark rows,自定义公共分 57.06/100、#86/218;类别权重与模型覆盖不完整。
来源类型:SWE 行标注 Provider exact,VulcanBench/EEBench/JobBench 行标注 Benchmark exact;Math 行来自 Epoch AI leaderboard。
复现状态:这是公开证据账本/聚合页,不是单一统一 harness 的一次运行。
页面的 benchmark 行链接至 Anthropic 发布页、VulcanBench、EEBench、JobBench 和 Epoch AI;未为每行公开 prompt、temperature、effort、重复次数和运行轨迹。
| 基准 | 得分 | 页面证据/观察 |
|---|---|---|
| SWE-bench Verified | 73.3% | Provider exact,链接 Anthropic Haiku 4.5 发布页 |
| VulcanBench v3 | 78.3% | Benchmark exact |
| EEBench V1 | 3.5% | Benchmark exact,页面显示明显弱项 |
| JobBench | 16.0% | Benchmark exact,Agentic 类别 |
| FrontierMath v2 Tiers 1–3 | 5.903% | Benchmark exact |
| FrontierMath v2 Tier 4 | 2.083% | Benchmark exact |
Haiku 4.5 在部分软件工程/指令类测试有可用成绩,但在 BenchLM 的工作 Agent 与 FrontierMath 条目明显较弱,适合做高速/低成本子任务,而不是默认承担所有难题。
BenchLM 自定义总分 57.06/100、#86/218 受权重、覆盖和动态目录影响,不能当作通用能力真值。
各行证据等级、harness 和日期不同,横向比较需回到原始 benchmark。
公开页不包含完整原始输入与失败轨迹,严格复现需要访问各来源。
Haiku 的 73.3% 与 Anthropic 发布页对 Sonnet/Haiku 的相对表述不能直接混算。
逐行打开 BenchLM 的原始链接,锁定 benchmark 版本和任务 split。
固定 Haiku 4.5 snapshot、API 参数、工具 scaffold 和超时后重跑 SWE、JobBench、数学/指令任务。
分项报告成功率、成本、延迟、重试和失败类型;不要报告自定义总分而省略覆盖率。
与 Sonnet 4.5/4.6 做同 harness 对照,确认路由是否真的带来成本/质量优势。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
BenchLM · BenchLM · 原文发布日期 2026-08-17 · 本站编辑日期 2026-09-20
打开原始来源Claude Haiku 4.5
下载 Tabbit 客户端后检查模型可用性