BenchLM 页面仅展示 6 条有来源的 Haiku 4.5 结果:SWE-bench Verified 73.3%、VulcanBench v3 78.3%、JobBench 16.0%,说明“快速小模型”不能用单一编码成绩代替全任务评估。
数据时间:2026-08-17。
目录状态:页面给出 6 条 source-displayable benchmark rows,自定义公共分 57.06/100、#86/218;类别权重与模型覆盖不完整。
来源类型:SWE 行标注 Provider exact,VulcanBench/EEBench/JobBench 行标注 Benchmark exact;Math 行来自 Epoch AI leaderboard。
复现状态:这是公开证据账本/聚合页,不是单一统一 harness 的一次运行。
页面的 benchmark 行链接至 Anthropic 发布页、VulcanBench、EEBench、JobBench 和 Epoch AI;未为每行公开 prompt、temperature、effort、重复次数和运行轨迹。
| 基准 | 得分 | 页面证据/观察 |
|---|---|---|
| SWE-bench Verified | 73.3% | Provider exact,链接 Anthropic Haiku 4.5 发布页 |
| VulcanBench v3 | 78.3% | Benchmark exact |
| EEBench V1 | 3.5% | Benchmark exact,页面显示明显弱项 |
| JobBench | 16.0% | Benchmark exact,Agentic 类别 |
| FrontierMath v2 Tiers 1–3 | 5.903% | Benchmark exact |
| FrontierMath v2 Tier 4 | 2.083% | Benchmark exact |
Haiku 4.5 在部分软件工程/指令类测试有可用成绩,但在 BenchLM 的工作 Agent 与 FrontierMath 条目明显较弱,适合做高速/低成本子任务,而不是默认承担所有难题。
BenchLM 自定义总分 57.06/100、#86/218 受权重、覆盖和动态目录影响,不能当作通用能力真值。
各行证据等级、harness 和日期不同,横向比较需回到原始 benchmark。
公开页不包含完整原始输入与失败轨迹,严格复现需要访问各来源。
Haiku 的 73.3% 与 Anthropic 发布页对 Sonnet/Haiku 的相对表述不能直接混算。
逐行打开 BenchLM 的原始链接,锁定 benchmark 版本和任务 split。
固定 Haiku 4.5 snapshot、API 参数、工具 scaffold 和超时后重跑 SWE、JobBench、数学/指令任务。
分项报告成功率、成本、延迟、重试和失败类型;不要报告自定义总分而省略覆盖率。
与 Sonnet 4.5/4.6 做同 harness 对照,确认路由是否真的带来成本/质量优势。
Claude Haiku 4.5