Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Claude Haiku 4.5

BenchLM 对 Claude Haiku 4.5 的六项公开证据

原始来源

BenchLM

作者BenchLM

原文日期2026-08-17

Tabbit 整理2026-08-19

查看原文

一句话结论

BenchLM 页面仅展示 6 条有来源的 Haiku 4.5 结果:SWE-bench Verified 73.3%、VulcanBench v3 78.3%、JobBench 16.0%,说明“快速小模型”不能用单一编码成绩代替全任务评估。

测试环境

  • 数据时间:2026-08-17。

  • 目录状态:页面给出 6 条 source-displayable benchmark rows,自定义公共分 57.06/100、#86/218;类别权重与模型覆盖不完整。

  • 来源类型:SWE 行标注 Provider exact,VulcanBench/EEBench/JobBench 行标注 Benchmark exact;Math 行来自 Epoch AI leaderboard。

  • 复现状态:这是公开证据账本/聚合页,不是单一统一 harness 的一次运行。

输入/配置

页面的 benchmark 行链接至 Anthropic 发布页、VulcanBench、EEBench、JobBench 和 Epoch AI;未为每行公开 prompt、temperature、effort、重复次数和运行轨迹。

结果数据

基准得分页面证据/观察
SWE-bench Verified73.3%Provider exact,链接 Anthropic Haiku 4.5 发布页
VulcanBench v378.3%Benchmark exact
EEBench V13.5%Benchmark exact,页面显示明显弱项
JobBench16.0%Benchmark exact,Agentic 类别
FrontierMath v2 Tiers 1–35.903%Benchmark exact
FrontierMath v2 Tier 42.083%Benchmark exact

结论

Haiku 4.5 在部分软件工程/指令类测试有可用成绩,但在 BenchLM 的工作 Agent 与 FrontierMath 条目明显较弱,适合做高速/低成本子任务,而不是默认承担所有难题。

局限

  • BenchLM 自定义总分 57.06/100、#86/218 受权重、覆盖和动态目录影响,不能当作通用能力真值。

  • 各行证据等级、harness 和日期不同,横向比较需回到原始 benchmark。

  • 公开页不包含完整原始输入与失败轨迹,严格复现需要访问各来源。

  • Haiku 的 73.3% 与 Anthropic 发布页对 Sonnet/Haiku 的相对表述不能直接混算。

复现步骤

  1. 逐行打开 BenchLM 的原始链接,锁定 benchmark 版本和任务 split。

  2. 固定 Haiku 4.5 snapshot、API 参数、工具 scaffold 和超时后重跑 SWE、JobBench、数学/指令任务。

  3. 分项报告成功率、成本、延迟、重试和失败类型;不要报告自定义总分而省略覆盖率。

  4. 与 Sonnet 4.5/4.6 做同 harness 对照,确认路由是否真的带来成本/质量优势。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Haiku 4.5

在 Tabbit 中使用并对比模型

Claude Haiku 4.5

相关测评

媒体Anthropic News / Introducing Claude Haiku 4.52025-10-15

Claude Haiku 4.5 官方发布:速度、成本、编码与电脑使用

社区Reddit / r/ClaudeAI2025-10-15

Reddit 用户对 Claude Haiku 4.5 的真实体验与限额边界

Claude Haiku 4.5

相关提示词

媒体Claude Platform Docs / Prompting best practices

Claude Haiku 4.5 的低延迟任务清晰指令与工具边界

媒体Claude Platform Docs / Models overview 与 Anthropic 发布说明2025-10-15

Claude Haiku 4.5 的价格、上下文与批量 Agent 配置