Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Claude Haiku 4.5 · 媒体来源 · 独立测量

BenchLM 对 Claude Haiku 4.5 的六项公开证据

BenchLM 截至 2026-08-17 展示 Haiku 4.5 的六条 source-displayable rows,涵盖 SWE-bench、VulcanBench、EEBench、JobBench 与 FrontierMath;各行条件不同,不能用聚合分数替代任务级判断。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

平台
BenchLM 六条 source-displayable rows;不是统一 harness
结果
SWE-bench、VulcanBench、EEBench、JobBench、FrontierMath 条件不同
配置
temperature、effort、重复次数和轨迹未公开
日期
数据截至 2026-08-17;动态目录需重开

关键数据与适用场景

一句话结论

BenchLM 页面仅展示 6 条有来源的 Haiku 4.5 结果:SWE-bench Verified 73.3%、VulcanBench v3 78.3%、JobBench 16.0%,说明“快速小模型”不能用单一编码成绩代替全任务评估。

测试环境

  • 数据时间:2026-08-17。

  • 目录状态:页面给出 6 条 source-displayable benchmark rows,自定义公共分 57.06/100、#86/218;类别权重与模型覆盖不完整。

  • 来源类型:SWE 行标注 Provider exact,VulcanBench/EEBench/JobBench 行标注 Benchmark exact;Math 行来自 Epoch AI leaderboard。

  • 复现状态:这是公开证据账本/聚合页,不是单一统一 harness 的一次运行。

输入/配置

页面的 benchmark 行链接至 Anthropic 发布页、VulcanBench、EEBench、JobBench 和 Epoch AI;未为每行公开 prompt、temperature、effort、重复次数和运行轨迹。

结果数据

基准得分页面证据/观察
SWE-bench Verified73.3%Provider exact,链接 Anthropic Haiku 4.5 发布页
VulcanBench v378.3%Benchmark exact
EEBench V13.5%Benchmark exact,页面显示明显弱项
JobBench16.0%Benchmark exact,Agentic 类别
FrontierMath v2 Tiers 1–35.903%Benchmark exact
FrontierMath v2 Tier 42.083%Benchmark exact

结论

Haiku 4.5 在部分软件工程/指令类测试有可用成绩,但在 BenchLM 的工作 Agent 与 FrontierMath 条目明显较弱,适合做高速/低成本子任务,而不是默认承担所有难题。

局限

  • BenchLM 自定义总分 57.06/100、#86/218 受权重、覆盖和动态目录影响,不能当作通用能力真值。

  • 各行证据等级、harness 和日期不同,横向比较需回到原始 benchmark。

  • 公开页不包含完整原始输入与失败轨迹,严格复现需要访问各来源。

  • Haiku 的 73.3% 与 Anthropic 发布页对 Sonnet/Haiku 的相对表述不能直接混算。

复现步骤

  1. 逐行打开 BenchLM 的原始链接,锁定 benchmark 版本和任务 split。

  2. 固定 Haiku 4.5 snapshot、API 参数、工具 scaffold 和超时后重跑 SWE、JobBench、数学/指令任务。

  3. 分项报告成功率、成本、延迟、重试和失败类型;不要报告自定义总分而省略覆盖率。

  4. 与 Sonnet 4.5/4.6 做同 harness 对照,确认路由是否真的带来成本/质量优势。

能支持的判断

  • 支持按公开 benchmark 行区分任务强弱。

不能支持的判断

  • 不支持把六行聚合成普遍能力或直接与 Anthropic 相对宣传混比。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

BenchLM · BenchLM · 原文发布日期 2026-08-17 · 本站编辑日期 2026-09-20

打开原始来源

Claude Haiku 4.5

在 Tabbit 中比较 Claude Haiku 4.5

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Claude Haiku 4.5 是什么、多少钱,什么时候值得用?

用可核对来源说明 Claude Haiku 4.5 的 20 万上下文、1/5 美元 API 价格、速度、获取渠道、生命周期和升级边界。

相关评测

Claude Haiku 4.5 官方发布:速度、成本、编码与电脑使用Anthropic 2025-10-15 发布说明覆盖 Haiku 4.5 的 SWE-bench、Augment coding、slide text 和 computer-use 案例,但各项目 prompt、参数、样本和 harness 未完整公开;相对性能是厂商/合作方口径。Reddit 用户对 Claude Haiku 4.5 的真实体验与限额边界Reddit 多位 Claude.ai/Claude Code 用户报告 Haiku 4.5 的短写作、翻译、长文本、轻量编码和 web search 体验,但正负反馈冲突且没有统一 prompt、snapshot、工具或重复次数;配额随账号和时间变化。Claude Haiku 4.5:Claude Haiku 4.5 的价格、上下文与批量 Agent 配置围绕“Claude Haiku 4.5 的价格、上下文与批量 Agent 配置”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。Claude Haiku 4.5:Claude Haiku 4.5 的低延迟任务清晰指令与工具边界围绕“Claude Haiku 4.5 的低延迟任务清晰指令与工具边界”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。