Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
社区Claude Haiku 5.5

Reddit 重复测试:Claude Code 技能在 Haiku 5.5 上的结果会反转

原始来源

Reddit r/ClaudeAI

作者u/maverickman1111

Tabbit 整理1970-01-01

查看原文

一句话结论

这份 Claude Code 技能现场报告在相同任务、启用和不启用技能、每种条件重复 3 次的情况下,发现 Haiku 5.5 的技能收益可能在不同运行之间改变方向;单次截图不足以判断技能是否有效。

适用场景

  • 适合判断的任务:对同一 Claude Code skill 做启用/不启用对照,并检查 Haiku 5.5 的结果是否在重复运行中稳定。

  • 不适合外推的任务:把一项技能的少量任务结果推广到所有编码任务;把一轮正收益当作稳定提升;用这份报告给 Haiku 5.5 排名或判断其整体编码能力。

  • 适用的模型版本:Claude Haiku 5.5;作者说明这些技能此前也在 Haiku 4.5 上测试过,并在本帖重新运行到 Haiku 5.5。

  • 测试环境或客户端:Claude Code skills;作者测试了此前 Haiku 4.5 测试中的 3 个技能,正文没有公开 Claude Code 版本、完整技能文件、模型 ID、effort、工具集、任务输入和评分脚本。

  • 推理档位和参数:未注明;帖子没有报告 effort、采样参数、token、延迟或成本。

测评方法

作者公开的方法是:

  1. 选取此前用于 Haiku 4.5 测试的 3 个 Claude Code skills。

  2. 在 Haiku 5.5 上运行完全相同的任务。

  3. 每个任务分别在启用技能和不启用技能的条件下运行 3 次。

  4. 作者称在相同运行之间,6 个 model/task readings 中有 4 个发生变化;帖子没有展示 6 个 reading 的完整明细表。

  5. 作者称每个结果都有带日期、经过 hash 验证的 receipt,并在原帖附上完整报告链接;本条只依据 Reddit 正文和可见评论,没有打开外部报告。

关键结果

Git workflow skill + Haiku 5.5

作者给出的 3 次结果如下:

运行结果作者解释
Run 1+0.549Clearly helped
Run 2-0.010No clear difference
Run 3+0.235Too few answers to tell

这组结果说明,同一技能和任务在一次运行中可能显示明显收益,在另一次运行中接近零,在第三次运行中又不足以判断。作者指出,如果只停在 Run 1,会得出“技能效果很好”的结论;如果只停在 Run 2,则可能得出“技能没用”的结论。

Documentation skill

  • 在 Haiku 4.5 上,作者称该技能在 3 次运行中的 2 次显示明显帮助。

  • 在 Haiku 5.5 上,作者称 3 次运行全部无法得出结论。

  • 帖子没有给出该技能的具体分数、任务输入或评分维度。

作者明确给出的限制

作者主动说明:每个技能只有一个任务、答案数量很少;这不能说明 Haiku 5.5 的整体编码能力,也不是模型排名。可见评论中作者进一步说明,3 次重复只能给出结果波动的下限;如果同一条件下 3 次运行都可能改变方向,就不应把单次运行称为结果。

原始数据

  • 运行条件:相同任务;启用技能与不启用技能;每种条件重复 3 次。

  • 技能数量:3 个,来自作者之前的 Haiku 4.5 测试。

  • 重复波动:作者称 6 个 model/task readings 中有 4 个在相同运行之间发生变化。

  • Git workflow + Haiku 5.5:+0.549、-0.010、+0.235。

  • Documentation skill:Haiku 4.5 为 3 次中 2 次明显帮助;Haiku 5.5 为 3 次全部 inconclusive。

  • 证据保存:作者称每个结果都有 dated、hash-verified receipt;正文未展示 receipt 内容。

  • 未报告字段:技能原文、任务输入、模型固定 ID、effort、工具、温度或采样设置、评分函数、答案数、token、延迟、成本、运行随机性控制和统计区间。

结论与边界

这份报告支持的结论是:Haiku 5.5 上技能收益存在明显运行间波动,单次成功案例或单张截图不能证明技能有效。对技能做判断时,应至少保留启用/不启用对照和多次重复,并把结果写成区间或波动范围,而不是只报一个分数。

报告不支持以下结论:某个技能普遍有效或无效;Haiku 5.5 整体编码能力优于或劣于 Haiku 4.5;Haiku 5.5 的性能排名;或者技能收益的具体成本、延迟和 token 变化。样本只有少量技能和任务,且正文没有完整输入、评分规则和运行配置。

复现说明

  1. 固定 Haiku 5.5 的模型 ID、Claude Code 版本、effort、工具、system prompt、技能版本和任务输入;保存技能启用与不启用两套配置。

  2. 对每个技能运行相同任务,至少完成 3 次启用和 3 次不启用运行;保存每次输出、时间戳、模型服务信息和 hash receipt。

  3. 预先定义评分维度、分数范围、最小实际收益和“无法判断”的规则;不要在看到结果后改变评分方式。

  4. 同时记录答案数量、成功率、错误类型、token、延迟和成本;如果单次结果方向变化,报告区间和样本量,不把最高分当代表值。

  5. 扩大到多个任务和多个仓库后再判断技能是否有稳定收益,并将 Haiku 5.5 与其他模型的结果放在相同任务、相同工具和相同评分标准下比较。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Haiku 5.5

在 Tabbit 中使用并对比模型

Claude Haiku 5.5

相关测评

媒体Anthropic2026-10-07

Claude Haiku 5.5 官方基准:高吞吐任务的成本与能力定位

媒体Artificial Analysis2026-10-07

Artificial Analysis:Claude Haiku 5.5 的智能指数与 Agent 任务独立测评

社区Reddit / r/ClaudeCode2026-10-08

Reddit ClaudeCode 小样本编码 Agent 对照测试:Haiku 5.5 Medium 是否足够做主力

社区Reddit r/ClaudeAI

Reddit 用户的 Claude Code 体验:Haiku 5.5 的上下文增长与 100k 门槛

Claude Haiku 5.5

相关提示词

媒体Anthropic Claude Platform Docs

Claude Haiku 5.5 迁移配置:从 Haiku 4.5 切换到 API 参数与工具集

媒体Anthropic Claude Platform Docs

Claude Haiku 5.5 官方提示指南:effort、搜索与 Agent 可靠性

媒体Anthropic Claude Platform Docs

Claude Haiku 5.5 客服工单路由分类提示词

社区Reddit r/ClaudeCode

Reddit 配置实录:在 Claude Code 中把搜索子代理切换到 Haiku 5.5