这份 Claude Code 技能现场报告在相同任务、启用和不启用技能、每种条件重复 3 次的情况下,发现 Haiku 5.5 的技能收益可能在不同运行之间改变方向;单次截图不足以判断技能是否有效。
适合判断的任务:对同一 Claude Code skill 做启用/不启用对照,并检查 Haiku 5.5 的结果是否在重复运行中稳定。
不适合外推的任务:把一项技能的少量任务结果推广到所有编码任务;把一轮正收益当作稳定提升;用这份报告给 Haiku 5.5 排名或判断其整体编码能力。
适用的模型版本:Claude Haiku 5.5;作者说明这些技能此前也在 Haiku 4.5 上测试过,并在本帖重新运行到 Haiku 5.5。
测试环境或客户端:Claude Code skills;作者测试了此前 Haiku 4.5 测试中的 3 个技能,正文没有公开 Claude Code 版本、完整技能文件、模型 ID、effort、工具集、任务输入和评分脚本。
推理档位和参数:未注明;帖子没有报告 effort、采样参数、token、延迟或成本。
作者公开的方法是:
选取此前用于 Haiku 4.5 测试的 3 个 Claude Code skills。
在 Haiku 5.5 上运行完全相同的任务。
每个任务分别在启用技能和不启用技能的条件下运行 3 次。
作者称在相同运行之间,6 个 model/task readings 中有 4 个发生变化;帖子没有展示 6 个 reading 的完整明细表。
作者称每个结果都有带日期、经过 hash 验证的 receipt,并在原帖附上完整报告链接;本条只依据 Reddit 正文和可见评论,没有打开外部报告。
作者给出的 3 次结果如下:
| 运行 | 结果 | 作者解释 |
|---|---|---|
| Run 1 | +0.549 | Clearly helped |
| Run 2 | -0.010 | No clear difference |
| Run 3 | +0.235 | Too few answers to tell |
这组结果说明,同一技能和任务在一次运行中可能显示明显收益,在另一次运行中接近零,在第三次运行中又不足以判断。作者指出,如果只停在 Run 1,会得出“技能效果很好”的结论;如果只停在 Run 2,则可能得出“技能没用”的结论。
在 Haiku 4.5 上,作者称该技能在 3 次运行中的 2 次显示明显帮助。
在 Haiku 5.5 上,作者称 3 次运行全部无法得出结论。
帖子没有给出该技能的具体分数、任务输入或评分维度。
作者主动说明:每个技能只有一个任务、答案数量很少;这不能说明 Haiku 5.5 的整体编码能力,也不是模型排名。可见评论中作者进一步说明,3 次重复只能给出结果波动的下限;如果同一条件下 3 次运行都可能改变方向,就不应把单次运行称为结果。
运行条件:相同任务;启用技能与不启用技能;每种条件重复 3 次。
技能数量:3 个,来自作者之前的 Haiku 4.5 测试。
重复波动:作者称 6 个 model/task readings 中有 4 个在相同运行之间发生变化。
Git workflow + Haiku 5.5:+0.549、-0.010、+0.235。
Documentation skill:Haiku 4.5 为 3 次中 2 次明显帮助;Haiku 5.5 为 3 次全部 inconclusive。
证据保存:作者称每个结果都有 dated、hash-verified receipt;正文未展示 receipt 内容。
未报告字段:技能原文、任务输入、模型固定 ID、effort、工具、温度或采样设置、评分函数、答案数、token、延迟、成本、运行随机性控制和统计区间。
这份报告支持的结论是:Haiku 5.5 上技能收益存在明显运行间波动,单次成功案例或单张截图不能证明技能有效。对技能做判断时,应至少保留启用/不启用对照和多次重复,并把结果写成区间或波动范围,而不是只报一个分数。
报告不支持以下结论:某个技能普遍有效或无效;Haiku 5.5 整体编码能力优于或劣于 Haiku 4.5;Haiku 5.5 的性能排名;或者技能收益的具体成本、延迟和 token 变化。样本只有少量技能和任务,且正文没有完整输入、评分规则和运行配置。
固定 Haiku 5.5 的模型 ID、Claude Code 版本、effort、工具、system prompt、技能版本和任务输入;保存技能启用与不启用两套配置。
对每个技能运行相同任务,至少完成 3 次启用和 3 次不启用运行;保存每次输出、时间戳、模型服务信息和 hash receipt。
预先定义评分维度、分数范围、最小实际收益和“无法判断”的规则;不要在看到结果后改变评分方式。
同时记录答案数量、成功率、错误类型、token、延迟和成本;如果单次结果方向变化,报告区间和样本量,不把最高分当代表值。
扩大到多个任务和多个仓库后再判断技能是否有稳定收益,并将 Haiku 5.5 与其他模型的结果放在相同任务、相同工具和相同评分标准下比较。
Claude Haiku 5.5