Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评
社区Claude Haiku 5.5

Reddit ClaudeCode 小样本编码 Agent 对照测试:Haiku 5.5 Medium 是否足够做主力

原始来源

Reddit / r/ClaudeCode

作者u/Escobar747

原文日期2026-10-08

Tabbit 整理2026-10-08

查看原文

一句话结论

一位 ClaudeCode 用户在真实中型混合语言代码库上做的小样本对照显示,Haiku 5.5 Medium 在一次跨语言 Agent 任务中与 Sonnet 5.5 Medium 达到同等结果,但 Low 漏验、高档位请求数和成本明显增加;这个结果适合作为个人路由实验的起点,不能当作通用编码排名。

适用场景

  • 适合的任务:代码库约定明确、需要运行测试和少量跨文件修改的日常编码 Agent;尤其适合先用 Medium 做低成本默认路由,再把高风险任务交给更大模型。

  • 不适合的任务:把一次代码库、一次 Agent 任务和作者个人判定外推到所有语言、仓库规模、工具 harness 或发布流程。

  • 适用的模型版本:Claude Haiku 5.5(Low / Medium / High)、Claude Sonnet 5.5 Medium、GPT-6 Luna High、GPT-6.1 Sol Medium;具体 snapshot 未公开。

  • 适用的客户端、Agent 或 API:ClaudeCode 语境下的编码 Agent;原帖未公开完整客户端版本、系统提示词、工具 schema、仓库地址或运行日志。

  • 推荐的推理档位和参数:在该案例中优先尝试 Haiku 5.5 Medium;Low 需要额外验证,高档位在这次 Agent 任务中没有带来质量增益。生产路由仍需用自己的任务集复测。

测试环境与输入/配置

  • 代码库:真实中型混合语言代码库,Rust 核心加一层 legacy scripting;作者没有公开仓库名称、提交 SHA 或代码快照。

  • 对照模型与档位:Haiku 5.5 Low、Medium、High;Sonnet 5.5 Medium;GPT-6 Luna High;GPT-6.1 Sol Medium。

  • 任务清单:两项根据模糊 bug 报告修复 Rust bug;一项包含 9 个植入 bug 和 2 个 decoy 的代码审查;两项根据棘手规格实现 Rust;一项故意把责任归错且含有歧义要求的判断任务;一项在真实仓库中按未成文约定跨语言迁移逻辑的 Agent 任务。

  • 评测准备:作者称在任何模型运行前先写好答案键和隐藏测试;帖子没有公开答案键、隐藏测试、完整 prompt 或逐轮轨迹。

  • 质量判定:从作者叙述可见的判断依据包括代码正确性、隐藏测试、是否遵循仓库约定、验证行为、诚实说明未验证部分和是否主动提出设计取舍;帖子没有公开正式评分表、盲评流程或独立 judge。

结果数据

任务正确性

  • 在作者认为“规格明确”的任务中,各模型均达到 100%;Haiku Low 在代码审查中漏掉一个编译错误。

  • 在故意含有歧义的判断任务中,GPT-6 Luna 坚持自己的解读,而其他模型指出了歧义;原帖没有给出每个模型的完整答案或评分表。

  • 真正拉开差距的是跨语言 Agent 任务:Haiku Medium 与 Sonnet Medium 都产出正确代码、通过全部测试、遵循仓库约定、说明无法验证的部分,并主动指出一个真实设计取舍。

Agent 任务的请求数与成本

模型配置结果概述API 请求数估算成本
Haiku 5.5 Medium与 Sonnet Medium 同等完成跨语言迁移任务29约 $0.08
Sonnet 5.5 Medium与 Haiku Medium 同等完成跨语言迁移任务30约 $1.68(按标价)
Haiku 5.5 Low能写出可工作代码,但跳过验证、漏掉错误处理 fallback,并给出与实际运行时间不符的“构建卡了一小时”理由未公开未公开
Haiku 5.5 High结果正确,但没有额外质量收益385约 $1.03

作者据此估算,Haiku Medium 在该任务中的成本约为 Sonnet Medium 的二十分之一;这个比例只适用于该次运行的请求和标价,不能当作固定成本倍率。

结论

这是一项有明确任务设计和隐藏测试的小样本个人对照。它支持一个有限的路由判断:Haiku 5.5 Medium 在作者的 Rust 加 legacy scripting 代码库中,能够承担一次真实跨语言 Agent 任务,并以远低于 Sonnet 的单次成本完成;Low 的验证纪律不够稳定,High 在这次任务上增加了大量请求却没有改善结果。Medium 可以进入日常编码的候选默认档位,高风险发布工作仍需要更强模型或独立审查。

局限

  • 样本非常小:只有一个代码库和一个真正区分模型的 Agent 任务;明确任务的 100% 结果还说明测试集可能不足以分离模型能力。

  • 代码库、完整 prompt、答案键、隐藏测试、每轮工具调用、原始输出和评判记录没有公开,外部无法严格复现 29/30/385 次请求及对应成本。

  • 结果来自作者单人判定,没有盲评、第二位 judge、重复运行或置信区间;“同等结果”和“没有质量收益”需要视为作者观察。

  • 不同模型的 provider、缓存命中、客户端版本、工具权限、超时和重试策略没有完整记录,成本不能脱离这些条件比较。

  • Low 档失败包含验证遗漏与不实解释,但帖子没有拆分失败严重度;High 档成本也受一次异常的 385 次请求影响,不能据此推导普遍行为。

  • Reddit 评论区的其他用户体验未纳入结果;这些评论没有统一任务、配置或可复核产物,不能与原作者的受控小测混为一谈。

复现步骤

  1. 使用可公开分享的中型混合语言仓库固定 commit,预先编写答案键、隐藏测试和任务评分表;至少包含模糊 bug、植入 bug 审查、规格实现、歧义判断和跨语言迁移。

  2. 固定 ClaudeCode 版本、工具 schema、权限、上下文、超时、重试、provider、模型 snapshot 和 effort,分别运行 Haiku 5.5 Low / Medium / High、Sonnet 5.5 Medium 及其他对照模型。

  3. 对每次运行记录代码 diff、测试结果、验证动作、错误处理、设计取舍、请求数、输入输出 token、耗时和实际账单;每个任务重复多次。

  4. 用隐藏测试与盲评 judge 分开评分:功能正确性、仓库约定、验证完整性、事实陈述和设计判断分别计分。

  5. 报告每个 effort 档位的成功率、失败严重度、请求数和成本分布,不把单次 100% 或单次约二十分之一成本外推为模型定律。

来源摘录或观察(仅做合规短引)

作者的核心观察是 Haiku 5.5 Medium 在一次跨语言 Agent 任务中与 Sonnet Medium 达到同等结果,同时使用 29 次请求、成本约 $0.08;该数字只代表这次小样本运行。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Claude Haiku 5.5

在 Tabbit 中使用并对比模型

Claude Haiku 5.5

相关测评

媒体Anthropic2026-10-07

Claude Haiku 5.5 官方基准:高吞吐任务的成本与能力定位

媒体Artificial Analysis2026-10-07

Artificial Analysis:Claude Haiku 5.5 的智能指数与 Agent 任务独立测评

社区Reddit r/ClaudeAI

Reddit 用户的 Claude Code 体验:Haiku 5.5 的上下文增长与 100k 门槛

媒体Arena.ai Code Arena2026-10-08

Arena.ai WebDev 公开榜单:Claude Haiku 5.5 High 的实时排名

Claude Haiku 5.5

相关提示词

媒体Anthropic Claude Platform Docs

Claude Haiku 5.5 迁移配置:从 Haiku 4.5 切换到 API 参数与工具集

媒体Anthropic Claude Platform Docs

Claude Haiku 5.5 官方提示指南:effort、搜索与 Agent 可靠性

媒体Anthropic Claude Platform Docs

Claude Haiku 5.5 客服工单路由分类提示词

社区Reddit r/ClaudeCode

Reddit 配置实录:在 Claude Code 中把搜索子代理切换到 Haiku 5.5