一位 ClaudeCode 用户在真实中型混合语言代码库上做的小样本对照显示,Haiku 5.5 Medium 在一次跨语言 Agent 任务中与 Sonnet 5.5 Medium 达到同等结果,但 Low 漏验、高档位请求数和成本明显增加;这个结果适合作为个人路由实验的起点,不能当作通用编码排名。
适合的任务:代码库约定明确、需要运行测试和少量跨文件修改的日常编码 Agent;尤其适合先用 Medium 做低成本默认路由,再把高风险任务交给更大模型。
不适合的任务:把一次代码库、一次 Agent 任务和作者个人判定外推到所有语言、仓库规模、工具 harness 或发布流程。
适用的模型版本:Claude Haiku 5.5(Low / Medium / High)、Claude Sonnet 5.5 Medium、GPT-6 Luna High、GPT-6.1 Sol Medium;具体 snapshot 未公开。
适用的客户端、Agent 或 API:ClaudeCode 语境下的编码 Agent;原帖未公开完整客户端版本、系统提示词、工具 schema、仓库地址或运行日志。
推荐的推理档位和参数:在该案例中优先尝试 Haiku 5.5 Medium;Low 需要额外验证,高档位在这次 Agent 任务中没有带来质量增益。生产路由仍需用自己的任务集复测。
代码库:真实中型混合语言代码库,Rust 核心加一层 legacy scripting;作者没有公开仓库名称、提交 SHA 或代码快照。
对照模型与档位:Haiku 5.5 Low、Medium、High;Sonnet 5.5 Medium;GPT-6 Luna High;GPT-6.1 Sol Medium。
任务清单:两项根据模糊 bug 报告修复 Rust bug;一项包含 9 个植入 bug 和 2 个 decoy 的代码审查;两项根据棘手规格实现 Rust;一项故意把责任归错且含有歧义要求的判断任务;一项在真实仓库中按未成文约定跨语言迁移逻辑的 Agent 任务。
评测准备:作者称在任何模型运行前先写好答案键和隐藏测试;帖子没有公开答案键、隐藏测试、完整 prompt 或逐轮轨迹。
质量判定:从作者叙述可见的判断依据包括代码正确性、隐藏测试、是否遵循仓库约定、验证行为、诚实说明未验证部分和是否主动提出设计取舍;帖子没有公开正式评分表、盲评流程或独立 judge。
在作者认为“规格明确”的任务中,各模型均达到 100%;Haiku Low 在代码审查中漏掉一个编译错误。
在故意含有歧义的判断任务中,GPT-6 Luna 坚持自己的解读,而其他模型指出了歧义;原帖没有给出每个模型的完整答案或评分表。
真正拉开差距的是跨语言 Agent 任务:Haiku Medium 与 Sonnet Medium 都产出正确代码、通过全部测试、遵循仓库约定、说明无法验证的部分,并主动指出一个真实设计取舍。
| 模型配置 | 结果概述 | API 请求数 | 估算成本 |
|---|---|---|---|
| Haiku 5.5 Medium | 与 Sonnet Medium 同等完成跨语言迁移任务 | 29 | 约 $0.08 |
| Sonnet 5.5 Medium | 与 Haiku Medium 同等完成跨语言迁移任务 | 30 | 约 $1.68(按标价) |
| Haiku 5.5 Low | 能写出可工作代码,但跳过验证、漏掉错误处理 fallback,并给出与实际运行时间不符的“构建卡了一小时”理由 | 未公开 | 未公开 |
| Haiku 5.5 High | 结果正确,但没有额外质量收益 | 385 | 约 $1.03 |
作者据此估算,Haiku Medium 在该任务中的成本约为 Sonnet Medium 的二十分之一;这个比例只适用于该次运行的请求和标价,不能当作固定成本倍率。
这是一项有明确任务设计和隐藏测试的小样本个人对照。它支持一个有限的路由判断:Haiku 5.5 Medium 在作者的 Rust 加 legacy scripting 代码库中,能够承担一次真实跨语言 Agent 任务,并以远低于 Sonnet 的单次成本完成;Low 的验证纪律不够稳定,High 在这次任务上增加了大量请求却没有改善结果。Medium 可以进入日常编码的候选默认档位,高风险发布工作仍需要更强模型或独立审查。
样本非常小:只有一个代码库和一个真正区分模型的 Agent 任务;明确任务的 100% 结果还说明测试集可能不足以分离模型能力。
代码库、完整 prompt、答案键、隐藏测试、每轮工具调用、原始输出和评判记录没有公开,外部无法严格复现 29/30/385 次请求及对应成本。
结果来自作者单人判定,没有盲评、第二位 judge、重复运行或置信区间;“同等结果”和“没有质量收益”需要视为作者观察。
不同模型的 provider、缓存命中、客户端版本、工具权限、超时和重试策略没有完整记录,成本不能脱离这些条件比较。
Low 档失败包含验证遗漏与不实解释,但帖子没有拆分失败严重度;High 档成本也受一次异常的 385 次请求影响,不能据此推导普遍行为。
Reddit 评论区的其他用户体验未纳入结果;这些评论没有统一任务、配置或可复核产物,不能与原作者的受控小测混为一谈。
使用可公开分享的中型混合语言仓库固定 commit,预先编写答案键、隐藏测试和任务评分表;至少包含模糊 bug、植入 bug 审查、规格实现、歧义判断和跨语言迁移。
固定 ClaudeCode 版本、工具 schema、权限、上下文、超时、重试、provider、模型 snapshot 和 effort,分别运行 Haiku 5.5 Low / Medium / High、Sonnet 5.5 Medium 及其他对照模型。
对每次运行记录代码 diff、测试结果、验证动作、错误处理、设计取舍、请求数、输入输出 token、耗时和实际账单;每个任务重复多次。
用隐藏测试与盲评 judge 分开评分:功能正确性、仓库约定、验证完整性、事实陈述和设计判断分别计分。
报告每个 effort 档位的成功率、失败严重度、请求数和成本分布,不把单次 100% 或单次约二十分之一成本外推为模型定律。
作者的核心观察是 Haiku 5.5 Medium 在一次跨语言 Agent 任务中与 Sonnet Medium 达到同等结果,同时使用 29 次请求、成本约 $0.08;该数字只代表这次小样本运行。
Claude Haiku 5.5