社区反馈两极:有人在 20 分钟试用中认为 Haiku 4.5 写作、上下文和轻量编码接近快速 Sonnet,也有人报告不遵循指令、写作质量下降、限额/可用性阻碍测试;应把它当作短任务候选并用自己的 eval 验证。
环境:Claude.ai、Claude Code 和订阅用户的对话/编码体验;模型入口和限额因账号/时间不同。
输入/配置:社区用户报告短写作、翻译、大文本、多轮故事、轻量编码,以及开启 web search 的问答;没有统一 prompt 或任务集。
结果形式:个人体验、相互矛盾的评论和订阅限额反馈。
原帖没有公开完整可复制 prompt。可复用的测试方法是把目标风格、上下文和验收条件写得具体,并在 web search 场景明确要求调用工具;不应把评论中的自然语言体验包装成“Haiku 提示词”。
一位用户称约 20 分钟试用中,Haiku 4.5 写作自然、理解意图、轻量编码表现良好,并可处理长文本翻译;认为像快速 Sonnet 4。
其他评论称模型忽略指令、只求完成而缺少质量,写作风格/情节连续性变差;也有用户认为它反应快且输出质量足以满足小模型任务。
多条评论集中在周/月限额、Sonnet/Haiku 可用性和订阅体验,而不是模型能力本身;这些反馈说明生产可用性还受配额和入口影响。
一位用户观察到开启 web search 后,如果不明确要求,Haiku 不一定主动搜索;这是单个账户/提示的体验,不是官方保证。
Haiku 4.5 值得用于可回退的快速分类、翻译、草拟和子 Agent;对长故事、复杂指令、关键代码和需要搜索的任务,必须明确验收、工具触发和升级路径,并记录配额带来的实际失败。
评论无统一模型 snapshot、系统 prompt、temperature、工具、上下文和重试信息。
正负体验冲突,不能推导总体满意率或性能排名。
订阅限额会改变用户可见体验,不能与 API 价格/吞吐直接类比。
Web search 是否调用取决于产品入口和提示,不宜外推为 API 行为。
在同一 Claude 入口分别测试短写作、翻译、轻量代码、长上下文和搜索任务,各重复 10 次。
明确写出风格、工具调用、完成标准和失败时的升级条件。
记录正确率、指令遵循、上下文连续性、搜索触发、延迟、输出 token、配额消耗和人工评分。
用 Sonnet 4.5/4.6 对照,并把订阅限额与 API 资源限制单独报告。
Claude Haiku 4.5