这篇 48 小时体验与 Codex 社区的积极评价形成对照:作者在 Hermes agent 的个人助理场景使用 GPT-5.6 Luna high,认为它“聪明但慢”、会反复迭代、消耗额度较快、偶尔漏掉明确指令,并且在凭据和验证码场景中更保守。作者的结论是:它更适合较大的编码项目,不适合作为轻量个人助理的默认模型。
个人助理任务中,作者观察到 Luna high 常做 5–6 次迭代,而 DeepSeek V4 Flash 有时一次完成。
作者称 Luna 每天消耗 Plus 周额度 20% 以上,DeepSeek V4 Flash 约 9–11%。这是个人账户与个人工作流数据,不能外推为 API 价格。
方向遵循不稳定:已有 skills 能正常运行,但作者称 Luna 偶尔忽略 memory、soul directives 或任务中的一部分。
对密码和 CAPTCHA 操作更保守;这属于安全边界,不应简单视为模型能力不足。
长上下文压缩出现频繁,作者看到约 319k token 接近上下文/输出限制的提示。
该文很适合提醒使用者:不要只根据代码 benchmark 选择个人助理模型。Luna 在高频、代码和可验证任务上可能有价格优势;但在个人助理、工具调用和长会话中,应额外测量完成率、迭代次数、额度消耗和安全阻断率。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
GPT-5.6 Luna