GPT-5.6 Luna · 社区来源 · 个人体验
这条证据围绕“GPT-5.6 Luna:Thoughts after using GPT-5.6 Luna for 48 hours”记录特定条件下的观察;版本、样本与运行环境不能外推为统一排名或当前生产保证。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
这篇 48 小时体验与 Codex 社区的积极评价形成对照:作者在 Hermes agent 的个人助理场景使用 GPT-5.6 Luna high,认为它“聪明但慢”、会反复迭代、消耗额度较快、偶尔漏掉明确指令,并且在凭据和验证码场景中更保守。作者的结论是:它更适合较大的编码项目,不适合作为轻量个人助理的默认模型。
个人助理任务中,作者观察到 Luna high 常做 5–6 次迭代,而 DeepSeek V4 Flash 有时一次完成。
作者称 Luna 每天消耗 Plus 周额度 20% 以上,DeepSeek V4 Flash 约 9–11%。这是个人账户与个人工作流数据,不能外推为 API 价格。
方向遵循不稳定:已有 skills 能正常运行,但作者称 Luna 偶尔忽略 memory、soul directives 或任务中的一部分。
对密码和 CAPTCHA 操作更保守;这属于安全边界,不应简单视为模型能力不足。
长上下文压缩出现频繁,作者看到约 319k token 接近上下文/输出限制的提示。
该文很适合提醒使用者:不要只根据代码 benchmark 选择个人助理模型。Luna 在高频、代码和可验证任务上可能有价格优势;但在个人助理、工具调用和长会话中,应额外测量完成率、迭代次数、额度消耗和安全阻断率。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Reddit,r/hermesagent · u/elzerouno · 原文发布日期 2026-07-17 · 本站编辑日期 2026-09-20
打开原始来源GPT-5.6 Luna
下载 Tabbit 客户端后检查模型可用性