GPT-5.6 Luna 模型测评导航
汇总 GPT-5.6 Luna 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。
媒体
2 条已核对来源的资料GPT-5.6 Luna Benchmarks & Pricing(公开基准与定价)
BenchLM 将 GPT-5.6 Luna 评为 67.3/100,在 218 个模型中排名第 23。它的公开证据最强项是 Coding:73.0 分、6/135;Agentic 为 43/130。页面同时列出 $0.20/百万输入 token、$1.20/百万输出 token、缓存输入 $0.020/百万 token。BenchLM 特别提醒:速度尚未独立测量,部分类别没有足够的公开证据,排名不应脱离证据覆盖率理解。
GPT-5.6 Luna Semgrep IDOR 安全基准与每真阳性成本
Semgrep 的安全测评认为 Luna 在每个真阳性成本上约比更重模型低 6 倍、F1 仅有边际牺牲,但 precision/recall 与 harness 强相关,不能把裸模型分数直接当生产防护能力。
社区
10 条已核对来源的资料GPT-5.6 Luna is really underrated:Codex 用户体验
发帖者认为,GPT-5.6 Luna 在 medium thinking 下接近 GPT-5.4 mini 的速度和能力,在 high effort 下可以接近 GPT-5.5 medium。评论区有用户把 Luna Max 设为默认模型,也有人认为 Luna 的质量和价格优势明显,但对速度、上下文和任务完成可靠性的评价并不一致。
Thoughts after using GPT-5.6 Luna for 48 hours
这篇 48 小时体验与 Codex 社区的积极评价形成对照:作者在 Hermes agent 的个人助理场景使用 GPT-5.6 Luna high,认为它“聪明但慢”、会反复迭代、消耗额度较快、偶尔漏掉明确指令,并且在凭据和验证码场景中更保守。作者的结论是:它更适合较大的编码项目,不适合作为轻量个人助理的默认模型。
GPT-5.6 Luna Max vs. Sol Medium:X 用户成本实测
X 的 Google 索引摘要显示,作者比较了 GPT-5.6 Luna Max 与 Sol Medium,并称 Luna 使用了更多 token,但平均每个 session 成本约 $1.20,而 Sol 约 $29。该结果适合用作“单次任务成本可能远低于旗舰模型”的社区实测线索,不能替代完整实验报告。
GPT-5.6 Sol、Terra、Luna:Reddit 三档基准与路由建议
帖子汇总了三档模型的价格与多个 benchmark,并给出路由建议:Terra 作为多数工作负载默认模型,Sol 留给最难的 agent/terminal 任务,Luna 用于高频流水线。帖子同时引发了关于幻觉、订阅额度和“benchmark 是否代表真实体验”的讨论。
I benchmarked GPT-5.6 Sol/Luna/Terra by role:角色化测评
作者没有把模型压成一个总分,而是将其放进战略决策、仓库执行和代码修复等角色中测量。结果显示 Sol high 适合主战略会话,Sol medium 更快且消耗更少;在这套小样本执行测试中,Luna high/max 没有击败已有路线,甚至出现过度推理。
GPT-5.6 Luna 与 Gemini 3.6 Flash:文档视觉任务的成本反例
帖子标题用 benchmark 宣称 Luna 优于 Google 模型,但评论提供了重要的生产反例:在 PDF 文档审计、分类、问答和 bounding box 任务中,评论者认为 Gemini 3.6 Flash 更稳定、更遵循指令,月成本约 $7,000;Luna 预估约 $2,000,但视觉能力和 bounding box 质量更差。
GPT-5.6 Luna vs DeepSeek V4 Flash:缓存与真实任务成本
讨论围绕“Luna 是否在性能/成本上胜过 DeepSeek V4 Flash”展开。原帖作者强调长任务中的 99.9% cache hit;回复者称 Luna 可能少用 token、速度更快,但美元消耗约为 DeepSeek 的 2–3 倍。另一位用户认为价格变化后 DeepSeek 仍更便宜,但 Luna 在 coding benchmark 上更强。结论高度依赖缓存率、订阅配额、峰谷价格和 harness。
5.6 Luna Extra High is the work horse I needed
作者在 Plus 账户上认为 Luna Extra High 是更实用的 workhorse:Sol 用于“破解难题”和制定计划,Luna Extra High 用于日常执行。评论区同时出现相反体验:有人认为 Luna x-high 会长时间搜索却只改几行代码,也有人认为 Luna Max 在相同成本下比 Terra 更实用。
Agents on Rails:8 个模型、21 项原子任务
Google 索引显示,Rails 团队将 8 个模型放在 21 项原子任务上比较。摘要给出的 Luna 结果是:默认 medium reasoning 下 73% 的 runs 成功,63 次运行总成本约 90 美分,并被标为最便宜模型。
GPT-5.6 Luna Reddit Codex 额度与缓存成本实测
一条 Luna-only Codex Plus 会话用 3.52M 未缓存输入、73.79M 缓存输入和 205K 输出计算出约 $2.43 的 API 等价成本,却消耗约 16–17% 周额度,说明订阅额度权重与公开 API 价格不能直接画等号。
GPT-5.6 Luna
在 Tabbit 中使用并对比模型
汇总 GPT-5.6 Luna 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。