查看所有模型

在 Tabbit 中使用 GPT-5.6 Luna

在 Tabbit 中使用

在 Tabbit 中使用 GPT-5.6 Luna

精选提示词

查看全部提示词
官方OpenAI

The builder’s guide to GPT-5.6:Luna 的模型选择、代理编排与缓存

OpenAI 的官方构建者指南不提供一段“万能提示词”,而是建议通过模型路由、推理努力等级、保留 reasoning、原生压缩、多智能体、程序化工具调用和 Prompt Caching 共同设计工作流。对 Luna 的核心建议是:把它放在高频、低延迟、重复步骤和抽取类任务中;复杂判断可用更高能力的模型。

官方AWS Machine Learning Blog

Get started with OpenAI GPT-5.6 on Amazon Bedrock:推理、工具调用与缓存

AWS 文章把 Luna 定位为高吞吐、低延迟的分类、摘要和路由模型,并通过 Responses API 示例说明如何设置 reasoning effort、调用工具、把模型输出完整带回下一轮,以及使用 prompt cache key 和 cache breakpoint 缓存稳定前缀。

官方OpenAI Developers

GPT-5.6 Luna API 模型参数与成本配置

官方模型页确认 Luna 的当前 API ID、价格、推理档位、工具面和速率限制,可直接作为高吞吐路由的配置基线,但 272K 以上的单次请求会触发整单加价。

媒体DMarketer Tayeeb

GPT-5.6 Prompting Guide:Luna 的工作契约与模型路由

这篇面向营销、写作和开发工作流的长文把“提示词技巧”改写为工作契约:定义 Goal、Context、Output、Boundaries 和 Completion check,再依据任务风险选择 Luna、Terra 或 Sol。它建议把 Luna 用于抽取、分类、转换和高频任务,用更高能力模型承担复杂判断,并强调“reasoning effort 是计算预算,不是真实性开关”。

社区Reddit,r/codex

Reddit Codex:Luna 子代理与 Sol 审查的多模型路由配置

这不是官方配置,而是 Codex 用户分享的个人路由方案:把 Luna 用于普通实现、头脑风暴和子代理,把 Sol high 用于计划审查和最终判断,把快速模型用于测试执行。它把“便宜模型做高频工作、强模型做质量闸门”落成可执行配置。

媒体CodeRabbit Blog

GPT-5.6 Luna 低风险首轮与升级路由工作流

把 Luna 放在摘要、标签、轻量 review precheck 和脚手架等低风险首轮,并把失败或复杂任务升级给 Terra/Sol,是 CodeRabbit 对三档编码 Agent 的可复用路由建议。

测评与真实反馈

查看全部测评
媒体BenchLM.ai

GPT-5.6 Luna Benchmarks & Pricing(公开基准与定价)

BenchLM 将 GPT-5.6 Luna 评为 67.3/100,在 218 个模型中排名第 23。它的公开证据最强项是 Coding:73.0 分、6/135;Agentic 为 43/130。页面同时列出 $0.20/百万输入 token、$1.20/百万输出 token、缓存输入 $0.020/百万 token。BenchLM 特别提醒:速度尚未独立测量,部分类别没有足够的公开证据,排名不应脱离证据覆盖率理解。

社区Reddit,r/codex

GPT-5.6 Luna is really underrated:Codex 用户体验

发帖者认为,GPT-5.6 Luna 在 medium thinking 下接近 GPT-5.4 mini 的速度和能力,在 high effort 下可以接近 GPT-5.5 medium。评论区有用户把 Luna Max 设为默认模型,也有人认为 Luna 的质量和价格优势明显,但对速度、上下文和任务完成可靠性的评价并不一致。

社区Reddit,r/hermesagent

Thoughts after using GPT-5.6 Luna for 48 hours

这篇 48 小时体验与 Codex 社区的积极评价形成对照:作者在 Hermes agent 的个人助理场景使用 GPT-5.6 Luna high,认为它“聪明但慢”、会反复迭代、消耗额度较快、偶尔漏掉明确指令,并且在凭据和验证码场景中更保守。作者的结论是:它更适合较大的编码项目,不适合作为轻量个人助理的默认模型。

社区X

GPT-5.6 Luna Max vs. Sol Medium:X 用户成本实测

X 的 Google 索引摘要显示,作者比较了 GPT-5.6 Luna Max 与 Sol Medium,并称 Luna 使用了更多 token,但平均每个 session 成本约 $1.20,而 Sol 约 $29。该结果适合用作“单次任务成本可能远低于旗舰模型”的社区实测线索,不能替代完整实验报告。

媒体Semgrep Security Research

GPT-5.6 Luna Semgrep IDOR 安全基准与每真阳性成本

Semgrep 的安全测评认为 Luna 在每个真阳性成本上约比更重模型低 6 倍、F1 仅有边际牺牲,但 precision/recall 与 harness 强相关,不能把裸模型分数直接当生产防护能力。

OpenAI

在 Tabbit 中使用 GPT-5.6 Luna

整理 GPT-5.6 Luna 的模型路由、提示词工作契约、成本基准与代码场景反馈,适合高频和易验证任务选型。