官方模型页确认 Luna 的当前 API ID、价格、推理档位、工具面和速率限制,可直接作为高吞吐路由的配置基线,但 272K 以上的单次请求会触发整单加价。
适合的任务:成本敏感、高体量的分类、抽取、摘要、标签、轻量代码解释和可验证的流水线步骤。
不适合的任务:音频/视频、微调、需要复杂跨文件架构判断的任务;页面只描述能力与计费,不承诺业务准确率。
适用的模型版本:gpt-5.6-luna。
适用的客户端、Agent 或 API:OpenAI API;Responses API 支持页面列出的工具,Chat Completions 也可用。
推荐的推理档位和参数:批量任务先从 none 或 low 开始;medium 作为默认档位;只有验收失败且可量化改善时再试 high、xhigh 或 max。
这是按官方字段整理的最小配置清单;鉴权、SDK 初始化和业务工具实现需要由应用补齐。
model = "gpt-5.6-luna"
reasoning.effort = "low" # none | low | medium | high | xhigh | max
endpoint = "/v1/responses"
price_per_1M:
input = 0.20
cached_input = 0.02
output = 1.20Responses API 工具页将 web search、file search、image generation、code interpreter、hosted shell、apply patch、skills、computer use、MCP 和 tool search 标为 Supported;函数调用、结构化输出和流式输出也标为 Supported。
先固定 gpt-5.6-luna 和 low,选择一批有明确标签或测试判定的任务,记录每次输入/输出 tokens、耗时、通过率和重试数。
对同一任务集做 none、low、medium 的小样本 A/B;把通过率提升与额外 token/时延同时记录。
将静态系统指令、工具定义和参考资料放在稳定前缀,变化的用户输入放在后部,以便观察缓存命中。
对单次输入超过 272K tokens 的请求先做预算;官方规则是整次请求按 2 倍 input、1.5 倍 output 计价,必要时测试分块方案。
如果模型输出将触发写文件、发送消息、支付或删除数据,增加人工确认、沙箱或回滚;低单价不改变动作风险。
运行一周后按“每个通过且经人工验收的结果成本”评估,而不是按 token 单价直接决定路由。
定位:官方称 Luna 面向 cost-sensitive、high-volume workloads,约对应早期 GPT-5 系列的 nano 档。
推理:none、low、medium(默认)、high、xhigh、max。
上下文/输出:1,050,000 context window,128,000 max output tokens;知识截止 2026-02-16。
价格:输入 $0.20、缓存输入 $0.02、输出 $1.20(每 1M tokens)。
长输入:超过 272K input tokens 时,完整请求按 2 倍输入、1.5 倍输出计价。
模态:文本输入/输出、图像输入;音频和视频不支持。
API:流式、函数调用、结构化输出支持;微调不支持。
Responses 工具:web search、file search、image generation、code interpreter、hosted shell、apply patch、skills、computer use、MCP、tool search 均为 Supported。
Tier 1:500 RPM、500,000 TPM、5,000,000 batch queue limit;更高层级按账户页面显示为准。
模型目录页没有给出 Luna 在你的业务上的准确率、首轮通过率或平均延迟;不要把“Fast”当作 SLA。
272K 规则是整次请求的倍数计费,不是仅对超出部分加价;长文档任务必须实测分块和缓存。
工具支持只在 Responses API 工具表中确认;具体工具调用仍需处理权限、失败、恶意工具输出和人工确认。
页面显示的是别名;若需要复现实验,应记录采集日期和实际可用 snapshot,当前页面未公开独立快照名。
官方定位是 “designed for cost-sensitive, high-volume workloads”,它说明使用方向,不等于低风险或零返工。
GPT-5.6 Luna