这份官方模型页给出了 Terra 的模型 ID、推理档位、上下文/输出上限、价格和 Responses API 工具面,可直接作为接入前的配置基线。
适合的任务:需要在智能、速度和成本之间折中的文本/代码任务,以及需要调用搜索、文件、代码解释器或 MCP 的 Agent。
不适合的任务:音频或视频输入输出、需要微调的任务;页面没有承诺任何具体业务的成功率。
适用的模型版本:gpt-5.6-terra(页面当前展示的别名)。
适用的客户端、Agent 或 API:OpenAI API,尤其是 Responses API;Chat Completions 也列为支持的端点。
推荐的推理档位和参数:先用 medium(默认);对延迟/成本敏感的短任务尝试 none 或 low,对复杂排错和长程规划再逐级升到 high、xhigh 或 max。
下面是按官方页面字段整理的最小配置片段;它不包含鉴权、SDK 初始化和业务工具的完整实现。
model = "gpt-5.6-terra"
reasoning.effort = "medium" # none | low | medium | high | xhigh | max
endpoint = "/v1/responses"Responses API 页面列出的可用工具包括:web search、file search、image generation、code interpreter、hosted shell、apply patch、skills、computer use、MCP 和 tool search。需要结构化结果或函数调用时,页面也标为 Supported。
固定 gpt-5.6-terra,先以 medium 跑一组代表性任务,记录输入、输出、推理档位、工具调用数和总耗时。
对只需读取、改写或小范围修复的任务,分别用 low 与 medium 做小样本 A/B;只有质量差异明确时才提升档位。
对需要多轮工具协同的任务使用 Responses API,并只启用实际需要的工具;将工具返回的中间大对象留在工具侧,避免无必要地回传给模型。
当单次输入接近 272K tokens 时先计算完整请求成本;官方规则是超过该阈值后,整次请求按 2 倍输入、1.5 倍输出计价,必要时再考虑按文档/仓库分块。
记录是否使用缓存:缓存读取、缓存写入和未缓存输入分别按页面公布的费率核算,不要把缓存命中当成免费。
验证任务若涉及音视频或微调,先在路由层拒绝或改用支持该能力的模型。
模型定位:页面称 Terra 是“balances intelligence and cost”的 GPT-5.6 模型,约对应早期 GPT-5 系列的 mini 档。
reasoning.effort:支持 none、low、medium(默认)、high、xhigh、max。
上下文窗口:1,050,000 tokens;最大输出:128,000 tokens;知识截止日期:2026-02-16。
价格:每 1M tokens 输入 $2.00、缓存输入 $0.20、输出 $12.00;缓存写入按未缓存输入费率的 1.25 倍计费。
长输入规则:超过 272K input tokens 的完整请求按 2 倍输入、1.5 倍输出计价。
模态:文本输入/输出、图像输入;音频和视频标为不支持。
API 能力:流式输出、函数调用、结构化输出支持;微调不支持。
Responses API 工具:web search、file search、image generation、code interpreter、hosted shell、apply patch、skills、computer use、MCP、tool search 均标为支持。
Tier 1 速率限制:500 RPM、500,000 TPM、1,500,000 batch queue limit;更高 Tier 的页面数值需按账户实际显示为准。
这是能力与计费目录,不是独立质量测评;不能仅凭“Default”或价格推断某个业务的准确率。
页面列出的端点不等于每个端点都有相同的工具能力;工具说明明确限定在 Responses API。
272K 阈值按完整请求计费,不是只对超出部分加价;长文档工作流应在预算测试中验证分块是否更划算。
页面展示的是别名;若要锁定行为,应在上线前确认可用的具体 snapshot,当前页面未公开可供选择的独立快照名称。
官方定位语句是 “GPT-5.6 model that balances intelligence and cost”。这能支持“均衡档”定位,但不能替代业务基准。
GPT-5.6 Terra