OpenAI 将 Terra 定位为日常工作的均衡层:官方表中它在编码、电脑使用、学术、工具使用和长上下文上明显强于 GPT-5.5 的若干项目,但这些数字是发布方结果,不能替代相同 harness 的独立复测。
模型/入口:GPT-5.6 Terra;OpenAI API、ChatGPT Work、Codex。页面同时比较 Sol、Luna、GPT-5.5 及其他模型。
推理/配置:页面区分 max、ultra 等设置;Terra 表格没有逐项公开 prompt、temperature、工具权限和重复次数。
价格:发布页列出 Terra 为输入 $2.50/1M tokens、输出 $15/1M tokens;页面更新说明 2026-07-30 将 Terra 价格下调 20%,X 官方更新帖进一步列出降价后的 API 价格为输入 $2、输出 $12。
评测范围:Agents’ Last Exam、GDPval-AA v2、Artificial Analysis Intelligence/Coding Agent Index、SWE-Bench Pro、DeepSWE、Terminal-Bench 2.1、OSWorld 2.0、BrowseComp、GPQA Diamond、MRCR v2、Toolathlon 等。
发布页没有公开每个评测的完整输入、样本数、抽样方式、重复次数、temperature、工具定义或错误明细;因此下表是可核对的官方结果账本,不是完整可复现测试包。
| 评测 | GPT-5.6 Terra | GPT-5.5 | 备注 |
|---|---|---|---|
| Agents’ Last Exam | 50.4% | 46.9% | 55 个领域的长周期专业工作流;发布方结果 |
| GDPval-AA v2 | 1,593 Elo | 1,493.7 Elo | Elo,不是准确率 |
| Artificial Analysis Intelligence Index v4.1 | 55 | 54.8 | 页面引用外部指数 |
| Artificial Analysis Coding Agent Index v1.1 | 77.4 | 76.4 | 页面引用外部指数 |
| SWE-Bench Pro | 63.4% | 59.4% | 真实代码库工程基准 |
| DeepSWE v1.1 | 69.6% | 67.0% | 长周期软件工程 |
| Terminal-Bench 2.1 | 87.4% | 85.6% | 命令行工作流 |
| 评测 | GPT-5.6 Terra | GPT-5.5 |
|---|---|---|
| OSWorld 2.0 | 50.2% | 47.5% |
| BrowseComp | 87.5% | 84.4% |
| GPQA Diamond | 92.9% | 93.6% |
| FrontierMath Tier 1–3 (v2) | 84.9% | 85.3% |
| AutomationBench | 15.2% | 12.9% |
| Toolathlon | 53.1% | 55.6% |
| OpenAI MRCR v2 8-needle 256K–512K | 89.6% | 81.5% |
| OpenAI MRCR v2 8-needle 512K–1M | 72.5% | 74.0% |
OSWorld 2.0 中,官方称 GPT-5.6 Sol 以 62.6% 超过 Opus 4.8,且输出 Token 减少 85%;Terra 的表格值为 50.2%,说明不能把 Sol 的宣传段落直接外推给 Terra。
Terra 在 SEC-Bench Pro 为 57.7%、ExploitBench 为 52.9%、ExploitGym 为 23.2%,显示网络安全能力较强但不应绕过访问控制或把结果当作安全授权。
Terra 的 OpenAI MRCR v2 256K–512K 为 89.6%,但在 512K–1M 为 72.5%;长上下文表现随区间变化,不能笼统称为“1M 上下文都可靠”。
发布页提供一个可复制的 Work 提示示例:Create an interactive spirograph to explain how it works. 这是官方展示案例,不是 Terra 单独的 benchmark 输入。
较适合:日常编码、命令行工程、浏览/电脑操作、长上下文检索、常规工具编排和成本受控的 Agent 执行。
需要升级/复核:最高难度架构规划、关键安全/财务决策、对 GPQA/FrontierMath Tier 4 等困难学术题要求极高的任务,以及需要完整视觉验收的复杂设计交付。
模型选择:官方数据支持把 Terra 作为 GPT-5.5 以上的均衡候选,但是否优于更便宜的 Luna 或更强的 Sol,要结合任务成本、延迟和验收失败代价测量。
所有结果来自 OpenAI 发布页,部分列为外部指数,缺少公开 harness 与原始逐题输出。
不同评测的工具、时间预算、提示和评分方式不同,不能跨表直接比较百分比。
价格、模型 alias、可用入口会变化;本文只记录采集日可见页面。
https://developers.openai.com/api/docs/models/gpt-5.6-terra 在 Tabbit 中返回 ERR_CONNECTION_CLOSED,未使用其搜索摘要或猜测内容补写本文。
已请求用户接管 Tabbit 中该标签页核对;若恢复访问,应补录模型 ID、上下文上限和 API 参数,并与本页结果分开标注。
固定 Terra 的 API snapshot、推理档位、temperature、工具 schema、上下文长度和输出上限。
先复测 SWE-Bench/Terminal-Bench 类代码任务,再测 OSWorld/BrowseComp、GPQA、MRCR 长上下文任务。
为每项任务记录成功率、p50/p95 延迟、输入/输出 token、工具调用次数、费用和人工复核结果。
与 GPT-5.5、Luna、Sol 保持相同 harness 对照;报告逐题失败原因,不把官方表格当作自己的复现结果。
GPT-5.6 Terra