GPT-5.6 Terra

GPT-5.6 Terra · 测评与证据

GPT-5.6 Terra,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

SonarSource 在 4,444 个 Java 任务上复测 Sol 与 Terra,能说明静态代码质量和安全检测样本中的差异,不能替代真实仓库验证。

SonarSource · 查看证据

OpenAI GPT-5.6 发布页把 Terra 放在 Sol 与 Luna 的系列定位中,并将基准、价格和任务类型分开呈现;没有公开 Terra 的业务成功率。

OpenAI 官方发布页 · 查看证据

完整测评与相关内容

模型深度阅读

总览 · 简体中文

GPT-5.6 Terra:模型定位、获取方式与适用边界

从 API 规格、Sol 与 Luna 的差异、访问入口、价格边界和评测风险,判断 GPT-5.6 Terra 是否适合你的工作流。

精选证据

官方厂商自报

GPT-5.6 Terra System Card 安全防护与 Agent 边界

OpenAI System Card 将 Terra 的安全能力放在具体工具、沙箱和提示注入测试中;结果支持安全边界评估,不等于生产防护保证。

来源OpenAI Deployment Safety Hub
原文日期2026-07-09
采集2026-08-20
来源具体观察
2026-07-09 System Card,2026-08-03 变更记录;覆盖 Production Benchmarks、数据破坏规避、电脑使用确认、连接器/搜索提示注入及网络安全/生物化学测试。
已公布条件
网络安全描述使用 headless Linux box、常用工具和 3 次 rollout pass@1;ExploitBench 使用 5 个 seeds,完整样本未公开。
能力
官方厂商自报

GPT-5.6 Terra SonarSource 4,444 Java 任务代码质量与安全复测

SonarSource 在 4,444 个 Java 任务上复测 Sol 与 Terra,能说明静态代码质量和安全检测样本中的差异,不能替代真实仓库验证。

来源SonarSource
原文日期2026-08-06
采集2026-08-20

待验证:本次未能重新核实原文。

来源具体观察
2026-07-11 SonarSource 复测;4,444 个 Java 任务,使用 SonarQube 规则检测代码质量与安全问题,并比较 Sol/Terra 结果。
已公布条件
该评测是 SonarSource 的任务集与分析流水线,不是通用端到端 Agent;完整 prompt、重复次数和每个 snapshot 未全部公开。
编程Agent
官方厂商自报

OpenAI 官方 GPT-5.6 Terra 基准、定价与任务边界

OpenAI GPT-5.6 发布页把 Terra 放在 Sol 与 Luna 的系列定位中,并将基准、价格和任务类型分开呈现;没有公开 Terra 的业务成功率。

来源OpenAI 官方发布页
原文日期2026-07-10
采集2026-08-20
来源具体观察
2026-07-09 发布页,2026-07-30 价格更新;比较 GPT-5.6 系列的任务示例、推理档位和 API 价格。
已公布条件
页面示例来自发布演示与官方测评,未公开统一随机种子、完整输入和 Terra 专属前端成功率。
能力
媒体 / 基准方独立测量

GPT-5.6 Terra Artificial Analysis 智能、成本与编码 Agent 指数

Artificial Analysis 的 GPT-5.6 Terra 页面把 Intelligence Index、Coding Agent Index 与成本位置放在同一比较框架,适合做成本—能力初筛。

来源Artificial Analysis
原文日期2026-07-09
采集2026-08-20

待验证:本次未能重新核实原文。

来源具体观察
2026-07-09 页面;Terra max Intelligence Index 55、Coding Agent Index 77;页面将其放在 Sol 与 Luna 的成本/能力对照中。
已公布条件
Artificial Analysis 的指数和价格按其公开 harness 与当日快照计算;不等于 OpenAI API 的所有档位或用户账单。
能力

全部来源

全部来源

9 / 9
官方厂商自报

GPT-5.6 Terra System Card 安全防护与 Agent 边界

OpenAI System Card 将 Terra 的安全能力放在具体工具、沙箱和提示注入测试中;结果支持安全边界评估,不等于生产防护保证。

来源OpenAI Deployment Safety Hub
原文日期2026-07-09
采集2026-08-20
来源具体观察
2026-07-09 System Card,2026-08-03 变更记录;覆盖 Production Benchmarks、数据破坏规避、电脑使用确认、连接器/搜索提示注入及网络安全/生物化学测试。
已公布条件
网络安全描述使用 headless Linux box、常用工具和 3 次 rollout pass@1;ExploitBench 使用 5 个 seeds,完整样本未公开。
能力
官方厂商自报

GPT-5.6 Terra SonarSource 4,444 Java 任务代码质量与安全复测

SonarSource 在 4,444 个 Java 任务上复测 Sol 与 Terra,能说明静态代码质量和安全检测样本中的差异,不能替代真实仓库验证。

来源SonarSource
原文日期2026-08-06
采集2026-08-20

待验证:本次未能重新核实原文。

来源具体观察
2026-07-11 SonarSource 复测;4,444 个 Java 任务,使用 SonarQube 规则检测代码质量与安全问题,并比较 Sol/Terra 结果。
已公布条件
该评测是 SonarSource 的任务集与分析流水线,不是通用端到端 Agent;完整 prompt、重复次数和每个 snapshot 未全部公开。
编程Agent
官方厂商自报

OpenAI 官方 GPT-5.6 Terra 基准、定价与任务边界

OpenAI GPT-5.6 发布页把 Terra 放在 Sol 与 Luna 的系列定位中,并将基准、价格和任务类型分开呈现;没有公开 Terra 的业务成功率。

来源OpenAI 官方发布页
原文日期2026-07-10
采集2026-08-20
来源具体观察
2026-07-09 发布页,2026-07-30 价格更新;比较 GPT-5.6 系列的任务示例、推理档位和 API 价格。
已公布条件
页面示例来自发布演示与官方测评,未公开统一随机种子、完整输入和 Terra 专属前端成功率。
能力
媒体 / 基准方独立测量

GPT-5.6 Terra Artificial Analysis 智能、成本与编码 Agent 指数

Artificial Analysis 的 GPT-5.6 Terra 页面把 Intelligence Index、Coding Agent Index 与成本位置放在同一比较框架,适合做成本—能力初筛。

来源Artificial Analysis
原文日期2026-07-09
采集2026-08-20

待验证:本次未能重新核实原文。

来源具体观察
2026-07-09 页面;Terra max Intelligence Index 55、Coding Agent Index 77;页面将其放在 Sol 与 Luna 的成本/能力对照中。
已公布条件
Artificial Analysis 的指数和价格按其公开 harness 与当日快照计算;不等于 OpenAI API 的所有档位或用户账单。
能力
社区个人体验

GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准

这条证据记录“GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。

来源Reddit r/LLMDevs
原文日期2026-08-18
采集2026-08-20

待验证:本次未能重新核实原文。

模型/版本
GPT-5.6 Terra;来源日期 2026-08-18;不混用其他快照或推理档位。
平台/评测环境
Reddit r/LLMDevs;以该来源公布的平台与 harness 为观察单位。
样本/日期边界
采集日期 2026-08-20;“GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准”不能在其公开样本之外推出统一通过率。
能力
社区个人体验

Artificial Analysis:GPT-5.6 Terra 在智能—成本曲线上的位置

这条证据记录“Artificial Analysis:GPT-5.6 Terra 在智能—成本曲线上的位置”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。

来源X / Artificial Analysis 官方账号
原文日期2026-07-11
采集2026-08-20

待验证:本次未能重新核实原文。

模型/版本
GPT-5.6 Terra;来源日期 2026-07-11;不混用其他快照或推理档位。
平台/评测环境
X / Artificial Analysis 官方账号;以该来源公布的平台与 harness 为观察单位。
样本/日期边界
采集日期 2026-08-20;“Artificial Analysis:GPT-5.6 Terra 在智能—成本曲线上的位置”不能在其公开样本之外推出统一通过率。
能力
社区个人体验

25+ Claude Code/Codex Agent 无人值守循环:Terra 的批量研究实战

这条证据记录“25+ Claude Code/Codex Agent 无人值守循环:Terra 的批量研究实战”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。

来源Reddit / r/ClaudeCode
原文日期2026-08-19
采集2026-08-20

待验证:本次未能重新核实原文。

模型/版本
GPT-5.6 Terra;来源日期 2026-08-19;不混用其他快照或推理档位。
平台/评测环境
Reddit / r/ClaudeCode;以该来源公布的平台与 harness 为观察单位。
样本/日期边界
采集日期 2026-08-20;“25+ Claude Code/Codex Agent 无人值守循环:Terra 的批量研究实战”不能在其公开样本之外推出统一通过率。
能力
社区个人体验

四模型同提示 iPhone UI 盲测:Terra 的真实开发任务证据

这条证据记录“四模型同提示 iPhone UI 盲测:Terra 的真实开发任务证据”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。

来源X
原文日期2026-07-10
采集2026-08-20

待验证:本次未能重新核实原文。

模型/版本
GPT-5.6 Terra;来源日期 2026-07-10;不混用其他快照或推理档位。
平台/评测环境
X;以该来源公布的平台与 harness 为观察单位。
样本/日期边界
采集日期 2026-08-20;“四模型同提示 iPhone UI 盲测:Terra 的真实开发任务证据”不能在其公开样本之外推出统一通过率。
能力
社区个人体验

Codex 中 Terra High 与 Luna Extra High 的个人限额对照

这条证据记录“Codex 中 Terra High 与 Luna Extra High 的个人限额对照”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。

来源X
原文日期2026-07-12
采集2026-08-20

待验证:本次未能重新核实原文。

模型/版本
GPT-5.6 Terra;来源日期 2026-07-12;不混用其他快照或推理档位。
平台/评测环境
X;以该来源公布的平台与 harness 为观察单位。
样本/日期边界
采集日期 2026-08-20;“Codex 中 Terra High 与 Luna Extra High 的个人限额对照”不能在其公开样本之外推出统一通过率。
能力

GPT-5.6 Terra

在 Tabbit 中比较 GPT-5.6 Terra

客户端中的模型、功能和权限以当前账户为准。