OpenAI System Card 将 Terra 的安全能力放在具体工具、沙箱和提示注入测试中;结果支持安全边界评估,不等于生产防护保证。
OpenAI Deployment Safety Hub · 查看证据GPT-5.6 Terra · 测评与证据
GPT-5.6 Terra,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
SonarSource 在 4,444 个 Java 任务上复测 Sol 与 Terra,能说明静态代码质量和安全检测样本中的差异,不能替代真实仓库验证。
SonarSource · 查看证据OpenAI GPT-5.6 发布页把 Terra 放在 Sol 与 Luna 的系列定位中,并将基准、价格和任务类型分开呈现;没有公开 Terra 的业务成功率。
OpenAI 官方发布页 · 查看证据完整测评与相关内容
精选证据
GPT-5.6 Terra System Card 安全防护与 Agent 边界
OpenAI System Card 将 Terra 的安全能力放在具体工具、沙箱和提示注入测试中;结果支持安全边界评估,不等于生产防护保证。
- 来源具体观察
- 2026-07-09 System Card,2026-08-03 变更记录;覆盖 Production Benchmarks、数据破坏规避、电脑使用确认、连接器/搜索提示注入及网络安全/生物化学测试。
- 已公布条件
- 网络安全描述使用 headless Linux box、常用工具和 3 次 rollout pass@1;ExploitBench 使用 5 个 seeds,完整样本未公开。
GPT-5.6 Terra SonarSource 4,444 Java 任务代码质量与安全复测
SonarSource 在 4,444 个 Java 任务上复测 Sol 与 Terra,能说明静态代码质量和安全检测样本中的差异,不能替代真实仓库验证。
待验证:本次未能重新核实原文。
- 来源具体观察
- 2026-07-11 SonarSource 复测;4,444 个 Java 任务,使用 SonarQube 规则检测代码质量与安全问题,并比较 Sol/Terra 结果。
- 已公布条件
- 该评测是 SonarSource 的任务集与分析流水线,不是通用端到端 Agent;完整 prompt、重复次数和每个 snapshot 未全部公开。
OpenAI 官方 GPT-5.6 Terra 基准、定价与任务边界
OpenAI GPT-5.6 发布页把 Terra 放在 Sol 与 Luna 的系列定位中,并将基准、价格和任务类型分开呈现;没有公开 Terra 的业务成功率。
- 来源具体观察
- 2026-07-09 发布页,2026-07-30 价格更新;比较 GPT-5.6 系列的任务示例、推理档位和 API 价格。
- 已公布条件
- 页面示例来自发布演示与官方测评,未公开统一随机种子、完整输入和 Terra 专属前端成功率。
GPT-5.6 Terra Artificial Analysis 智能、成本与编码 Agent 指数
Artificial Analysis 的 GPT-5.6 Terra 页面把 Intelligence Index、Coding Agent Index 与成本位置放在同一比较框架,适合做成本—能力初筛。
待验证:本次未能重新核实原文。
- 来源具体观察
- 2026-07-09 页面;Terra max Intelligence Index 55、Coding Agent Index 77;页面将其放在 Sol 与 Luna 的成本/能力对照中。
- 已公布条件
- Artificial Analysis 的指数和价格按其公开 harness 与当日快照计算;不等于 OpenAI API 的所有档位或用户账单。
全部来源
全部来源
GPT-5.6 Terra System Card 安全防护与 Agent 边界
OpenAI System Card 将 Terra 的安全能力放在具体工具、沙箱和提示注入测试中;结果支持安全边界评估,不等于生产防护保证。
- 来源具体观察
- 2026-07-09 System Card,2026-08-03 变更记录;覆盖 Production Benchmarks、数据破坏规避、电脑使用确认、连接器/搜索提示注入及网络安全/生物化学测试。
- 已公布条件
- 网络安全描述使用 headless Linux box、常用工具和 3 次 rollout pass@1;ExploitBench 使用 5 个 seeds,完整样本未公开。
GPT-5.6 Terra SonarSource 4,444 Java 任务代码质量与安全复测
SonarSource 在 4,444 个 Java 任务上复测 Sol 与 Terra,能说明静态代码质量和安全检测样本中的差异,不能替代真实仓库验证。
待验证:本次未能重新核实原文。
- 来源具体观察
- 2026-07-11 SonarSource 复测;4,444 个 Java 任务,使用 SonarQube 规则检测代码质量与安全问题,并比较 Sol/Terra 结果。
- 已公布条件
- 该评测是 SonarSource 的任务集与分析流水线,不是通用端到端 Agent;完整 prompt、重复次数和每个 snapshot 未全部公开。
OpenAI 官方 GPT-5.6 Terra 基准、定价与任务边界
OpenAI GPT-5.6 发布页把 Terra 放在 Sol 与 Luna 的系列定位中,并将基准、价格和任务类型分开呈现;没有公开 Terra 的业务成功率。
- 来源具体观察
- 2026-07-09 发布页,2026-07-30 价格更新;比较 GPT-5.6 系列的任务示例、推理档位和 API 价格。
- 已公布条件
- 页面示例来自发布演示与官方测评,未公开统一随机种子、完整输入和 Terra 专属前端成功率。
GPT-5.6 Terra Artificial Analysis 智能、成本与编码 Agent 指数
Artificial Analysis 的 GPT-5.6 Terra 页面把 Intelligence Index、Coding Agent Index 与成本位置放在同一比较框架,适合做成本—能力初筛。
待验证:本次未能重新核实原文。
- 来源具体观察
- 2026-07-09 页面;Terra max Intelligence Index 55、Coding Agent Index 77;页面将其放在 Sol 与 Luna 的成本/能力对照中。
- 已公布条件
- Artificial Analysis 的指数和价格按其公开 harness 与当日快照计算;不等于 OpenAI API 的所有档位或用户账单。
GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准
这条证据记录“GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。
待验证:本次未能重新核实原文。
- 模型/版本
- GPT-5.6 Terra;来源日期 2026-08-18;不混用其他快照或推理档位。
- 平台/评测环境
- Reddit r/LLMDevs;以该来源公布的平台与 harness 为观察单位。
- 样本/日期边界
- 采集日期 2026-08-20;“GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准”不能在其公开样本之外推出统一通过率。
Artificial Analysis:GPT-5.6 Terra 在智能—成本曲线上的位置
这条证据记录“Artificial Analysis:GPT-5.6 Terra 在智能—成本曲线上的位置”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。
待验证:本次未能重新核实原文。
- 模型/版本
- GPT-5.6 Terra;来源日期 2026-07-11;不混用其他快照或推理档位。
- 平台/评测环境
- X / Artificial Analysis 官方账号;以该来源公布的平台与 harness 为观察单位。
- 样本/日期边界
- 采集日期 2026-08-20;“Artificial Analysis:GPT-5.6 Terra 在智能—成本曲线上的位置”不能在其公开样本之外推出统一通过率。
25+ Claude Code/Codex Agent 无人值守循环:Terra 的批量研究实战
这条证据记录“25+ Claude Code/Codex Agent 无人值守循环:Terra 的批量研究实战”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。
待验证:本次未能重新核实原文。
- 模型/版本
- GPT-5.6 Terra;来源日期 2026-08-19;不混用其他快照或推理档位。
- 平台/评测环境
- Reddit / r/ClaudeCode;以该来源公布的平台与 harness 为观察单位。
- 样本/日期边界
- 采集日期 2026-08-20;“25+ Claude Code/Codex Agent 无人值守循环:Terra 的批量研究实战”不能在其公开样本之外推出统一通过率。
四模型同提示 iPhone UI 盲测:Terra 的真实开发任务证据
这条证据记录“四模型同提示 iPhone UI 盲测:Terra 的真实开发任务证据”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。
待验证:本次未能重新核实原文。
- 模型/版本
- GPT-5.6 Terra;来源日期 2026-07-10;不混用其他快照或推理档位。
- 平台/评测环境
- X;以该来源公布的平台与 harness 为观察单位。
- 样本/日期边界
- 采集日期 2026-08-20;“四模型同提示 iPhone UI 盲测:Terra 的真实开发任务证据”不能在其公开样本之外推出统一通过率。
Codex 中 Terra High 与 Luna Extra High 的个人限额对照
这条证据记录“Codex 中 Terra High 与 Luna Extra High 的个人限额对照”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。
待验证:本次未能重新核实原文。
- 模型/版本
- GPT-5.6 Terra;来源日期 2026-07-12;不混用其他快照或推理档位。
- 平台/评测环境
- X;以该来源公布的平台与 harness 为观察单位。
- 样本/日期边界
- 采集日期 2026-08-20;“Codex 中 Terra High 与 Luna Extra High 的个人限额对照”不能在其公开样本之外推出统一通过率。