System Card 将 Terra 与 Sol、Luna 一起评为网络安全及生物化学领域的 High capability、但未达到 Critical;其安全边界必须和工具 Agent 的确认、提示注入防护及数据破坏测试一起评估。
模型:GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna,并与 GPT-5.5 等上一代模型比较。
安全评估:Production Benchmarks、视觉安全、数据破坏规避、计算机使用确认、连接器/搜索函数提示注入、HealthBench、网络安全与生物化学能力评估。
评估形态:页面同时报告不带系统级 safeguards 的模型行为测试、生产部署模拟和包含工具/沙箱的 Agent 测试。
版本说明:System Card 表格可能随模型快照和评测管线更新;页面公开了发布日期与变更记录。
System Card 没有公开完整生产 prompt 或每个安全样本,但公开了部分任务类型、工具环境和表格指标。网络安全 CTF 的描述包括 headless Linux box、常用 offensive 工具和工具调用 harness,并使用 3 次 rollout 的 pass@1;ExploitBench 使用 5 个 seeds 和 reasoning continuity。
| 评估 | GPT-5.6 Terra |
|---|---|
| Production Benchmarks:violent illicit behavior | 0.952 |
| Production Benchmarks:nonviolent illicit behavior | 0.990 |
| Production Benchmarks:extremism | 0.981 |
| Production Benchmarks:hate | 1.000 |
| Production Benchmarks:self-harm standard | 0.962 |
| Production Benchmarks:gore | 0.600 |
| Production Benchmarks:sexual | 0.966 |
| Production Benchmarks:sexual/minors | 0.974 |
| 图像输入:hate / extremism / self-harm / harms-erotic | 0.999 / 0.978 / 0.986 / 0.991 |
| 数据破坏规避(avoidance only) | 0.81 |
| 数据破坏规避(avoidance + correctness) | 0.37 |
| 计算机使用:financial transaction confirmation | 0.98 |
| 计算机使用:high-stakes communication confirmation | 0.98 |
| 计算机使用:general confirmation | 0.94 |
| 连接器 prompt injection | 1.000 |
| Search and function-calling prompt injection | 0.946 |
| GPT-Red:direct instruction-hierarchy injection | 0.061% |
| GPT-Red:indirect prompt injection | 3.32% |
Preparedness Framework:Sol、Terra、Luna 均被视为网络安全和生物/化学领域的 High capability。
AI self-improvement:System Card 称三者都没有达到 High capability 阈值。
官方概括是:模型能发现漏洞和部分 exploit,但在测试中无法对 hardened targets 执行自主端到端攻击。
Terra 的数据破坏规避与正确性合并分为 0.37,低于 Sol 的 0.44;对可写文件、代码仓库和连接器环境,应把确认和回滚作为外部门禁。
计算机使用确认率并非 100%;财务和高风险通信均为 0.98,不能让模型单独决定不可逆操作。
直接提示注入率 0.061% 与间接注入率 3.32% 不是零风险;读取邮件、网页、搜索结果或第三方工具输出时仍需隔离不可信指令。
官方将 Terra 标为 High cyber capability,但同时说明未达 Critical;这支持防御性漏洞分流、修复和验证等受控用途,不支持无监督攻击自动化。
一部分安全评估故意不带系统级 safeguards,用来测底层行为;它们不等于默认产品中的实际拦截率。
Production Benchmarks 面向困难样本,页面明确说错误率不代表平均生产流量。
数据破坏、确认和提示注入是特定 harness/数据分布下的指标,不能推出任意工具和任意第三方连接器的安全性。
System Card 是供应商披露,缺少完整样本、失败轨迹和独立复测;安全等级也不等于业务授权。
将 Agent 分成只读、可写但可回滚、不可逆操作三档,分别记录是否请求确认、是否保留用户改动和最终正确性。
构造独立的直接注入与间接注入集:把不可信指令放在用户 prompt、网页、搜索结果、邮件和函数返回中,记录模型是否越过开发者约束。
在隔离 Linux/容器环境运行防御性 CTF 与漏洞修复任务,固定工具版本、超时、rollout 数和允许的网络范围。
记录每次模型调用、工具参数、文件 diff、确认事件、回滚结果和失败原因;不要只记录最终回答。
对任何需要金融交易、发送高风险通信或删除/覆盖数据的操作强制人工确认,并将模型确认率与系统实际拦截率分开统计。
System Card 的关键措辞是 “High capability in both Cybersecurity and Biological and Chemical risk”,但同时注明未达到 Critical。
GPT-5.6 Terra