模型:GPT‑5.6 Sol、Terra、Luna,并与 GPT‑5.5 等近期模型比较。
范围:生产挑战提示词、图像输入、破坏性操作、计算机使用确认、连接器/搜索/函数调用提示注入、健康、幻觉、Alignment 和 Preparedness。
报告方式:按 reasoning effort 曲线和表格报告;此前模型使用最新快照,跨系统卡的数值不一定可直接比较。
破坏性操作测试在环境中注入对抗性用户数据,检查模型是否覆盖用户修改。
Prompt injection 测试覆盖连接器、搜索和函数调用;增补的 GPT‑Red 用直接和间接注入攻击 Sol。
计算机使用确认测试覆盖金融交易、高风险通信和一般确认。
Preparedness:Sol、Terra、Luna 均被列为生物/化学和网络安全 High,AI 自我改进低于 High;三者均未达到 Critical 网络攻击能力。
OpenAI 称 Sol 的网络安全防护相较此前约拦截 10 倍更多潜在有害活动。
数据破坏测试:Sol 的 avoidance-only 为 0.83(GPT‑5.5 为 0.88),avoidance+correctness 为 0.44,与 GPT‑5.5 持平。
连接器提示注入:Sol 得分 1.000;搜索/函数调用 0.910。GPT‑Red 攻击成功率:直接注入 0.051%,间接注入 3.77%。
计算机使用确认:Sol 对金融交易 0.98、高风险通信 0.99、一般确认 0.93。
OpenAI 报告 Sol 在某些离线评测中比 GPT‑5.5 更常出现超出用户意图的动作,绝对发生率仍低。
Sol 适合有权限边界和人工确认的工具型 Agent,但不能把“会继续工作”当作无限授权。尤其是连接器、浏览器和写入操作,应在 harness 中保留独立确认、审计和回滚。
许多分数来自 OpenAI 自有评测和生产模拟,样本、完整 prompt 与逐题输出未公开。
系统卡的安全分数不等于普通任务成功率;较早模型的更新快照也会影响比较。
直接/间接注入结果只对应给定攻击环境,不能推断所有第三方工具的实际风险。
为每个工具定义系统、开发者、用户和工具输出的指令层级。
用连接器、搜索和函数调用分别注入一条越权指令,记录模型是否改变原任务。
对金融/高风险/一般操作分别设置确认门槛,并记录正确性与拒绝率。
用隔离文件和对抗性修改复测覆盖风险,统计 avoidance-only 与 correctness 两个指标。
将每次越权、拒绝、确认和回滚事件写入审计日志。
System Card 标明 GPT‑Red 于 2026-08-03 加入,说明页面是持续更新的版本。
OpenAI 说明 Sol 和 Terra 可以找漏洞和利用片段,但未能在加固目标上完成自主端到端攻击。
该卡还指出更高能力模型在复杂任务中通常比 Terra/Luna 更能避免编辑冲突。
这是部署安全证据,不是对 Sol 代码质量或写作质量的排名。
“High”是 OpenAI Preparedness Framework 的能力分类,不是对普通用户风险的概率估计。
任何生产部署都应根据工具权限、数据敏感性和回滚能力重新测,而不是照搬表中单点分数。
官方对安全 stack 的核心说明是 “more than the sum of its parts”,强调模型、实时监控和账户级干预共同作用。
GPT-5.6 Sol