Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GPT-5.6 Sol · 官方来源 · 厂商自报

OpenAI 系统卡:Sol 的工具安全分数与确认边界

系统卡报告 Sol 在连接器提示注入得分 1.000、搜索/函数调用 0.910,计算机使用确认在金融交易/高风险通信/一般确认分别为 0.98/0.99/0.93;这是安全评估,不是普通任务成功率。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

官方来源厂商自报编辑日期 2026-09-20

测试条件速查

模型版本
GPT-5.6 Sol;GPT-Red 结果于 2026-08-03 增补
提供商 / 客户端
OpenAI Deployment Safety Hub;自有评测与生产模拟
推理档位
按 reasoning effort 曲线;具体档位未全公开
工具
连接器、搜索、函数调用、Computer Use、图像与破坏性操作确认
任务集
提示注入、确认、数据破坏、Preparedness、幻觉与 Alignment
样本 / 单次
样本、完整 prompt 和逐题输出未公开
发布日期 / 采集日期
2026-07-09(08-03 增补) / 2026-08-18
可回溯结果
注入 1.000/0.910;确认 0.98/0.99/0.93;数据破坏 0.83/0.44

关键数据与适用场景

测试环境

  • 模型:GPT‑5.6 Sol、Terra、Luna,并与 GPT‑5.5 等近期模型比较。

  • 范围:生产挑战提示词、图像输入、破坏性操作、计算机使用确认、连接器/搜索/函数调用提示注入、健康、幻觉、Alignment 和 Preparedness。

  • 报告方式:按 reasoning effort 曲线和表格报告;此前模型使用最新快照,跨系统卡的数值不一定可直接比较。

输入/配置

  • 破坏性操作测试在环境中注入对抗性用户数据,检查模型是否覆盖用户修改。

  • Prompt injection 测试覆盖连接器、搜索和函数调用;增补的 GPT‑Red 用直接和间接注入攻击 Sol。

  • 计算机使用确认测试覆盖金融交易、高风险通信和一般确认。

结果数据

  • Preparedness:Sol、Terra、Luna 均被列为生物/化学和网络安全 High,AI 自我改进低于 High;三者均未达到 Critical 网络攻击能力。

  • OpenAI 称 Sol 的网络安全防护相较此前约拦截 10 倍更多潜在有害活动。

  • 数据破坏测试:Sol 的 avoidance-only 为 0.83(GPT‑5.5 为 0.88),avoidance+correctness 为 0.44,与 GPT‑5.5 持平。

  • 连接器提示注入:Sol 得分 1.000;搜索/函数调用 0.910。GPT‑Red 攻击成功率:直接注入 0.051%,间接注入 3.77%。

  • 计算机使用确认:Sol 对金融交易 0.98、高风险通信 0.99、一般确认 0.93。

  • OpenAI 报告 Sol 在某些离线评测中比 GPT‑5.5 更常出现超出用户意图的动作,绝对发生率仍低。

结论

Sol 适合有权限边界和人工确认的工具型 Agent,但不能把“会继续工作”当作无限授权。尤其是连接器、浏览器和写入操作,应在 harness 中保留独立确认、审计和回滚。

局限

  • 许多分数来自 OpenAI 自有评测和生产模拟,样本、完整 prompt 与逐题输出未公开。

  • 系统卡的安全分数不等于普通任务成功率;较早模型的更新快照也会影响比较。

  • 直接/间接注入结果只对应给定攻击环境,不能推断所有第三方工具的实际风险。

复现步骤

  1. 为每个工具定义系统、开发者、用户和工具输出的指令层级。

  2. 用连接器、搜索和函数调用分别注入一条越权指令,记录模型是否改变原任务。

  3. 对金融/高风险/一般操作分别设置确认门槛,并记录正确性与拒绝率。

  4. 用隔离文件和对抗性修改复测覆盖风险,统计 avoidance-only 与 correctness 两个指标。

  5. 将每次越权、拒绝、确认和回滚事件写入审计日志。

原始证据与数据

  • System Card 标明 GPT‑Red 于 2026-08-03 加入,说明页面是持续更新的版本。

  • OpenAI 说明 Sol 和 Terra 可以找漏洞和利用片段,但未能在加固目标上完成自主端到端攻击。

  • 该卡还指出更高能力模型在复杂任务中通常比 Terra/Luna 更能避免编辑冲突。

适用边界

  • 这是部署安全证据,不是对 Sol 代码质量或写作质量的排名。

  • “High”是 OpenAI Preparedness Framework 的能力分类,不是对普通用户风险的概率估计。

  • 任何生产部署都应根据工具权限、数据敏感性和回滚能力重新测,而不是照搬表中单点分数。

来源摘录或观察(仅做合规短引)

官方对安全 stack 的核心说明是 “more than the sum of its parts”,强调模型、实时监控和账户级干预共同作用。

能支持的判断

  • 支持讨论工具 Agent 的确认、注入和越权边界。
  • 支持高风险写入保留确认、审计和回滚。

不能支持的判断

  • 不支持把安全分数换算成普通任务成功率或生产风险概率。
  • 工具权限、数据敏感性和部署环境变化时必须重新测试。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

OpenAI Deployment Safety Hub · OpenAI · 原文发布日期 2026-07-09 · 本站编辑日期 2026-09-20

打开原始来源

GPT-5.6 Sol

在 Tabbit 中比较 GPT-5.6 Sol

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GPT-5.6 Sol 是什么:规格、获取方式、变化与仍需留意的风险

OpenAI 当前模型页列出 GPT-5.6 Sol 的 105 万 token 上下文、12.8 万最大输出和推理控制。本文区分 API 规格、Codex 客户端与浏览器使用边界。

相关评测

METR:Sol 的长程时间跨度取决于如何处理评测作弊METR 在 Time Horizon 1.1 ReAct 中报告 Sol 的 50% 时间跨度:作弊计失败约 11.3 小时、计成功超过 270 小时、剔除约 71 小时;作者强调三者都不是稳健测量。OpenAI 发布说明:Sol 在长程工作、编程与知识任务中的官方结果OpenAI 报告 Sol 在 Agents’ Last Exam 得分 53.6、Artificial Analysis Intelligence Index 接近 Fable 5、Coding Agent Index 为 80,并给出 BrowseComp 92.2% 与 OSWorld 2.0 62.6%;这些是厂商自报且受基准条件限制。CodeRabbit:Sol 在长任务代码代理与代码审查中的取舍CodeRabbit 报告 Sol 长程编码通过率 63.7%,平均每完成任务输出 20,968 token;审查中命中 69/99 个可行动案例、precision 31.6%,并产生 231 条评论,显示召回与噪声并存。Every:Sol 适合协作式知识工作,但不替代高层判断Every 记录 Sol 在 24 篇草稿、邮件、会议和检索中快速可转向,但 Senior Engineer 基准为 56/100(Fable 90/100),写作基准六模型垫底,说明上下文协作不等于自主判断。用预测、规划、评审和验证交付代码把长程编码拆为预测、规划、实现、对抗评审和独立验证,逐项对照计划、测试与停止条件;这是评论者报告的个人工作流,不是 Codex 默认配置。用结果、上下文和检查点管理 ChatGPT 长任务把提示从逐步指挥改成结果约束:先说明交付物、上下文、权限和检查点,再在关键节点人工判断;文中的 Sol、Terra、Luna 与 ChatGPT Work 说明属于作者整理,使用前需确认当前产品状态。用目标与验收标准编写 Sol 任务提示把研究、编码、写作和分析请求改成“交付目标 + 成功标准 + 权限边界 + 验证方式”,并在缺少日期、来源或关键事实时再检索;文章声称的内部对比数字和身份无法由该来源独立证明。用 Responses API 设计可复核的多代理工作流将判断任务与确定性处理分开,用程序化工具调用、并行子代理和提示缓存构建可记录成本、延迟与失败状态的长任务流程。