OpenAI 发布页把 GPT-5.5 的工具密集型编码、浏览和跨软件 Agent 结果归因于特定 harness;这些表格数字不能脱离快照和工具复现。
OpenAI · 查看证据GPT-5.5 · 测评与证据
GPT-5.5,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
Vellum 汇总 GPT-5.5 与 Claude、Gemini 的公开榜单,显示任务间有明显分化;它是跨来源汇总,不是统一复测。
Vellum · 查看证据完整测评与相关内容
精选证据
官方厂商自报
GPT-5.5 官方基准、价格与安全边界
OpenAI 发布页把 GPT-5.5 的工具密集型编码、浏览和跨软件 Agent 结果归因于特定 harness;这些表格数字不能脱离快照和工具复现。
来源OpenAI
原文日期2026-04-23
采集2026-08-20
- 来源具体观察
- 2026-04-23 发布页;GPT-5.5 snapshot gpt-5.5-2026-04-23;官方 harness 包含浏览、终端、代码和 Agent 工具。
- 已公布条件
- 页面列出约 1.05M 上下文与 128K 最大输出,但没有为每个业务任务公开相同输入和重复次数。
媒体 / 基准方独立测量
GPT-5.5 Vellum 跨模型基准与厂商数据边界
Vellum 汇总 GPT-5.5 与 Claude、Gemini 的公开榜单,显示任务间有明显分化;它是跨来源汇总,不是统一复测。
来源Vellum
原文日期未知
采集2026-08-20
待验证:本次未能重新核实原文。
- 来源具体观察
- 文章比较 GPT-5.5、Claude 和 Gemini 的公开 Terminal、GDPval、OSWorld、SWE Pro 等结果,具体快照依来源而异。
- 已公布条件
- Vellum 页面未提供一套统一 API harness、随机种子和逐任务原始输出;采集于 2026-08-18,未在本轮重开。
全部来源
全部来源
官方厂商自报
GPT-5.5 官方基准、价格与安全边界
OpenAI 发布页把 GPT-5.5 的工具密集型编码、浏览和跨软件 Agent 结果归因于特定 harness;这些表格数字不能脱离快照和工具复现。
来源OpenAI
原文日期2026-04-23
采集2026-08-20
- 来源具体观察
- 2026-04-23 发布页;GPT-5.5 snapshot gpt-5.5-2026-04-23;官方 harness 包含浏览、终端、代码和 Agent 工具。
- 已公布条件
- 页面列出约 1.05M 上下文与 128K 最大输出,但没有为每个业务任务公开相同输入和重复次数。
媒体 / 基准方独立测量
GPT-5.5 Vellum 跨模型基准与厂商数据边界
Vellum 汇总 GPT-5.5 与 Claude、Gemini 的公开榜单,显示任务间有明显分化;它是跨来源汇总,不是统一复测。
来源Vellum
原文日期未知
采集2026-08-20
待验证:本次未能重新核实原文。
- 来源具体观察
- 文章比较 GPT-5.5、Claude 和 Gemini 的公开 Terminal、GDPval、OSWorld、SWE Pro 等结果,具体快照依来源而异。
- 已公布条件
- Vellum 页面未提供一套统一 API harness、随机种子和逐任务原始输出;采集于 2026-08-18,未在本轮重开。