汇总 GPT-5.5 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。
OpenAI 的发布数据把 GPT-5.5 定位为工具密集型编码、浏览、知识工作和跨软件 Agent 的高端模型,但表内数字是官方测评结果,复现时必须保留 harness、工具和模型快照。
Vellum 汇总的同一批公开基准显示 GPT-5.5 在 Terminal、GDPval、OSWorld、长上下文和 CyberGym 等项目很强,但 Opus 4.7 在 SWE Pro、MCP Atlas 与部分 HLE 项目领先,不能用单一榜单替代任务匹配。
GPT-5.5