官方数据支持 GPT-5.4 在计算机使用、网页搜索、专业知识工作和工具调用上的综合升级,但 1M 上下文、长上下文计价和研究环境差异必须纳入复现与成本评估。
适合的任务:跨软件计算机使用、专业文档/表格/演示、深度网页搜索、工具密集 Agent、代码与长任务。
不适合的任务:不需要推理却默认用 xhigh 的低延迟任务,或把 1M 上下文当作全程无损记忆的工作流。
适用的模型版本:gpt-5.4;发布页同时包含 gpt-5.4-pro,本文重点是普通版。
适用的客户端、Agent 或 API:ChatGPT Thinking、API、Codex;API 模型名 gpt-5.4。
推荐的推理档位和参数:官方评测大多使用 xhigh,但专业生产任务应按官方 guidance 从 none/low/medium 做 sweep;长上下文与工具设置必须固定。
通用评估:官方研究环境;发布页明确说结果可能与正式上线 ChatGPT 略有不同。
GDPval:44 个职业、9 个高 GDP 行业的知识工作;GPT-5.4 xhigh,GPT-5.2 使用 ChatGPT 可用较低 heavy。
OSWorld-Verified:截图+键盘/鼠标操作桌面环境。
WebArena-Verified:DOM 与截图双驱动;Online-Mind2Web 仅截图观察。
MCP Atlas:36 个 MCP servers,比较全量定义与 tool search,250-task 平均。
长上下文:Graphwalks、MRCR v2;模型支持 1M,上述 >272K 请求有不同价格/限额。
| 基准 | GPT-5.4 | GPT-5.3-Codex | GPT-5.2 |
|---|---|---|---|
| GDPval(胜出或持平) | 83.0% | 70.9% | 70.9% |
| SWE-Bench Pro Public | 57.7% | 56.8% | 55.6% |
| OSWorld-Verified | 75.0% | 74.0% | 47.3% |
| Toolathlon | 54.6% | 51.9% | 46.3% |
| BrowseComp | 82.7% | 77.3% | 65.8% |
| WebArena-Verified(DOM+截图) | 67.3% | 未公开 | GPT-5.2 65.4% |
| Online-Mind2Web(截图) | 92.8% | 未公开 | ChatGPT Atlas 70.9% |
| MMMU-Pro(无工具/有工具) | 81.2% / 82.1% | 未公开 | 79.5% / 80.4% |
| MCP Atlas | 67.2% | 未公开 | 60.6% |
| GPT-5.4 OpenAI MRCR 512K–1M | 36.6% | 未公开 | — |
专业工作补充:GDPval 83.0%;内部投行建模平均 87.3%;FinanceAgent v1.1 56.0%;OfficeQA 68.1%。发布页还报告 GPT-5.4 相比 GPT-5.2 在去标识用户事实错误测试中,单项陈述错误率降低 33%、完整回复包含错误的概率降低 18%。
GPT-5.4 的相对强项是“做事”:计算机使用 75.0%、BrowseComp 82.7%、工具搜索和长程专业工作;与 GPT-5.2 相比,编码、文档、工具和视觉都有提升。对于生产 Agent,结果应以相同工具/harness、成本和完成率验证,而非只采用官方最高 xhigh 分数。
官方 benchmark 由 OpenAI 运行,输入、完整工具 schema、随机种子、失败样本和置信区间未全部公开。
BrowseComp 得分受搜索系统、时间、黑名单和 ChatGPT search tool 影响;官方明确 API 搜索可能不同。
1M 长上下文的 Graphwalks/MRCR 结果显示远端区间性能下降;“支持 1M”不等于 1M 内均匀可靠。
合作方评价和内部任务不是独立受控测试;例如财务、房产税门户、法律 benchmark 需按各自 harness 理解。
固定 gpt-5.4 快照、reasoning effort、verbosity、工具定义、权限和上下文长度。
按业务选取代码、文档、表格、电脑使用和网页搜索任务,记录完成/失败、工具调用、token、延迟和人工接管。
对 tool search 与全量工具定义做同一任务 A/B,验证 token 节省是否保持准确率。
对 272K 以下与以上请求分别计算真实成本,并跑 256K–1M 的召回/引用测试。
与 GPT-5.2/5.3-Codex 或目标模型使用同一 harness 对照,报告任务类型而非只给总平均。
官方发布页提供上述表格、测试定义、定价、工具搜索 47% token 节省以及 OSWorld/WebArena/Online-Mind2Web 的原始数字,并说明多数评估使用 xhigh、研究环境结果可能与线上不同。
OpenAI 将 GPT-5.4 描述为 “most capable and efficient frontier model for professional work”,同时公开 1M 长上下文的远端召回和费用边界;两者应一起记录。
GPT-5.4