Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
官方GPT-5.4

GPT-5.4:OpenAI 官方专业工作与 Agent 基准

原始来源

OpenAI Newsroom

作者OpenAI 官方

原文日期2026-03-05

Tabbit 整理2026-08-19

查看原文

一句话结论

官方数据支持 GPT-5.4 在计算机使用、网页搜索、专业知识工作和工具调用上的综合升级,但 1M 上下文、长上下文计价和研究环境差异必须纳入复现与成本评估。

适用场景

  • 适合的任务:跨软件计算机使用、专业文档/表格/演示、深度网页搜索、工具密集 Agent、代码与长任务。

  • 不适合的任务:不需要推理却默认用 xhigh 的低延迟任务,或把 1M 上下文当作全程无损记忆的工作流。

  • 适用的模型版本:gpt-5.4;发布页同时包含 gpt-5.4-pro,本文重点是普通版。

  • 适用的客户端、Agent 或 API:ChatGPT Thinking、API、Codex;API 模型名 gpt-5.4。

  • 推荐的推理档位和参数:官方评测大多使用 xhigh,但专业生产任务应按官方 guidance 从 none/low/medium 做 sweep;长上下文与工具设置必须固定。

测试环境、输入/配置

  • 通用评估:官方研究环境;发布页明确说结果可能与正式上线 ChatGPT 略有不同。

  • GDPval:44 个职业、9 个高 GDP 行业的知识工作;GPT-5.4 xhigh,GPT-5.2 使用 ChatGPT 可用较低 heavy。

  • OSWorld-Verified:截图+键盘/鼠标操作桌面环境。

  • WebArena-Verified:DOM 与截图双驱动;Online-Mind2Web 仅截图观察。

  • MCP Atlas:36 个 MCP servers,比较全量定义与 tool search,250-task 平均。

  • 长上下文:Graphwalks、MRCR v2;模型支持 1M,上述 >272K 请求有不同价格/限额。

结果数据

基准GPT-5.4GPT-5.3-CodexGPT-5.2
GDPval(胜出或持平)83.0%70.9%70.9%
SWE-Bench Pro Public57.7%56.8%55.6%
OSWorld-Verified75.0%74.0%47.3%
Toolathlon54.6%51.9%46.3%
BrowseComp82.7%77.3%65.8%
WebArena-Verified(DOM+截图)67.3%未公开GPT-5.2 65.4%
Online-Mind2Web(截图)92.8%未公开ChatGPT Atlas 70.9%
MMMU-Pro(无工具/有工具)81.2% / 82.1%未公开79.5% / 80.4%
MCP Atlas67.2%未公开60.6%
GPT-5.4 OpenAI MRCR 512K–1M36.6%未公开—

专业工作补充:GDPval 83.0%;内部投行建模平均 87.3%;FinanceAgent v1.1 56.0%;OfficeQA 68.1%。发布页还报告 GPT-5.4 相比 GPT-5.2 在去标识用户事实错误测试中,单项陈述错误率降低 33%、完整回复包含错误的概率降低 18%。

结论

GPT-5.4 的相对强项是“做事”:计算机使用 75.0%、BrowseComp 82.7%、工具搜索和长程专业工作;与 GPT-5.2 相比,编码、文档、工具和视觉都有提升。对于生产 Agent,结果应以相同工具/harness、成本和完成率验证,而非只采用官方最高 xhigh 分数。

局限

  • 官方 benchmark 由 OpenAI 运行,输入、完整工具 schema、随机种子、失败样本和置信区间未全部公开。

  • BrowseComp 得分受搜索系统、时间、黑名单和 ChatGPT search tool 影响;官方明确 API 搜索可能不同。

  • 1M 长上下文的 Graphwalks/MRCR 结果显示远端区间性能下降;“支持 1M”不等于 1M 内均匀可靠。

  • 合作方评价和内部任务不是独立受控测试;例如财务、房产税门户、法律 benchmark 需按各自 harness 理解。

复现步骤

  1. 固定 gpt-5.4 快照、reasoning effort、verbosity、工具定义、权限和上下文长度。

  2. 按业务选取代码、文档、表格、电脑使用和网页搜索任务,记录完成/失败、工具调用、token、延迟和人工接管。

  3. 对 tool search 与全量工具定义做同一任务 A/B,验证 token 节省是否保持准确率。

  4. 对 272K 以下与以上请求分别计算真实成本,并跑 256K–1M 的召回/引用测试。

  5. 与 GPT-5.2/5.3-Codex 或目标模型使用同一 harness 对照,报告任务类型而非只给总平均。

原始证据与数据

官方发布页提供上述表格、测试定义、定价、工具搜索 47% token 节省以及 OSWorld/WebArena/Online-Mind2Web 的原始数字,并说明多数评估使用 xhigh、研究环境结果可能与线上不同。

来源摘录或观察(仅做合规短引)

OpenAI 将 GPT-5.4 描述为 “most capable and efficient frontier model for professional work”,同时公开 1M 长上下文的远端召回和费用边界;两者应一起记录。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-5.4

在 Tabbit 中使用并对比模型

GPT-5.4

相关测评

媒体Thomas Wiegold Blog2026-03-18

GPT-5.4:四模型原子时钟应用对照

社区Reddit r/AIAgents

GPT-5.4:Reddit AI Agents 多步 Agent 与模型路由体验

GPT-5.4

相关提示词

官方OpenAI API Model Guidance2026-03-05

GPT-5.4:结果契约与验证循环提示

官方OpenAI API Model Page / Model Guidance2026-03-05

GPT-5.4:Responses API 工具搜索与 Phase 配置