Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GPT-5.4 · 官方来源 · 厂商自报

GPT-5.4:OpenAI 官方专业工作与 Agent 基准

OpenAI 披露 GPT-5.4 在 GDPval 达到 83.0%、SpreadsheetBench 达到 87.3%,并说明长上下文与工具搜索的边界。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

官方来源厂商自报编辑日期 2026-09-20

测试条件速查

Condition
Model/version follows the source; reopened 2026-09-20.
Condition
Task, harness, and sample follow the source; undisclosed fields remain unknown.

关键数据与适用场景

一句话结论

官方数据支持 GPT-5.4 在计算机使用、网页搜索、专业知识工作和工具调用上的综合升级,但 1M 上下文、长上下文计价和研究环境差异必须纳入复现与成本评估。

适用场景

  • 适合的任务:跨软件计算机使用、专业文档/表格/演示、深度网页搜索、工具密集 Agent、代码与长任务。

  • 不适合的任务:不需要推理却默认用 xhigh 的低延迟任务,或把 1M 上下文当作全程无损记忆的工作流。

  • 适用的模型版本:gpt-5.4;发布页同时包含 gpt-5.4-pro,本文重点是普通版。

  • 适用的客户端、Agent 或 API:ChatGPT Thinking、API、Codex;API 模型名 gpt-5.4。

  • 推荐的推理档位和参数:官方评测大多使用 xhigh,但专业生产任务应按官方 guidance 从 none/low/medium 做 sweep;长上下文与工具设置必须固定。

测试环境、输入/配置

  • 通用评估:官方研究环境;发布页明确说结果可能与正式上线 ChatGPT 略有不同。

  • GDPval:44 个职业、9 个高 GDP 行业的知识工作;GPT-5.4 xhigh,GPT-5.2 使用 ChatGPT 可用较低 heavy。

  • OSWorld-Verified:截图+键盘/鼠标操作桌面环境。

  • WebArena-Verified:DOM 与截图双驱动;Online-Mind2Web 仅截图观察。

  • MCP Atlas:36 个 MCP servers,比较全量定义与 tool search,250-task 平均。

  • 长上下文:Graphwalks、MRCR v2;模型支持 1M,上述 >272K 请求有不同价格/限额。

结果数据

基准GPT-5.4GPT-5.3-CodexGPT-5.2
GDPval(胜出或持平)83.0%70.9%70.9%
SWE-Bench Pro Public57.7%56.8%55.6%
OSWorld-Verified75.0%74.0%47.3%
Toolathlon54.6%51.9%46.3%
BrowseComp82.7%77.3%65.8%
WebArena-Verified(DOM+截图)67.3%未公开GPT-5.2 65.4%
Online-Mind2Web(截图)92.8%未公开ChatGPT Atlas 70.9%
MMMU-Pro(无工具/有工具)81.2% / 82.1%未公开79.5% / 80.4%
MCP Atlas67.2%未公开60.6%
GPT-5.4 OpenAI MRCR 512K–1M36.6%未公开—

专业工作补充:GDPval 83.0%;内部投行建模平均 87.3%;FinanceAgent v1.1 56.0%;OfficeQA 68.1%。发布页还报告 GPT-5.4 相比 GPT-5.2 在去标识用户事实错误测试中,单项陈述错误率降低 33%、完整回复包含错误的概率降低 18%。

结论

GPT-5.4 的相对强项是“做事”:计算机使用 75.0%、BrowseComp 82.7%、工具搜索和长程专业工作;与 GPT-5.2 相比,编码、文档、工具和视觉都有提升。对于生产 Agent,结果应以相同工具/harness、成本和完成率验证,而非只采用官方最高 xhigh 分数。

局限

  • 官方 benchmark 由 OpenAI 运行,输入、完整工具 schema、随机种子、失败样本和置信区间未全部公开。

  • BrowseComp 得分受搜索系统、时间、黑名单和 ChatGPT search tool 影响;官方明确 API 搜索可能不同。

  • 1M 长上下文的 Graphwalks/MRCR 结果显示远端区间性能下降;“支持 1M”不等于 1M 内均匀可靠。

  • 合作方评价和内部任务不是独立受控测试;例如财务、房产税门户、法律 benchmark 需按各自 harness 理解。

复现步骤

  1. 固定 gpt-5.4 快照、reasoning effort、verbosity、工具定义、权限和上下文长度。

  2. 按业务选取代码、文档、表格、电脑使用和网页搜索任务,记录完成/失败、工具调用、token、延迟和人工接管。

  3. 对 tool search 与全量工具定义做同一任务 A/B,验证 token 节省是否保持准确率。

  4. 对 272K 以下与以上请求分别计算真实成本,并跑 256K–1M 的召回/引用测试。

  5. 与 GPT-5.2/5.3-Codex 或目标模型使用同一 harness 对照,报告任务类型而非只给总平均。

原始证据与数据

官方发布页提供上述表格、测试定义、定价、工具搜索 47% token 节省以及 OSWorld/WebArena/Online-Mind2Web 的原始数字,并说明多数评估使用 xhigh、研究环境结果可能与线上不同。

来源摘录或观察(仅做合规短引)

OpenAI 将 GPT-5.4 描述为 “most capable and efficient frontier model for professional work”,同时公开 1M 长上下文的远端召回和费用边界;两者应一起记录。

能支持的判断

  • 支持在官方 GDPval 83.0%、SpreadsheetBench 87.3% 及工具搜索/长上下文定义下讨论专业工作能力方向。

不能支持的判断

  • 结果多使用 xhigh 或研究环境,完整 prompt、失败轨迹和独立样本未公开;1M 上下文不等于全程均匀召回或生产完成率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

OpenAI Newsroom · OpenAI 官方 · 原文发布日期 2026-03-05 · 本站编辑日期 2026-09-20

打开原始来源

GPT-5.4

在 Tabbit 中比较 GPT-5.4

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GPT-5.4 是什么:变化、获取方式与使用边界

用官方与独立来源说明 GPT-5.4 的电脑操作、专业工作、工具搜索、上下文和计费边界、访问入口与实际风险。

相关评测

GPT-5.4:四模型原子时钟应用对照在一次 one-shot 原子时钟提示词任务中,GPT-5.4 的外观表现最好但出现同步漂移;文章明确这只是单任务观察。GPT-5.4:Reddit AI Agent 多步执行与模型路由体验一场持续四天的 Reddit 讨论称 GPT-5.4 能帮助复核和多步执行,但也出现约束遗忘、过度调用和 xhigh 成本问题。GPT-5.4: Result Contracts and Verification Loop PromptThe official pages describe Responses tool search and long-context configuration; this detail limits the workflow to an explicit allowlist and phased context.GPT-5.4:Responses API 工具搜索与 Phase 配置官方页面描述 Responses 工具搜索与长上下文配置;详情限定为显式工具白名单和阶段化上下文。