GPT-5.4 是 OpenAI 于 2026 年 3 月发布的前沿模型,面向专业工作、编码、工具调用和电脑操作智能体。它适合试验跨文件、应用和网站执行的工作流,但访问入口和计费细节与模型名称同样重要。
截至 2026 年 9 月 20 日,API 页列出 1,050,000 token 上下文;输入超过 272K 时,完整请求按输入 2 倍、输出 1.5 倍计价。这是 API 规则,不代表 ChatGPT、Codex、云提供商或 Tabbit 都提供同样的有效上下文。先看 GPT-5.4 模型资源,再确认实际产品和账户。
关键结论
GPT-5.4 把 GPT-5.3-Codex 编码能力带入通用模型,并加入专业工作和原生电脑操作。
API 列出
gpt-5.4、1,050,000 上下文、128,000 最大输出和 none 到 xhigh 的 reasoning effort。OpenAI 报告 OSWorld-Verified 75.0%、WebArena-Verified 67.3%、Online-Mind2Web 92.8%,以及工具搜索在 250 个 MCP Atlas 任务中减少 47% token。
API 价格为输入 $2.50、缓存输入 $0.25、输出 $15 / 百万 token;超过 272K 会改变完整请求倍率,订阅额度另算。
原生电脑操作扩大了动作能力,不会自动解决权限、确认和安全责任。
规格与入口
| 项目 | 当前 API 快照 | 边界 |
|---|---|---|
| API ID | gpt-5.4 | 日志固定完整 ID;ChatGPT 和 Codex 是不同入口。 |
| 发布 | 2026-03-05 | 比较时保留版本、日期和 harness。 |
| 上下文 / 最大输出 | 1,050,000 / 128,000 token | API 上限,客户端可能更小。 |
| 输入 / 输出 | 文本、图片 / 文本 | 工具和电脑操作取决于入口。 |
| reasoning | none、low、medium、high、xhigh | UI 或计划可能只开放部分档位。 |
| API 价格 | $2.50 输入、$0.25 缓存、$15 输出 / MTok | 工具调用、Batch/Flex 和 Priority 另计。 |
| 长输入规则 | >272K:输入 2 倍、输出 1.5 倍 | 这是计费规则,不是订阅规则。 |
| 知识截止 | API 页列 2025-08-31 | 当前事实仍需检索。 |
提示资源与评测资源保存原始条目,不能授予 OpenAI 或浏览器访问权限。
与 GPT-5.3-Codex 和 GPT-5.2 的变化
OpenAI 将 5.3-Codex 的编码能力与专业工作结合。三个变化最影响实际任务:
原生电脑操作:API 和 Codex 可以根据截图、鼠标键盘执行任务,也能编写 Playwright;开发者可配置确认策略。
工具搜索:模型先搜索需要的工具定义,而不是把所有 MCP 函数都塞进提示词。OpenAI 在 36 个 MCP 服务器、250 个任务的内部评估中报告 token 总量减少 47%。
可调节思考:ChatGPT Thinking 可先给计划并在执行中接受指示。Codex Fast mode 是同一模型更快的路线,不是新模型。
| 变化 | OpenAI 的公开说法 | 本地需验证 |
|---|---|---|
| 专业工作 | GDPval 83.0%,内部表格建模 87.3% | 你的文件、公式和验收规则是否相同。 |
| 编码 | SWE-Bench Pro 57.7%,Terminal-Bench 2.0 75.1% | 仓库、工具、effort、测试和复核负担。 |
| 电脑操作 | OSWorld 75.0%、WebArena 67.3%、Online-Mind2Web 92.8% | 截图、权限、确认和失败恢复。 |
| 工具生态 | MCP Atlas token 减少 47% | 工具定义、服务器延迟和提供商支持。 |
| 长上下文 | Graphwalks 256K–1M 准确率 21.4%;MRCR 512K–1M 36.6% | 1M 上限不等于 1M 质量保证。 |
OpenAI 使用不同 reasoning 和研究环境;生产 ChatGPT 结果可能不同。需要设计验证方案时可看智能体推理指南。独立 Reddit 评测只有 14 次直接 5.4 运行,虽报告方向性优势但保留大误差;ORCFLO 和 LayerLens 也各自使用不同 cohort、评委和指标,不能拼成单一排名。
不混淆访问与计费
| 入口 | 它是什么 | 必须确认 |
|---|---|---|
| OpenAI API | Responses API/SDK 中的 gpt-5.4 | 组织、地区、速率、工具、effort 和账单。 |
| ChatGPT | GPT-5.4 Thinking,Pro 是独立路线 | 计划、工作区、选择器和 ChatGPT 上下文。 |
| Codex | 面向编码流程的 GPT-5.4 | 客户端版本、额度、上下文设置和仓库权限。 |
| 云提供商 | 提供商部署或网关 | 别名、数据政策、地区、配额和工具。 |
| Tabbit Browser | 若实时选择器开放,则是独立浏览器客户端 | 已登录账户、显示模型、有效上下文和可回滚任务。 |
API 标准价格是 $2.50 输入、$0.25 缓存、$15 输出 / 百万 token;Batch/Flex 为标准价格一半,Priority 为两倍,工具调用可能另收费。超过 272K 输入的完整请求按 2 倍/1.5 倍计价。这些数字不能转换为 ChatGPT、Codex 或 Tabbit 的订阅额度。
场景自检
| 工作类型 | 第一个测试 | 验收标准 |
|---|---|---|
| 浏览器或桌面流程 | 可回滚的表单或文档任务 | 点击正确、无未批准操作、有审计日志。 |
| 多文件编码 | 有现成测试命令的小功能 | 测试通过、diff 不越界、没有跳过验证。 |
| 表格和文档 | 固定 fixture 与期望单元格 | 数值、公式、格式和引用一致。 |
| MCP 工具流程 | 工具搜索与短工具列表各跑一次 | 结果一致、提示 token 更少、失败清楚。 |
| 长研究 | 有来源包、停止条件和引用要求 | 引用可打开、论点有证据、矛盾被指出。 |
记录模型 ID、入口、effort、上下文设置、工具、输入/输出/缓存 token、用时、重试和人工修正。比较每个已接受结果的成本,而不是只看单价。GPT-5.6 Terra、GPT-5.6 Sol和Sol 1M 指南是更新的家庭页面,不能证明 5.4 提供同样行为。
社区证据
Reddit 首次印象帖称 5.4 比 5.3-Codex 更快,并报告 5.4 high 执行计划、5.3-Codex 复核;同一帖提醒 CLI 可能需要显式打开 1M。另一个实验在同一 Express JS 项目和 prompt 上创建 16 个 worktree,构建 React 笔记应用功能,适合作为本地比较模板,但代码质量由 Opus 评判,仍有主观性。负面反馈则认为 5.4 会中断子智能体并过快推进,严格计划才可靠。这些是任务信号,不是普遍性能证明。
Tabbit 能证明什么
本文没有用已登录账户在 Tabbit Browser 实测 GPT-5.4,因此不声称选择器、有效上下文、延迟、提供商路由、订阅额度、工具权限或费用。若实时选择器出现模型,请先做公开或可回滚任务,记录显示名称和 effort,并与已知验收结果比较。
Tabbit Browser 总览解释浏览器层工作流,不提供 OpenAI API 额度,也不改变 ChatGPT/Codex 计划。下载是另一个浏览器选择:
安全与未知风险
OpenAI 按 Preparedness Framework 将 GPT-5.4 视为 High cyber capability,并部署监控、可信访问控制和部分 Zero Data Retention 表面的异步阻断。分类器仍在改进,可能产生误报。原生电脑操作也带来不可逆动作风险:模型能点击和输入,不代表应用可以省略确认。
1M 上下文仍可能受到压缩、噪音和检索质量影响;工具搜索减少提示 token,也会增加发现和服务器失败路径;API 知识截止是 2025-08-31,当前事实需要检索。公开分数都绑定自己的 effort、工具和日期,不能合并成总排名。
结论
GPT-5.4 适合先试专业文档、编码智能体和电脑操作流程。最重要的变化不是一个排行榜数字,而是把编码、工具和电脑操作放进同一通用路线。实际限制在产品边界:超过 272K 的 API 倍率、客户端上下文、工具权限和订阅额度都要单独测量。
来源与常见问题
主要来源是 OpenAI 的发布说明、API 模型页和部署安全材料,以及 LayerLens、ORCFLO、Tom's Guide。
ChatGPT、Codex 和 API 中的 GPT-5.4 一样吗?
不完全一样。API ID 是 gpt-5.4,ChatGPT 展示 GPT-5.4 Thinking,Codex 还有自己的上下文、effort、额度和工具控制。
API 真支持 1.05M 上下文吗?
API 页列出 1,050,000 token,但客户端或提供商可能更早压缩;超过 272K 输入还会触发完整请求倍率。
应选哪个 reasoning effort?
从能通过验收的最低档开始。更高 effort 可能提高难题表现,也可能增加 token、时间和额度消耗。
原生电脑操作代表安全吗?
不代表。它扩大了动作范围,仍需确认策略、权限、日志、测试和人工批准。
工具搜索一定会降低账单吗?
OpenAI 在一个 250 任务 MCP Atlas 设置中报告减少 47% token,但你的工具定义、服务器延迟、失败和入口可能不同。
能在 Tabbit 使用吗?
本文没有核验已登录 Tabbit 会话。查看实时选择器,把一次成功任务当作本地观察,不要当作平台保证。
常见问题
GPT-5.4 是什么?
GPT-5.4 是 OpenAI 于 2026 年 3 月发布的前沿模型,面向专业工作、编码、工具调用和电脑操作智能体。API ID 为 gpt-5.4,也以 GPT-5.4 Thinking 进入 ChatGPT 和 Codex。
GPT-5.4 的上下文和输出上限是多少?
API 模型页列出 1,050,000 token 上下文和 128,000 token 最大输出。客户端、计划或提供商可能提供更小窗口,超过 272K 输入还会触发完整请求的不同价格倍率。
GPT-5.4 如何计费?
API 价格为输入每百万 token 2.50 美元、缓存输入 0.25 美元、输出 15 美元。超过 272K 输入的完整请求按输入 2 倍、输出 1.5 倍计价。
GPT-5.4 改变了什么?
OpenAI 将 GPT-5.3-Codex 编码能力与专业知识工作、原生电脑操作、工具搜索、改进的网页搜索和可调节思考结合。ChatGPT Thinking 还可以先给工作计划并在执行中接受方向调整。
在哪里可以使用 GPT-5.4?
OpenAI 列出 API、ChatGPT Thinking 和 Codex,并有提供商与工作区规则。模型 ID、地区、组织、计划、应用版本和工具权限决定实际入口。
能在 Tabbit Browser 使用 GPT-5.4 吗?
本文没有用已登录 Tabbit 账户实测 GPT-5.4,因此不声称选择器、有效上下文、延迟、费用或工具。请查看实时选择器并验证一个可回滚的小任务。