Tabbit博客

GPT-5.4 是什么:变化、获取方式与使用边界

用官方与独立来源说明 GPT-5.4 的电脑操作、专业工作、工具搜索、上下文和计费边界、访问入口与实际风险。

本文目录
  1. 关键结论
  2. 规格与入口
  3. 与 GPT-5.3-Codex 和 GPT-5.2 的变化
  4. 不混淆访问与计费
  5. 场景自检
  6. 社区证据
  7. Tabbit 能证明什么
  8. 安全与未知风险
  9. 结论
  10. 来源与常见问题
  11. ChatGPT、Codex 和 API 中的 GPT-5.4 一样吗?
  12. API 真支持 1.05M 上下文吗?
  13. 应选哪个 reasoning effort?
  14. 原生电脑操作代表安全吗?
  15. 工具搜索一定会降低账单吗?
  16. 能在 Tabbit 使用吗?

GPT-5.4 是 OpenAI 于 2026 年 3 月发布的前沿模型,面向专业工作、编码、工具调用和电脑操作智能体。它适合试验跨文件、应用和网站执行的工作流,但访问入口和计费细节与模型名称同样重要。

截至 2026 年 9 月 20 日,API 页列出 1,050,000 token 上下文;输入超过 272K 时,完整请求按输入 2 倍、输出 1.5 倍计价。这是 API 规则,不代表 ChatGPT、Codex、云提供商或 Tabbit 都提供同样的有效上下文。先看 GPT-5.4 模型资源,再确认实际产品和账户。

关键结论

  • GPT-5.4 把 GPT-5.3-Codex 编码能力带入通用模型,并加入专业工作和原生电脑操作。

  • API 列出 gpt-5.4、1,050,000 上下文、128,000 最大输出和 none 到 xhigh 的 reasoning effort。

  • OpenAI 报告 OSWorld-Verified 75.0%、WebArena-Verified 67.3%、Online-Mind2Web 92.8%,以及工具搜索在 250 个 MCP Atlas 任务中减少 47% token。

  • API 价格为输入 $2.50、缓存输入 $0.25、输出 $15 / 百万 token;超过 272K 会改变完整请求倍率,订阅额度另算。

  • 原生电脑操作扩大了动作能力,不会自动解决权限、确认和安全责任。

规格与入口

项目当前 API 快照边界
API IDgpt-5.4日志固定完整 ID;ChatGPT 和 Codex 是不同入口。
发布2026-03-05比较时保留版本、日期和 harness。
上下文 / 最大输出1,050,000 / 128,000 tokenAPI 上限,客户端可能更小。
输入 / 输出文本、图片 / 文本工具和电脑操作取决于入口。
reasoningnone、low、medium、high、xhighUI 或计划可能只开放部分档位。
API 价格$2.50 输入、$0.25 缓存、$15 输出 / MTok工具调用、Batch/Flex 和 Priority 另计。
长输入规则>272K:输入 2 倍、输出 1.5 倍这是计费规则,不是订阅规则。
知识截止API 页列 2025-08-31当前事实仍需检索。

提示资源评测资源保存原始条目,不能授予 OpenAI 或浏览器访问权限。

与 GPT-5.3-Codex 和 GPT-5.2 的变化

OpenAI 将 5.3-Codex 的编码能力与专业工作结合。三个变化最影响实际任务:

  1. 原生电脑操作:API 和 Codex 可以根据截图、鼠标键盘执行任务,也能编写 Playwright;开发者可配置确认策略。

  2. 工具搜索:模型先搜索需要的工具定义,而不是把所有 MCP 函数都塞进提示词。OpenAI 在 36 个 MCP 服务器、250 个任务的内部评估中报告 token 总量减少 47%。

  3. 可调节思考:ChatGPT Thinking 可先给计划并在执行中接受指示。Codex Fast mode 是同一模型更快的路线,不是新模型。

变化OpenAI 的公开说法本地需验证
专业工作GDPval 83.0%,内部表格建模 87.3%你的文件、公式和验收规则是否相同。
编码SWE-Bench Pro 57.7%,Terminal-Bench 2.0 75.1%仓库、工具、effort、测试和复核负担。
电脑操作OSWorld 75.0%、WebArena 67.3%、Online-Mind2Web 92.8%截图、权限、确认和失败恢复。
工具生态MCP Atlas token 减少 47%工具定义、服务器延迟和提供商支持。
长上下文Graphwalks 256K–1M 准确率 21.4%;MRCR 512K–1M 36.6%1M 上限不等于 1M 质量保证。

OpenAI 使用不同 reasoning 和研究环境;生产 ChatGPT 结果可能不同。需要设计验证方案时可看智能体推理指南。独立 Reddit 评测只有 14 次直接 5.4 运行,虽报告方向性优势但保留大误差;ORCFLO 和 LayerLens 也各自使用不同 cohort、评委和指标,不能拼成单一排名。

不混淆访问与计费

入口它是什么必须确认
OpenAI APIResponses API/SDK 中的 gpt-5.4组织、地区、速率、工具、effort 和账单。
ChatGPTGPT-5.4 Thinking,Pro 是独立路线计划、工作区、选择器和 ChatGPT 上下文。
Codex面向编码流程的 GPT-5.4客户端版本、额度、上下文设置和仓库权限。
云提供商提供商部署或网关别名、数据政策、地区、配额和工具。
Tabbit Browser若实时选择器开放,则是独立浏览器客户端已登录账户、显示模型、有效上下文和可回滚任务。

API 标准价格是 $2.50 输入、$0.25 缓存、$15 输出 / 百万 token;Batch/Flex 为标准价格一半,Priority 为两倍,工具调用可能另收费。超过 272K 输入的完整请求按 2 倍/1.5 倍计价。这些数字不能转换为 ChatGPT、Codex 或 Tabbit 的订阅额度。

场景自检

工作类型第一个测试验收标准
浏览器或桌面流程可回滚的表单或文档任务点击正确、无未批准操作、有审计日志。
多文件编码有现成测试命令的小功能测试通过、diff 不越界、没有跳过验证。
表格和文档固定 fixture 与期望单元格数值、公式、格式和引用一致。
MCP 工具流程工具搜索与短工具列表各跑一次结果一致、提示 token 更少、失败清楚。
长研究有来源包、停止条件和引用要求引用可打开、论点有证据、矛盾被指出。

记录模型 ID、入口、effort、上下文设置、工具、输入/输出/缓存 token、用时、重试和人工修正。比较每个已接受结果的成本,而不是只看单价。GPT-5.6 TerraGPT-5.6 SolSol 1M 指南是更新的家庭页面,不能证明 5.4 提供同样行为。

社区证据

Reddit 首次印象帖称 5.4 比 5.3-Codex 更快,并报告 5.4 high 执行计划、5.3-Codex 复核;同一帖提醒 CLI 可能需要显式打开 1M。另一个实验在同一 Express JS 项目和 prompt 上创建 16 个 worktree,构建 React 笔记应用功能,适合作为本地比较模板,但代码质量由 Opus 评判,仍有主观性。负面反馈则认为 5.4 会中断子智能体并过快推进,严格计划才可靠。这些是任务信号,不是普遍性能证明。

Tabbit 能证明什么

本文没有用已登录账户在 Tabbit Browser 实测 GPT-5.4,因此不声称选择器、有效上下文、延迟、提供商路由、订阅额度、工具权限或费用。若实时选择器出现模型,请先做公开或可回滚任务,记录显示名称和 effort,并与已知验收结果比较。

Tabbit Browser 总览解释浏览器层工作流,不提供 OpenAI API 额度,也不改变 ChatGPT/Codex 计划。下载是另一个浏览器选择:

Tabbit Browser

安全与未知风险

OpenAI 按 Preparedness Framework 将 GPT-5.4 视为 High cyber capability,并部署监控、可信访问控制和部分 Zero Data Retention 表面的异步阻断。分类器仍在改进,可能产生误报。原生电脑操作也带来不可逆动作风险:模型能点击和输入,不代表应用可以省略确认。

1M 上下文仍可能受到压缩、噪音和检索质量影响;工具搜索减少提示 token,也会增加发现和服务器失败路径;API 知识截止是 2025-08-31,当前事实需要检索。公开分数都绑定自己的 effort、工具和日期,不能合并成总排名。

结论

GPT-5.4 适合先试专业文档、编码智能体和电脑操作流程。最重要的变化不是一个排行榜数字,而是把编码、工具和电脑操作放进同一通用路线。实际限制在产品边界:超过 272K 的 API 倍率、客户端上下文、工具权限和订阅额度都要单独测量。

来源与常见问题

主要来源是 OpenAI 的发布说明API 模型页部署安全材料,以及 LayerLensORCFLOTom's Guide

ChatGPT、Codex 和 API 中的 GPT-5.4 一样吗?

不完全一样。API ID 是 gpt-5.4,ChatGPT 展示 GPT-5.4 Thinking,Codex 还有自己的上下文、effort、额度和工具控制。

API 真支持 1.05M 上下文吗?

API 页列出 1,050,000 token,但客户端或提供商可能更早压缩;超过 272K 输入还会触发完整请求倍率。

应选哪个 reasoning effort?

从能通过验收的最低档开始。更高 effort 可能提高难题表现,也可能增加 token、时间和额度消耗。

原生电脑操作代表安全吗?

不代表。它扩大了动作范围,仍需确认策略、权限、日志、测试和人工批准。

工具搜索一定会降低账单吗?

OpenAI 在一个 250 任务 MCP Atlas 设置中报告减少 47% token,但你的工具定义、服务器延迟、失败和入口可能不同。

能在 Tabbit 使用吗?

本文没有核验已登录 Tabbit 会话。查看实时选择器,把一次成功任务当作本地观察,不要当作平台保证。

常见问题

GPT-5.4 是什么?

GPT-5.4 是 OpenAI 于 2026 年 3 月发布的前沿模型,面向专业工作、编码、工具调用和电脑操作智能体。API ID 为 gpt-5.4,也以 GPT-5.4 Thinking 进入 ChatGPT 和 Codex。

GPT-5.4 的上下文和输出上限是多少?

API 模型页列出 1,050,000 token 上下文和 128,000 token 最大输出。客户端、计划或提供商可能提供更小窗口,超过 272K 输入还会触发完整请求的不同价格倍率。

GPT-5.4 如何计费?

API 价格为输入每百万 token 2.50 美元、缓存输入 0.25 美元、输出 15 美元。超过 272K 输入的完整请求按输入 2 倍、输出 1.5 倍计价。

GPT-5.4 改变了什么?

OpenAI 将 GPT-5.3-Codex 编码能力与专业知识工作、原生电脑操作、工具搜索、改进的网页搜索和可调节思考结合。ChatGPT Thinking 还可以先给工作计划并在执行中接受方向调整。

在哪里可以使用 GPT-5.4?

OpenAI 列出 API、ChatGPT Thinking 和 Codex,并有提供商与工作区规则。模型 ID、地区、组织、计划、应用版本和工具权限决定实际入口。

能在 Tabbit Browser 使用 GPT-5.4 吗?

本文没有用已登录 Tabbit 账户实测 GPT-5.4,因此不声称选择器、有效上下文、延迟、费用或工具。请查看实时选择器并验证一个可回滚的小任务。

下一步

让 Tabbit 与你并肩工作。

跨标签页调研、自动化重复的浏览器工作,让每一处上下文都触手可及。