Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体GPT-5.4

GPT-5.4:四模型原子时钟应用对照

原始来源

Thomas Wiegold Blog

作者Thomas Wiegold

原文日期2026-03-18

Tabbit 整理2026-08-19

查看原文

一句话结论

同一条无跟进创意编码提示下,GPT-5.4 的视觉/布局最好看,但原子时间同步会漂移;Claude 更重正确性,Gemini 更完整,说明单一模型不能同时覆盖设计与技术验证。

适用场景

  • 适合的任务:比较前端生成、外观层次、集成正确性和不同模型的失败模式。

  • 不适合的任务:把单个 atomic world clock prompt 当成通用编码排名,或把文章未披露的代码产物当作正式 benchmark。

  • 适用的模型版本:GPT-5.4、Claude(文章上下文指 Opus 4.6)、Gemini、MiniMax M2.5。

  • 适用的客户端、Agent 或 API:文章未公开统一客户端/harness;作者还进行两周日常项目使用。

  • 推荐的推理档位和参数:未公开/无法核实;文章不是参数控制实验。

测试环境、输入/配置

  • 任务:一次提示构建 atomic world clock app,要求模拟时钟、数字时间、世界地图/时区和真实 atomic time synchronization。

  • 约束:四个模型同一提示、one shot、无 follow-up、无 hand-holding。

  • 后续观察:作者随后连续两周在真实项目中使用 GPT-5.4,但未公开完整项目日志或统一评分表。

  • 检查点:布局/审美、NTP/atomic sync、模拟指针角度、地图完整性、运行可用性。

结果数据

  • GPT-5.4:外观最好、布局清晰,适合展示;但 atomic sync 只取一次时间后漂移,analog clock hands 略有偏差。

  • Claude:NTP 同步正确、按间隔更新;视觉较功能化而非漂亮。

  • Gemini:首轮有 import errors,修复后得到较完整的真实地理投影世界地图;时间同步同样漂移,指针偏差。

  • MiniMax M2.5:该创意集成任务产生非功能结果;作者说明针对性代码修复可能不同。

  • 四个模型都在模拟时钟指针位置上出错,暴露出看似简单的角度映射问题。

文章附带的公开数据表(来源 Vals.ai/Artificial Analysis)列出:GPT-5.4 SWE-Bench Pro 57.7%、Terminal-Bench 2.0 75.1%、OSWorld 75.0%;但作者强调不同 scaffold 会明显改变结果。

结论

该测试把“好看”“完整”“正确”拆开:GPT-5.4 适合视觉设计和定向修复候选,但任何时间、金融或同步类功能都必须加入真实协议/数据验证。作者的路由建议是按任务分工,而不是寻找一个全能模型。

局限

  • 单一 prompt、四个模型、无公开仓库/代码 diff/自动测试报告,不能给出统计显著性。

  • 模型参数、温度、工具、上下文和运行时没有完整披露,难以严格复现。

  • 文章的 benchmark 表混合官方/第三方数据,并且其关于长上下文、模型价格和其他模型的部分是二次资料;不应与本次创意测试混为一谈。

复现步骤

  1. 保留原始 atomic world clock 需求,给每个模型相同文件起始状态、API mock 和运行环境。

  2. 预先写自动检查:NTP/atomic sync 更新间隔、时针/分针/秒针角度、时区转换、地图数据和无网络回退。

  3. 每个模型运行多次,记录首次可运行时间、测试失败、视觉评分、功能通过率和人工修订。

  4. 将 GPT-5.4 的设计质量与协议正确性分别评分,不让漂亮界面掩盖同步错误。

  5. 用第二个真实项目验证结果,再决定是否将 GPT-5.4 用于设计、修复或审查。

原始证据与数据

原文公开了完整任务描述、one-shot/无跟进约束、四模型逐项结果,以及 GPT-5.4 外观好但 atomic sync 漂移、Claude NTP 正确、Gemini 地图完整、MiniMax 非功能等观察。

来源摘录或观察(仅做合规短引)

作者的总结是 “Design? GPT 5.4. Correctness? Claude. Completeness? Gemini”,这是一条单任务观察,不应扩展为普遍排名。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-5.4

在 Tabbit 中使用并对比模型

GPT-5.4

相关测评

官方OpenAI Newsroom2026-03-05

GPT-5.4:OpenAI 官方专业工作与 Agent 基准

社区Reddit r/AIAgents

GPT-5.4:Reddit AI Agents 多步 Agent 与模型路由体验

GPT-5.4

相关提示词

官方OpenAI API Model Guidance2026-03-05

GPT-5.4:结果契约与验证循环提示

官方OpenAI API Model Page / Model Guidance2026-03-05

GPT-5.4:Responses API 工具搜索与 Phase 配置