同一条无跟进创意编码提示下,GPT-5.4 的视觉/布局最好看,但原子时间同步会漂移;Claude 更重正确性,Gemini 更完整,说明单一模型不能同时覆盖设计与技术验证。
适合的任务:比较前端生成、外观层次、集成正确性和不同模型的失败模式。
不适合的任务:把单个 atomic world clock prompt 当成通用编码排名,或把文章未披露的代码产物当作正式 benchmark。
适用的模型版本:GPT-5.4、Claude(文章上下文指 Opus 4.6)、Gemini、MiniMax M2.5。
适用的客户端、Agent 或 API:文章未公开统一客户端/harness;作者还进行两周日常项目使用。
推荐的推理档位和参数:未公开/无法核实;文章不是参数控制实验。
任务:一次提示构建 atomic world clock app,要求模拟时钟、数字时间、世界地图/时区和真实 atomic time synchronization。
约束:四个模型同一提示、one shot、无 follow-up、无 hand-holding。
后续观察:作者随后连续两周在真实项目中使用 GPT-5.4,但未公开完整项目日志或统一评分表。
检查点:布局/审美、NTP/atomic sync、模拟指针角度、地图完整性、运行可用性。
GPT-5.4:外观最好、布局清晰,适合展示;但 atomic sync 只取一次时间后漂移,analog clock hands 略有偏差。
Claude:NTP 同步正确、按间隔更新;视觉较功能化而非漂亮。
Gemini:首轮有 import errors,修复后得到较完整的真实地理投影世界地图;时间同步同样漂移,指针偏差。
MiniMax M2.5:该创意集成任务产生非功能结果;作者说明针对性代码修复可能不同。
四个模型都在模拟时钟指针位置上出错,暴露出看似简单的角度映射问题。
文章附带的公开数据表(来源 Vals.ai/Artificial Analysis)列出:GPT-5.4 SWE-Bench Pro 57.7%、Terminal-Bench 2.0 75.1%、OSWorld 75.0%;但作者强调不同 scaffold 会明显改变结果。
该测试把“好看”“完整”“正确”拆开:GPT-5.4 适合视觉设计和定向修复候选,但任何时间、金融或同步类功能都必须加入真实协议/数据验证。作者的路由建议是按任务分工,而不是寻找一个全能模型。
单一 prompt、四个模型、无公开仓库/代码 diff/自动测试报告,不能给出统计显著性。
模型参数、温度、工具、上下文和运行时没有完整披露,难以严格复现。
文章的 benchmark 表混合官方/第三方数据,并且其关于长上下文、模型价格和其他模型的部分是二次资料;不应与本次创意测试混为一谈。
保留原始 atomic world clock 需求,给每个模型相同文件起始状态、API mock 和运行环境。
预先写自动检查:NTP/atomic sync 更新间隔、时针/分针/秒针角度、时区转换、地图数据和无网络回退。
每个模型运行多次,记录首次可运行时间、测试失败、视觉评分、功能通过率和人工修订。
将 GPT-5.4 的设计质量与协议正确性分别评分,不让漂亮界面掩盖同步错误。
用第二个真实项目验证结果,再决定是否将 GPT-5.4 用于设计、修复或审查。
原文公开了完整任务描述、one-shot/无跟进约束、四模型逐项结果,以及 GPT-5.4 外观好但 atomic sync 漂移、Claude NTP 正确、Gemini 地图完整、MiniMax 非功能等观察。
作者的总结是 “Design? GPT 5.4. Correctness? Claude. Completeness? Gemini”,这是一条单任务观察,不应扩展为普遍排名。
GPT-5.4