作者把 GPT-5.6 Sol、Terra、Luna 和 Claude Fable 5 放在同一 iPhone UI 移植任务中、给相同提示和一小时,进行盲测;它说明真实 UI/代码交付应看需求阅读和功能完整性,但原帖未公开 Terra 的逐项得分。
任务:四个模型构建相同的 iPhone UI/移植 App。
对照模型:GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna、Claude Fable 5。
控制条件:作者公开说使用相同提示、相同一小时,并进行盲测;视频章节还覆盖横屏、时间解析、外部显示器、自动隐藏控件、错误和远程 Mac QA。
结果形式:X 帖文链接到作者的视频/章节;X 文本未提供完整 prompt、代码、逐项评分表或每个模型的最终排名。
原帖可见的是测试设计,不是完整可复制 prompt。公开测试条件:
相同的设计文档、代码、提示和一小时预算;四个模型分别移植同一 iPhone UI,再进行盲测。视频章节公开了可复核的检查点:缺失功能、横屏模式、“5pm”时间功能、外部显示器、自动隐藏控件、错误列表和远程 Mac QA。
作者在章节中记录 Claude Fable 5 得分 93;X 帖文本没有给出 Terra、Sol、Luna 的得分。
作者强调只有一个模型仔细阅读设计文档和代码,足以交付实际使用的功能;具体“一个”是谁必须以视频揭晓和代码证据为准,不能从 X 摘要推断为 Terra 或其他模型。
这是 Terra 是否适合“有设计文档、已有代码、需要跑通 UI 细节”的强相关测试线索,但当前可见数据不足以判定 Terra 胜负。复现时应把需求阅读、功能完整性和设备 QA 作为主要指标,而不是只看首稿外观。
完整 prompt、仓库、模型配置、重复次数、逐项评分和视频中的最终揭晓未在 X 文本公开。
一小时预算、作者代码库和视频人工评分会影响结果;不能外推到所有 iOS 或前端任务。
Fable 93 是作者视频章节中的单项信息,不应当当作标准化 benchmark 分数。
准备相同设计文档、初始代码和四个模型入口,固定一小时预算与工具权限。
对每个模型保存完整 prompt、提交 diff、运行日志和最终构建。
盲化模型身份,按缺失功能、横屏、时间解析、外部显示器、自动隐藏控件、测试通过率和人工可用性评分。
报告逐项结果、失败原因和耗时;不要只报告一个总分。
GPT-5.6 Terra