GPT-5.6 Terra 模型测评导航
汇总 GPT-5.6 Terra 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。
官方
3 条已核对来源的资料GPT-5.6 Terra System Card 安全防护与 Agent 边界
System Card 将 Terra 与 Sol、Luna 一起评为网络安全及生物化学领域的 High capability、但未达到 Critical;其安全边界必须和工具 Agent 的确认、提示注入防护及数据破坏测试一起评估。
GPT-5.6 Terra SonarSource 4,444 Java 任务代码质量与安全复测
在同一组 4,444 个 Java 任务和 medium 推理配置下,Terra 生成的代码更短、缺失完成更少,但认知复杂度、bug/vulnerability 和 code smell 密度更高,必须接入静态分析与测试。
OpenAI 官方 GPT-5.6 Terra 基准、定价与任务边界
OpenAI 将 Terra 定位为日常工作的均衡层:官方表中它在编码、电脑使用、学术、工具使用和长上下文上明显强于 GPT-5.5 的若干项目,但这些数字是发布方结果,不能替代相同 harness 的独立复测。
媒体
1 条已核对来源的资料社区
5 条已核对来源的资料GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准
这个小样本本地基准没有证明 Terra 是通用最优,但显示 Terra max 在一个主输出角色中拿到 4.86/5、在一项植入 bug 修复中 4/4 正确却耗时 102.20 秒,适合把它当候选路由而非默认结论。
Artificial Analysis:GPT-5.6 Terra 在智能—成本曲线上的位置
Artificial Analysis 公开结论称,在其 Intelligence Index 的智能—任务成本图中,GPT-5.6 Sol 与 Luna 的每个点都领先 Terra;因此 Terra 可能缺少清晰的成本/智能优势,但帖文没有给出完整原始数据,不能单凭它做采购决策。
25+ Claude Code/Codex Agent 无人值守循环:Terra 的批量研究实战
在一个每天为 22 个城市研究和整理活动的网站中,作者发现 Sonnet 5、GPT-5.6 Terra 甚至 Haiku 都能稳定完成同一类任务,远低于 Opus 的额度压力;但这不是受控模型横评。
四模型同提示 iPhone UI 盲测:Terra 的真实开发任务证据
作者把 GPT-5.6 Sol、Terra、Luna 和 Claude Fable 5 放在同一 iPhone UI 移植任务中、给相同提示和一小时,进行盲测;它说明真实 UI/代码交付应看需求阅读和功能完整性,但原帖未公开 Terra 的逐项得分。
Codex 中 Terra High 与 Luna Extra High 的个人限额对照
作者在“严格测试后的更正”中称 Codex 的 GPT-5.6 Luna Extra High 与 Terra High 性能相当,但 Luna 快约 1.3 倍、便宜约 2.5 倍;由于没有公开任务集和原始日志,这只能作为路由假设。
GPT-5.6 Terra
在 Tabbit 中使用并对比模型
汇总 GPT-5.6 Terra 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。