GPT-5.6 Terra · 社区来源 · 个人体验
这条证据记录“Artificial Analysis:GPT-5.6 Terra 在智能—成本曲线上的位置”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
Artificial Analysis 公开结论称,在其 Intelligence Index 的智能—任务成本图中,GPT-5.6 Sol 与 Luna 的每个点都领先 Terra;因此 Terra 可能缺少清晰的成本/智能优势,但帖文没有给出完整原始数据,不能单凭它做采购决策。
模型/入口:GPT-5.6 Sol、Terra、Luna 与 GPT-5.5;Artificial Analysis Intelligence Index 的推理任务成本—智能图。
输入/配置:原帖只说明使用 Intelligence Index 图表,没有公开完整任务集、模型 snapshot、effort、采样参数、价格时点或样本明细。
结果形式:官方账号文字结论和配图;未提供可下载逐题结果。
公开帖没有可直接复现的 prompt 或完整配置。可复核的原始声明是:推理任务中,GPT-5.6 系列相对 GPT-5.5 处于 Pareto 前沿;对任何 Terra effort,存在 Luna 或 Sol effort,在不增加成本时更智能,或以更低成本达到相同智能。
Artificial Analysis:Sol 和 Luna 在智能与任务成本图表的每个点上领先 Terra。
Artificial Analysis:Luna 特别具有成本效益。
Rohan Paul 对该帖的转述进一步称 Terra“在整个智能—成本曲线上落后”,但这是评论者表述,不是额外的原始测量。
OpenAI 官方页同一时期列出 Intelligence Index v4.1:Terra 55、Luna 51.2、Sol 58.9;两者口径和时间点可能不同,不能把官方总分与 Artificial Analysis 图上的 effort 点直接混算。
对以 API 成本/智能为主要目标的任务,Terra 应与 Luna/Sol 做同 harness 试算;不能因为 Terra 名称位于中间层,就默认它是最优性价比。Terra 仍可能在特定延迟、上下文、工具可靠性或团队已有路由中有价值。
原帖未公开完整图表数据、任务清单、评分、模型版本、价格和 effort 映射,无法由此复算每个点。
“每个点都领先”是曲线层面的结论,不代表 Terra 在每个具体任务都失败。
官方页与独立机构的指数版本/采集时间可能不同;冲突时应保留两套原始口径。
获取同一 Intelligence Index 版本和模型 snapshot,记录采集时间、价格与 effort。
对 Terra、Luna、Sol 使用相同任务集和工具,至少重复 3 次,记录正确率、输入/输出 token、延迟和费用。
绘制 cost–intelligence 曲线,按每个 Terra 点寻找成本不高且分数更高的 Luna/Sol 点。
把无法支配的点、失败任务和延迟异常单独列出,不把曲线结论外推到所有工作流。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
X / Artificial Analysis 官方账号 · Artificial Analysis(@ArtificialAnlys) · 原文发布日期 2026-07-11 · 本站编辑日期 2026-09-20
打开原始来源GPT-5.6 Terra
下载 Tabbit 客户端后检查模型可用性