Artificial Analysis 公开结论称,在其 Intelligence Index 的智能—任务成本图中,GPT-5.6 Sol 与 Luna 的每个点都领先 Terra;因此 Terra 可能缺少清晰的成本/智能优势,但帖文没有给出完整原始数据,不能单凭它做采购决策。
模型/入口:GPT-5.6 Sol、Terra、Luna 与 GPT-5.5;Artificial Analysis Intelligence Index 的推理任务成本—智能图。
输入/配置:原帖只说明使用 Intelligence Index 图表,没有公开完整任务集、模型 snapshot、effort、采样参数、价格时点或样本明细。
结果形式:官方账号文字结论和配图;未提供可下载逐题结果。
公开帖没有可直接复现的 prompt 或完整配置。可复核的原始声明是:推理任务中,GPT-5.6 系列相对 GPT-5.5 处于 Pareto 前沿;对任何 Terra effort,存在 Luna 或 Sol effort,在不增加成本时更智能,或以更低成本达到相同智能。
Artificial Analysis:Sol 和 Luna 在智能与任务成本图表的每个点上领先 Terra。
Artificial Analysis:Luna 特别具有成本效益。
Rohan Paul 对该帖的转述进一步称 Terra“在整个智能—成本曲线上落后”,但这是评论者表述,不是额外的原始测量。
OpenAI 官方页同一时期列出 Intelligence Index v4.1:Terra 55、Luna 51.2、Sol 58.9;两者口径和时间点可能不同,不能把官方总分与 Artificial Analysis 图上的 effort 点直接混算。
对以 API 成本/智能为主要目标的任务,Terra 应与 Luna/Sol 做同 harness 试算;不能因为 Terra 名称位于中间层,就默认它是最优性价比。Terra 仍可能在特定延迟、上下文、工具可靠性或团队已有路由中有价值。
原帖未公开完整图表数据、任务清单、评分、模型版本、价格和 effort 映射,无法由此复算每个点。
“每个点都领先”是曲线层面的结论,不代表 Terra 在每个具体任务都失败。
官方页与独立机构的指数版本/采集时间可能不同;冲突时应保留两套原始口径。
获取同一 Intelligence Index 版本和模型 snapshot,记录采集时间、价格与 effort。
对 Terra、Luna、Sol 使用相同任务集和工具,至少重复 3 次,记录正确率、输入/输出 token、延迟和费用。
绘制 cost–intelligence 曲线,按每个 Terra 点寻找成本不高且分数更高的 Luna/Sol 点。
把无法支配的点、失败任务和延迟异常单独列出,不把曲线结论外推到所有工作流。
GPT-5.6 Terra