Artificial Analysis 的指数显示 Terra max 的 Intelligence Index 为 55、Coding Agent Index 为 77,并把它的成本位置放在 Sol 与 Luna 之间,但 Terra 并非所有成本/智能 Pareto 前沿的最优点。
指数:Artificial Analysis Intelligence Index v4.1 与 Coding Agent Index。
编码 Agent harness:文章说明 Index 组合了 Codex、Claude Code、Grok Build 等 Agent harness,并覆盖 DeepSWE、Terminal-Bench v2、SWE-Atlas-QnA。
推理档位:文章主要报告 GPT-5.6 各模型 max,并比较不同 reasoning effort 的成本/智能前沿。
数据来源:Artificial Analysis 的统一指数与任务成本统计;文章注明其在预发布阶段支持 OpenAI 对 Sol、Terra、Luna 做评估。
文章公开了指数名称、模型档位、每任务成本和部分组成评测,但没有逐题 prompt、完整采样参数或可下载的 Terra 运行 trace。完整复现需使用 Artificial Analysis 的评测服务或同版本公开 harness。
Intelligence Index:Terra max 为 55;Sol max 为 59;Luna max 为 51。
Intelligence Index 每任务成本:Terra 约 $0.55,Sol 约 $1.04,Luna 约 $0.21;文章将 Terra 与 Luna 相对 Sol 的成本差异概括为约 50% 和 80%。
Coding Agent Index:Terra max 为 77,Sol max 为 80,Luna max 为 75。
Coding Agent 成本:文章称 Terra max 和 Luna max 相对 Sol 分别约低 60% 和 80%。
AA-Briefcase:文章主要公布 Sol 的对照结果,并提醒 GPT-5.6 家族在知识工作上仍需按 rubric、Elo 和 Presentation Elo 分开看,不能把 Coding Agent Index 当成专业文档质量。
Pareto 观察:文章称 Luna 和 Sol 在 Intelligence 与成本前沿上持续领先 Terra;Terra max 的“中间价格”并不自动意味着全局性价比最优。
Terra 是一条清晰的中档成本/智能路线:比 Sol 便宜、比 Luna 智能指数高,但不能只看模型档位判断最优预算点。
对 Codex/终端类 Agent,Terra max 的 77 分足以进入前沿编码比较;实际选择仍取决于任务失败成本、工具 harness 和输出长度。
对批量任务,应先在自己的任务分布上比较“每任务成本 × 通过率”,而不是只比较每百万 token 价格。
文章明确说明 Artificial Analysis 在预发布阶段支持 OpenAI,这构成潜在的选择和配置偏差;它仍是外部指数,但不应视为完全无利益关系的盲测。
Coding Agent Index 绑定不同 Agent harness;模型分数和成本不能脱离 harness 直接比较。
每任务成本是特定日期、推理档位和输入分布下的测量,缓存、重试、工具费用和账户价格会改变实际账单。
文章没有公布 Terra 每道题的输入、输出和失败案例,因此不能独立复算总分。
记录 Artificial Analysis 文章版本、模型别名、max 档位和采集日期。
在同一 Coding Agent harness 中固定任务集、超时、工具版本和并发,分别运行 Terra、Sol、Luna。
对每次任务保存通过状态、模型轮数、输入/输出 tokens、工具调用、耗时和美元成本。
将结果拆成 Intelligence、Coding Agent 和 Briefcase/文档质量,不做跨指数加权。
计算每个模型的通过率、每任务成本和 cost-per-success,再与文章的方向性结论比较。
文章报告 “GPT-5.6 Terra (max) and Luna (max) score 55 and 51 respectively”。该数字是指数分,不是百分比。
GPT-5.6 Terra