这个小样本本地基准没有证明 Terra 是通用最优,但显示 Terra max 在一个主输出角色中拿到 4.86/5、在一项植入 bug 修复中 4/4 正确却耗时 102.20 秒,适合把它当候选路由而非默认结论。
任务:3 个战略决策 memo、1 个基于仓库的执行 brief、2 个植入 bug 的修复任务并带直接测试。
对照:GPT-5.6 Sol/Luna/Terra,并含 Fable、GPT-5.5、GPT-5.4 mini 等路线。
控制:每个比较内使用相同 prompt 或 fixture;战略任务使用固定 rubric,覆盖判断、依据、风险、边界、可执行性和效率。
评估方式:模型身份对评估者可见;作者明确称这是本地 workflow 分数,不是通用智能分数。
作者公开了任务类型、路线、观测时间、推理 tokens 和部分结果,但没有发布完整 prompt、仓库 fixture、测试代码或可下载 trace。该来源适合复刻“按角色小样本路由”的方法,不足以复算所有分数。
Multi-layer productization:Fable reference 95;Sol max 94、xhigh 90、high 87、GPT-5.5 high 81。
Decision-method / wrong-object review:Fable reference 92;Sol max 91、xhigh 90、Opus-class 87。
Bounded opportunity comparison:Fable reference 95;Sol high 94、Sol max 90、Luna max 88、Terra max 88。
Sol high 与 reference 相差不超过 1 分时,耗时 81.5 秒、推理 tokens 369;Sol max 为 216.9 秒、5,178 tokens,未改变决策。
Repository-grounded brief:Sol high 93、80.73 秒、1,818 reasoning tokens;Sol medium 91、70.66 秒、779 tokens。作者计算 medium 约快 12.5%,少用 57% reasoning tokens。
Planted-bug repair:Terra max 1 个 fixture,直接测试 4/4,通过首轮,观测时间 102.20 秒;同表中的 Sol low 为 2 fixtures、10/10、约 37.2 秒平均。
另一个 frozen role-specific suite:Terra max 在 primary-output role 得分 4.86/5;Sol xhigh 在 quality-control 和 adversarial-review roles 得分 4.70 与 4.93。
Terra max 在该作者的某个“主输出”角色中表现突出,但在公开的植入 bug 任务中正确而慢,不能据此替换所有 Sol 路由。
更有价值的可复用结论是按任务角色分档,并把“一点以内差异”当作噪声;作者建议下一步做 blinded holdout。
对 Terra 的复测应优先关注:同一 fixture 的首轮通过率、耗时、推理 tokens 和是否需要人工纠正,而不是只比较最终文本观感。
样本极小:战略 3 个 memo、仓库 brief 1 个、bug fixture 1–2 个;统计不确定性很大。
评估者知道模型身份,存在确认偏差;作者自己也把结果定位为 local workflow scores。
本地 CLI 延迟包含环境开销,订阅消耗不能直接等同 API token 成本。
不同模型的 Chat、CLI、Agent harness 和多智能体表面不同;横向结果不是完全同配置。
为“战略决策、仓库 brief、植入 bug 修复、主输出”各准备最小但固定的任务集和验收 rubric。
在相同工作树、工具版本、超时与测试命令下运行 Terra max,并保存完整 prompt、输出、工具轨迹、tokens、耗时。
把模型身份从评估表中隐藏,至少让第二位评估者按同一 rubric 评分。
对每个角色至少重复多轮,报告均值、首轮通过率、人工纠正次数和失败类型。
再与 Sol high/medium、GPT-5.4 mini low 等候选路线比较,只有稳定差异才固化路由。
作者明确写道 “These are local workflow scores, not general intelligence scores.” 这是解释本结果的关键边界。
GPT-5.6 Terra