Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体GPT-5.6 Terra

GPT-5.6 Terra Artificial Analysis 智能、成本与编码 Agent 指数

原始来源

Artificial Analysis

作者Artificial Analysis

原文日期2026-07-09

Tabbit 整理2026-08-19

查看原文

一句话结论

Artificial Analysis 的指数显示 Terra max 的 Intelligence Index 为 55、Coding Agent Index 为 77,并把它的成本位置放在 Sol 与 Luna 之间,但 Terra 并非所有成本/智能 Pareto 前沿的最优点。

测试环境

  • 指数:Artificial Analysis Intelligence Index v4.1 与 Coding Agent Index。

  • 编码 Agent harness:文章说明 Index 组合了 Codex、Claude Code、Grok Build 等 Agent harness,并覆盖 DeepSWE、Terminal-Bench v2、SWE-Atlas-QnA。

  • 推理档位:文章主要报告 GPT-5.6 各模型 max,并比较不同 reasoning effort 的成本/智能前沿。

  • 数据来源:Artificial Analysis 的统一指数与任务成本统计;文章注明其在预发布阶段支持 OpenAI 对 Sol、Terra、Luna 做评估。

输入/配置

文章公开了指数名称、模型档位、每任务成本和部分组成评测,但没有逐题 prompt、完整采样参数或可下载的 Terra 运行 trace。完整复现需使用 Artificial Analysis 的评测服务或同版本公开 harness。

结果数据

  • Intelligence Index:Terra max 为 55;Sol max 为 59;Luna max 为 51。

  • Intelligence Index 每任务成本:Terra 约 $0.55,Sol 约 $1.04,Luna 约 $0.21;文章将 Terra 与 Luna 相对 Sol 的成本差异概括为约 50% 和 80%。

  • Coding Agent Index:Terra max 为 77,Sol max 为 80,Luna max 为 75。

  • Coding Agent 成本:文章称 Terra max 和 Luna max 相对 Sol 分别约低 60% 和 80%。

  • AA-Briefcase:文章主要公布 Sol 的对照结果,并提醒 GPT-5.6 家族在知识工作上仍需按 rubric、Elo 和 Presentation Elo 分开看,不能把 Coding Agent Index 当成专业文档质量。

  • Pareto 观察:文章称 Luna 和 Sol 在 Intelligence 与成本前沿上持续领先 Terra;Terra max 的“中间价格”并不自动意味着全局性价比最优。

结论

  • Terra 是一条清晰的中档成本/智能路线:比 Sol 便宜、比 Luna 智能指数高,但不能只看模型档位判断最优预算点。

  • 对 Codex/终端类 Agent,Terra max 的 77 分足以进入前沿编码比较;实际选择仍取决于任务失败成本、工具 harness 和输出长度。

  • 对批量任务,应先在自己的任务分布上比较“每任务成本 × 通过率”,而不是只比较每百万 token 价格。

局限

  • 文章明确说明 Artificial Analysis 在预发布阶段支持 OpenAI,这构成潜在的选择和配置偏差;它仍是外部指数,但不应视为完全无利益关系的盲测。

  • Coding Agent Index 绑定不同 Agent harness;模型分数和成本不能脱离 harness 直接比较。

  • 每任务成本是特定日期、推理档位和输入分布下的测量,缓存、重试、工具费用和账户价格会改变实际账单。

  • 文章没有公布 Terra 每道题的输入、输出和失败案例,因此不能独立复算总分。

复现步骤

  1. 记录 Artificial Analysis 文章版本、模型别名、max 档位和采集日期。

  2. 在同一 Coding Agent harness 中固定任务集、超时、工具版本和并发,分别运行 Terra、Sol、Luna。

  3. 对每次任务保存通过状态、模型轮数、输入/输出 tokens、工具调用、耗时和美元成本。

  4. 将结果拆成 Intelligence、Coding Agent 和 Briefcase/文档质量,不做跨指数加权。

  5. 计算每个模型的通过率、每任务成本和 cost-per-success,再与文章的方向性结论比较。

来源摘录或观察(仅做合规短引)

文章报告 “GPT-5.6 Terra (max) and Luna (max) score 55 and 51 respectively”。该数字是指数分,不是百分比。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-5.6 Terra

在 Tabbit 中使用并对比模型

GPT-5.6 Terra

相关测评

官方OpenAI Deployment Safety Hub2026-07-09

GPT-5.6 Terra System Card 安全防护与 Agent 边界

官方SonarSource2026-08-06

GPT-5.6 Terra SonarSource 4,444 Java 任务代码质量与安全复测

官方OpenAI 官方发布页2026-07-10

OpenAI 官方 GPT-5.6 Terra 基准、定价与任务边界

社区Reddit r/LLMDevs2026-08-18

GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准

GPT-5.6 Terra

相关提示词

官方OpenAI Developers

GPT-5.6 Terra API 模型参数与工具配置

官方OpenAI 官方发布2026-07-09

GPT-5.6 Terra 前端交互原型提示词与验证工作流

媒体DataCamp2026-08-04

GPT-5.6 Terra 长上下文成本阈值与路由工作流

社区X2026-08-01

Framer Agent 用 GPT-5.6 Terra 生成入场动画与布局变体