Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GPT-5.6 Terra · 媒体来源 · 独立测量

GPT-5.6 Terra Artificial Analysis 智能、成本与编码 Agent 指数

Artificial Analysis 的 GPT-5.6 Terra 页面把 Intelligence Index、Coding Agent Index 与成本位置放在同一比较框架,适合做成本—能力初筛。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

来源具体观察
2026-07-09 页面;Terra max Intelligence Index 55、Coding Agent Index 77;页面将其放在 Sol 与 Luna 的成本/能力对照中。
已公布条件
Artificial Analysis 的指数和价格按其公开 harness 与当日快照计算;不等于 OpenAI API 的所有档位或用户账单。

关键数据与适用场景

一句话结论

Artificial Analysis 的指数显示 Terra max 的 Intelligence Index 为 55、Coding Agent Index 为 77,并把它的成本位置放在 Sol 与 Luna 之间,但 Terra 并非所有成本/智能 Pareto 前沿的最优点。

测试环境

  • 指数:Artificial Analysis Intelligence Index v4.1 与 Coding Agent Index。

  • 编码 Agent harness:文章说明 Index 组合了 Codex、Claude Code、Grok Build 等 Agent harness,并覆盖 DeepSWE、Terminal-Bench v2、SWE-Atlas-QnA。

  • 推理档位:文章主要报告 GPT-5.6 各模型 max,并比较不同 reasoning effort 的成本/智能前沿。

  • 数据来源:Artificial Analysis 的统一指数与任务成本统计;文章注明其在预发布阶段支持 OpenAI 对 Sol、Terra、Luna 做评估。

输入/配置

文章公开了指数名称、模型档位、每任务成本和部分组成评测,但没有逐题 prompt、完整采样参数或可下载的 Terra 运行 trace。完整复现需使用 Artificial Analysis 的评测服务或同版本公开 harness。

结果数据

  • Intelligence Index:Terra max 为 55;Sol max 为 59;Luna max 为 51。

  • Intelligence Index 每任务成本:Terra 约 $0.55,Sol 约 $1.04,Luna 约 $0.21;文章将 Terra 与 Luna 相对 Sol 的成本差异概括为约 50% 和 80%。

  • Coding Agent Index:Terra max 为 77,Sol max 为 80,Luna max 为 75。

  • Coding Agent 成本:文章称 Terra max 和 Luna max 相对 Sol 分别约低 60% 和 80%。

  • AA-Briefcase:文章主要公布 Sol 的对照结果,并提醒 GPT-5.6 家族在知识工作上仍需按 rubric、Elo 和 Presentation Elo 分开看,不能把 Coding Agent Index 当成专业文档质量。

  • Pareto 观察:文章称 Luna 和 Sol 在 Intelligence 与成本前沿上持续领先 Terra;Terra max 的“中间价格”并不自动意味着全局性价比最优。

结论

  • Terra 是一条清晰的中档成本/智能路线:比 Sol 便宜、比 Luna 智能指数高,但不能只看模型档位判断最优预算点。

  • 对 Codex/终端类 Agent,Terra max 的 77 分足以进入前沿编码比较;实际选择仍取决于任务失败成本、工具 harness 和输出长度。

  • 对批量任务,应先在自己的任务分布上比较“每任务成本 × 通过率”,而不是只比较每百万 token 价格。

局限

  • 文章明确说明 Artificial Analysis 在预发布阶段支持 OpenAI,这构成潜在的选择和配置偏差;它仍是外部指数,但不应视为完全无利益关系的盲测。

  • Coding Agent Index 绑定不同 Agent harness;模型分数和成本不能脱离 harness 直接比较。

  • 每任务成本是特定日期、推理档位和输入分布下的测量,缓存、重试、工具费用和账户价格会改变实际账单。

  • 文章没有公布 Terra 每道题的输入、输出和失败案例,因此不能独立复算总分。

复现步骤

  1. 记录 Artificial Analysis 文章版本、模型别名、max 档位和采集日期。

  2. 在同一 Coding Agent harness 中固定任务集、超时、工具版本和并发,分别运行 Terra、Sol、Luna。

  3. 对每次任务保存通过状态、模型轮数、输入/输出 tokens、工具调用、耗时和美元成本。

  4. 将结果拆成 Intelligence、Coding Agent 和 Briefcase/文档质量,不做跨指数加权。

  5. 计算每个模型的通过率、每任务成本和 cost-per-success,再与文章的方向性结论比较。

来源摘录或观察(仅做合规短引)

文章报告 “GPT-5.6 Terra (max) and Luna (max) score 55 and 51 respectively”。该数字是指数分,不是百分比。

能支持的判断

  • 支持该来源观察:2026-07-09 页面;Terra max Intelligence Index 55、Coding Agent Index 77;页面将其放在 Sol 与 Luna 的成本/能力对照中。

不能支持的判断

  • 支持比较相同口径的指数与成本,不支持推断具体代码库成功率、未来价格或 Tabbit 账户可用性。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Artificial Analysis · Artificial Analysis · 原文发布日期 2026-07-09 · 本站编辑日期 2026-09-20

打开原始来源

GPT-5.6 Terra

在 Tabbit 中比较 GPT-5.6 Terra

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GPT-5.6 Terra:模型定位、获取方式与适用边界

从 API 规格、Sol 与 Luna 的差异、访问入口、价格边界和评测风险,判断 GPT-5.6 Terra 是否适合你的工作流。

相关评测

GPT-5.6 Terra System Card 安全防护与 Agent 边界OpenAI System Card 将 Terra 的安全能力放在具体工具、沙箱和提示注入测试中;结果支持安全边界评估,不等于生产防护保证。OpenAI 官方 GPT-5.6 Terra 基准、定价与任务边界OpenAI GPT-5.6 发布页把 Terra 放在 Sol 与 Luna 的系列定位中,并将基准、价格和任务类型分开呈现;没有公开 Terra 的业务成功率。GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准这条证据记录“GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。Artificial Analysis:GPT-5.6 Terra 在智能—成本曲线上的位置这条证据记录“Artificial Analysis:GPT-5.6 Terra 在智能—成本曲线上的位置”在来源公布的模型、平台、日期和样本条件下的观察;不能外推为统一排名或生产保证。GPT-5.6 Terra 长上下文成本阈值与路由工作流DataCamp 的 Terra 路由案例用输入长度、工具调用频率和终端需求划分长上下文任务,并提醒按完整请求成本预算。GPT-5.6 Terra API 模型参数与工具配置OpenAI 模型页给出 Terra 的模型 ID、推理档位、上下文与输出上限及工具能力,可用于接入前的参数核对。GPT-5.6 Terra 前端交互原型提示词与验证工作流OpenAI 发布页展示用 GPT-5.6 系列生成可运行前端原型的短提示,并把浏览器渲染检查纳入后续迭代。Framer Agent 用 GPT-5.6 Terra 生成入场动画与布局变体Till Janek 的 Framer 案例把少量选择题、设计系统约束和页面级动画变体组合成 Terra 的视觉探索流程。