Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区GPT-5.6 Terra

Artificial Analysis:GPT-5.6 Terra 在智能—成本曲线上的位置

原始来源

X / Artificial Analysis 官方账号

作者Artificial Analysis(@ArtificialAnlys)

原文日期2026-07-11

Tabbit 整理2026-08-20

查看原文

一句话结论

Artificial Analysis 公开结论称,在其 Intelligence Index 的智能—任务成本图中,GPT-5.6 Sol 与 Luna 的每个点都领先 Terra;因此 Terra 可能缺少清晰的成本/智能优势,但帖文没有给出完整原始数据,不能单凭它做采购决策。

测试环境

  • 模型/入口:GPT-5.6 Sol、Terra、Luna 与 GPT-5.5;Artificial Analysis Intelligence Index 的推理任务成本—智能图。

  • 输入/配置:原帖只说明使用 Intelligence Index 图表,没有公开完整任务集、模型 snapshot、effort、采样参数、价格时点或样本明细。

  • 结果形式:官方账号文字结论和配图;未提供可下载逐题结果。

输入/配置

公开帖没有可直接复现的 prompt 或完整配置。可复核的原始声明是:推理任务中,GPT-5.6 系列相对 GPT-5.5 处于 Pareto 前沿;对任何 Terra effort,存在 Luna 或 Sol effort,在不增加成本时更智能,或以更低成本达到相同智能。

结果数据

  • Artificial Analysis:Sol 和 Luna 在智能与任务成本图表的每个点上领先 Terra。

  • Artificial Analysis:Luna 特别具有成本效益。

  • Rohan Paul 对该帖的转述进一步称 Terra“在整个智能—成本曲线上落后”,但这是评论者表述,不是额外的原始测量。

  • OpenAI 官方页同一时期列出 Intelligence Index v4.1:Terra 55、Luna 51.2、Sol 58.9;两者口径和时间点可能不同,不能把官方总分与 Artificial Analysis 图上的 effort 点直接混算。

结论

对以 API 成本/智能为主要目标的任务,Terra 应与 Luna/Sol 做同 harness 试算;不能因为 Terra 名称位于中间层,就默认它是最优性价比。Terra 仍可能在特定延迟、上下文、工具可靠性或团队已有路由中有价值。

局限

  • 原帖未公开完整图表数据、任务清单、评分、模型版本、价格和 effort 映射,无法由此复算每个点。

  • “每个点都领先”是曲线层面的结论,不代表 Terra 在每个具体任务都失败。

  • 官方页与独立机构的指数版本/采集时间可能不同;冲突时应保留两套原始口径。

复现步骤

  1. 获取同一 Intelligence Index 版本和模型 snapshot,记录采集时间、价格与 effort。

  2. 对 Terra、Luna、Sol 使用相同任务集和工具,至少重复 3 次,记录正确率、输入/输出 token、延迟和费用。

  3. 绘制 cost–intelligence 曲线,按每个 Terra 点寻找成本不高且分数更高的 Luna/Sol 点。

  4. 把无法支配的点、失败任务和延迟异常单独列出,不把曲线结论外推到所有工作流。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-5.6 Terra

在 Tabbit 中使用并对比模型

GPT-5.6 Terra

相关测评

官方OpenAI Deployment Safety Hub2026-07-09

GPT-5.6 Terra System Card 安全防护与 Agent 边界

官方SonarSource2026-08-06

GPT-5.6 Terra SonarSource 4,444 Java 任务代码质量与安全复测

官方OpenAI 官方发布页2026-07-10

OpenAI 官方 GPT-5.6 Terra 基准、定价与任务边界

媒体Artificial Analysis2026-07-09

GPT-5.6 Terra Artificial Analysis 智能、成本与编码 Agent 指数

GPT-5.6 Terra

相关提示词

官方OpenAI Developers

GPT-5.6 Terra API 模型参数与工具配置

官方OpenAI 官方发布2026-07-09

GPT-5.6 Terra 前端交互原型提示词与验证工作流

媒体DataCamp2026-08-04

GPT-5.6 Terra 长上下文成本阈值与路由工作流

社区X2026-08-01

Framer Agent 用 GPT-5.6 Terra 生成入场动画与布局变体