Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
官方GPT-5.6 Terra

OpenAI 官方 GPT-5.6 Terra 基准、定价与任务边界

原始来源

OpenAI 官方发布页

作者OpenAI

原文日期2026-07-10

Tabbit 整理2026-08-20

查看原文

一句话结论

OpenAI 将 Terra 定位为日常工作的均衡层:官方表中它在编码、电脑使用、学术、工具使用和长上下文上明显强于 GPT-5.5 的若干项目,但这些数字是发布方结果,不能替代相同 harness 的独立复测。

测试环境

  • 模型/入口:GPT-5.6 Terra;OpenAI API、ChatGPT Work、Codex。页面同时比较 Sol、Luna、GPT-5.5 及其他模型。

  • 推理/配置:页面区分 max、ultra 等设置;Terra 表格没有逐项公开 prompt、temperature、工具权限和重复次数。

  • 价格:发布页列出 Terra 为输入 $2.50/1M tokens、输出 $15/1M tokens;页面更新说明 2026-07-30 将 Terra 价格下调 20%,X 官方更新帖进一步列出降价后的 API 价格为输入 $2、输出 $12。

  • 评测范围:Agents’ Last Exam、GDPval-AA v2、Artificial Analysis Intelligence/Coding Agent Index、SWE-Bench Pro、DeepSWE、Terminal-Bench 2.1、OSWorld 2.0、BrowseComp、GPQA Diamond、MRCR v2、Toolathlon 等。

输入/配置

发布页没有公开每个评测的完整输入、样本数、抽样方式、重复次数、temperature、工具定义或错误明细;因此下表是可核对的官方结果账本,不是完整可复现测试包。

结果数据

专业与编码

评测GPT-5.6 TerraGPT-5.5备注
Agents’ Last Exam50.4%46.9%55 个领域的长周期专业工作流;发布方结果
GDPval-AA v21,593 Elo1,493.7 EloElo,不是准确率
Artificial Analysis Intelligence Index v4.15554.8页面引用外部指数
Artificial Analysis Coding Agent Index v1.177.476.4页面引用外部指数
SWE-Bench Pro63.4%59.4%真实代码库工程基准
DeepSWE v1.169.6%67.0%长周期软件工程
Terminal-Bench 2.187.4%85.6%命令行工作流

电脑使用、学术、工具与长上下文

评测GPT-5.6 TerraGPT-5.5
OSWorld 2.050.2%47.5%
BrowseComp87.5%84.4%
GPQA Diamond92.9%93.6%
FrontierMath Tier 1–3 (v2)84.9%85.3%
AutomationBench15.2%12.9%
Toolathlon53.1%55.6%
OpenAI MRCR v2 8-needle 256K–512K89.6%81.5%
OpenAI MRCR v2 8-needle 512K–1M72.5%74.0%

其他边界信号

  • OSWorld 2.0 中,官方称 GPT-5.6 Sol 以 62.6% 超过 Opus 4.8,且输出 Token 减少 85%;Terra 的表格值为 50.2%,说明不能把 Sol 的宣传段落直接外推给 Terra。

  • Terra 在 SEC-Bench Pro 为 57.7%、ExploitBench 为 52.9%、ExploitGym 为 23.2%,显示网络安全能力较强但不应绕过访问控制或把结果当作安全授权。

  • Terra 的 OpenAI MRCR v2 256K–512K 为 89.6%,但在 512K–1M 为 72.5%;长上下文表现随区间变化,不能笼统称为“1M 上下文都可靠”。

  • 发布页提供一个可复制的 Work 提示示例:Create an interactive spirograph to explain how it works. 这是官方展示案例,不是 Terra 单独的 benchmark 输入。

结论

  • 较适合:日常编码、命令行工程、浏览/电脑操作、长上下文检索、常规工具编排和成本受控的 Agent 执行。

  • 需要升级/复核:最高难度架构规划、关键安全/财务决策、对 GPQA/FrontierMath Tier 4 等困难学术题要求极高的任务,以及需要完整视觉验收的复杂设计交付。

  • 模型选择:官方数据支持把 Terra 作为 GPT-5.5 以上的均衡候选,但是否优于更便宜的 Luna 或更强的 Sol,要结合任务成本、延迟和验收失败代价测量。

局限

  • 所有结果来自 OpenAI 发布页,部分列为外部指数,缺少公开 harness 与原始逐题输出。

  • 不同评测的工具、时间预算、提示和评分方式不同,不能跨表直接比较百分比。

  • 价格、模型 alias、可用入口会变化;本文只记录采集日可见页面。

受限来源记录

  • https://developers.openai.com/api/docs/models/gpt-5.6-terra 在 Tabbit 中返回 ERR_CONNECTION_CLOSED,未使用其搜索摘要或猜测内容补写本文。

  • 已请求用户接管 Tabbit 中该标签页核对;若恢复访问,应补录模型 ID、上下文上限和 API 参数,并与本页结果分开标注。

复现步骤

  1. 固定 Terra 的 API snapshot、推理档位、temperature、工具 schema、上下文长度和输出上限。

  2. 先复测 SWE-Bench/Terminal-Bench 类代码任务,再测 OSWorld/BrowseComp、GPQA、MRCR 长上下文任务。

  3. 为每项任务记录成功率、p50/p95 延迟、输入/输出 token、工具调用次数、费用和人工复核结果。

  4. 与 GPT-5.5、Luna、Sol 保持相同 harness 对照;报告逐题失败原因,不把官方表格当作自己的复现结果。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-5.6 Terra

在 Tabbit 中使用并对比模型

GPT-5.6 Terra

相关测评

官方OpenAI Deployment Safety Hub2026-07-09

GPT-5.6 Terra System Card 安全防护与 Agent 边界

官方SonarSource2026-08-06

GPT-5.6 Terra SonarSource 4,444 Java 任务代码质量与安全复测

媒体Artificial Analysis2026-07-09

GPT-5.6 Terra Artificial Analysis 智能、成本与编码 Agent 指数

社区Reddit r/LLMDevs2026-08-18

GPT-5.6 Terra Reddit LLMDevs 按角色小样本路由基准

GPT-5.6 Terra

相关提示词

官方OpenAI Developers

GPT-5.6 Terra API 模型参数与工具配置

官方OpenAI 官方发布2026-07-09

GPT-5.6 Terra 前端交互原型提示词与验证工作流

媒体DataCamp2026-08-04

GPT-5.6 Terra 长上下文成本阈值与路由工作流

社区X2026-08-01

Framer Agent 用 GPT-5.6 Terra 生成入场动画与布局变体