Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
官方GPT-6 Astra

GPT-6 Astra:OpenAI 官方发布页的五项基准与 GPT-5.6 Sol 对照

原始来源

OpenAI 官方发布页

作者OpenAI

Tabbit 整理2026-09-08

查看原文

一句话结论

OpenAI 官方表格显示 Astra 在所选的电脑使用、专业工作、代码和科学基准上普遍高于 GPT-5.6 Sol,但结果依赖具体 harness、工具、成本档位和数据版本,不能脱离脚注横向解读。

适用场景

  • 适合的任务:需要电脑操作、专业软件、多步终端工程、CAD 生成或研究级科学推理的模型初筛。

  • 不适合的任务:把官方 benchmark 当作独立验收、生产成功率或任意任务的成本预测。

  • 适用的模型版本:GPT-6 Astra 与 GPT-5.6 Sol;表中部分对照还包括其他模型。

  • 适用的客户端、Agent 或 API:OpenAI 发布页所述评测设置;OSWorld 使用 latency simulation,Terminal-Bench 使用 agent/terminal harness,BenchCAD 明确为 with tools。

  • 推荐的推理档位和参数:页面没有为所有项目公开统一 effort、随机种子或完整 API 参数;复现时必须逐项对齐官方脚注和模型配置。

测试环境、输入/配置

  • Agents’ Last Exam:真实软件中的复杂专业任务,页面正文给出 Astra 59.3%、GPT-5.6 Sol 53.6%。最高分设置下,Astra 比 Opus 5 少约 65% 输出 token。

  • OSWorld 2.0:表格标注版本 v2026.08.08、offline set、partial score;延迟模拟中 Astra 72.6%(约 40 分钟/任务),Sol 65.7%(约 75 分钟/任务)。

  • BenchCAD:使用工具从多视角渲染重建 3D 对象并生成 CAD 代码;几何重叠分数 Astra 95.9%、Sol 83.3%。页面称所示配置下 Astra 估计 API 成本比 Sol 低约 43%。

  • Terminal-Bench 4.0:覆盖软件工程、系统配置和数据分析的复杂终端任务;表格 Astra 57.9%、Sol 37.3%,页面称每任务估计 API 成本低约 9%。

  • GPQA Diamond:研究生级生物、化学和物理科学推理;高分设置 Astra 96.0%。低成本设置 Astra 94.9%,高于 Sol 最佳 94.6%,且估计 API 成本低约 37%。

结果数据

基准(表格或正文对应设置)GPT-6 AstraGPT-5.6 Sol关键条件
Agents’ Last Exam59.3%53.6%最高分设置;专业软件任务
OSWorld 2.072.6%65.7%v2026.08.08、offline set、partial score;约 40 vs 75 分钟/任务
BenchCAD(with tools)95.9%83.3%几何重叠分数;估计 Astra 成本低约 43%
Terminal-Bench 4.057.9%37.3%复杂终端任务;估计 Astra 每任务成本低约 9%
GPQA Diamond96.0%94.6%高分设置;低成本设置为 Astra 94.9% vs Sol 94.6%

发布页开头的概述使用了另一项基准 Terminal-Bench Science 0.1:Astra 64.6% vs Fable 52.6%,低成本设置为 Astra 61.1% vs Sol 最佳 22.4%;这些数字不能替换另一项基准 Terminal-Bench 4.0 表格中的 57.9% vs 37.3%。读取时应保留项目名称、设置和表格精度。

结论与适用边界

官方证据支持 Astra 在这些公开比较中的强势定位,尤其是 BenchCAD、Terminal-Bench 4.0 和 Agents’ Last Exam。OSWorld 的比较同时包含耗时模拟,GPQA 还区分高分与低成本设置;因此“更高分”与“更快/更便宜”是不同维度。页面没有提供完整输入、随机种子、每题输出、失败日志和独立复现实验,且部分项目是内部任务或特定 harness。Cybersecurity 与 alignment 部分还明确提到是否启用 production safeguards 会改变结果,不能把无 safeguards 的安全评测数字当成普通产品体验。

复现步骤

  1. 逐项锁定 benchmark 数据版本、offline/online 集合、工具权限、harness、模型快照、effort、token 上限和成本计算规则。

  2. 先复现表格中的五项,单独记录分数、任务耗时、输入/输出/推理 token、工具步数和失败类型。

  3. 将高分设置与低成本设置分开跑,不能用一个设置的得分和另一个设置的价格作比较。

  4. 对 OSWorld 同时报告 pass/partial score 和每任务耗时;对 BenchCAD 报告几何重叠指标与工具调用。

  5. 对 GPT-5.6 Sol 复现时,明确使用表格中的版本和 harness;不要把正文 Terminal-Bench Science 0.1 的 Sol 数字与 Terminal-Bench 4.0 混列。

原始来源观察(短摘录)

页面明确把 OSWorld 数字标为 offline set, partial score,并将 Terminal-Bench Science 与 Terminal-Bench 4.0 分开。这个标注决定了不同段落的数字不能直接拼成一个总榜。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-6 Astra

在 Tabbit 中使用并对比模型

GPT-6 Astra

相关测评

官方Reddit(r/codex)与 OpenAI Codex GitHub issue 评论2026-09-08

GPT-6 Astra:子代理 30 秒轮询造成额度消耗的可复现遥测

媒体CodeRabbit Blog2026-09-04

GPT-6 Astra:CodeRabbit 代码审查中的跨文件缺陷与成本评测

社区Reddit(r/codex)2026-09-08

GPT-6 Astra:100K+ LOC 长任务、推理档位与 Fast 模式现场报告

媒体Artificial Analysis2026-09

GPT-6 Astra:Artificial Analysis 六档推理智能、速度与成本对照

GPT-6 Astra

相关提示词

官方OpenAI Developers

OpenAI GPT-6 Astra 提示词与配置指南

官方OpenAI Developers

OpenAI GPT-6 Astra API 模型配置与成本边界

社区X2026-09-05

GPT-6 Astra:Skills 与 AGENTS.md 指令清理指南

社区Reddit(r/codex)2026-09-05

GPT-6 Astra:Codex 仓库指令审计完整提示词