OpenAI 官方表格显示 Astra 在所选的电脑使用、专业工作、代码和科学基准上普遍高于 GPT-5.6 Sol,但结果依赖具体 harness、工具、成本档位和数据版本,不能脱离脚注横向解读。
适合的任务:需要电脑操作、专业软件、多步终端工程、CAD 生成或研究级科学推理的模型初筛。
不适合的任务:把官方 benchmark 当作独立验收、生产成功率或任意任务的成本预测。
适用的模型版本:GPT-6 Astra 与 GPT-5.6 Sol;表中部分对照还包括其他模型。
适用的客户端、Agent 或 API:OpenAI 发布页所述评测设置;OSWorld 使用 latency simulation,Terminal-Bench 使用 agent/terminal harness,BenchCAD 明确为 with tools。
推荐的推理档位和参数:页面没有为所有项目公开统一 effort、随机种子或完整 API 参数;复现时必须逐项对齐官方脚注和模型配置。
Agents’ Last Exam:真实软件中的复杂专业任务,页面正文给出 Astra 59.3%、GPT-5.6 Sol 53.6%。最高分设置下,Astra 比 Opus 5 少约 65% 输出 token。
OSWorld 2.0:表格标注版本 v2026.08.08、offline set、partial score;延迟模拟中 Astra 72.6%(约 40 分钟/任务),Sol 65.7%(约 75 分钟/任务)。
BenchCAD:使用工具从多视角渲染重建 3D 对象并生成 CAD 代码;几何重叠分数 Astra 95.9%、Sol 83.3%。页面称所示配置下 Astra 估计 API 成本比 Sol 低约 43%。
Terminal-Bench 4.0:覆盖软件工程、系统配置和数据分析的复杂终端任务;表格 Astra 57.9%、Sol 37.3%,页面称每任务估计 API 成本低约 9%。
GPQA Diamond:研究生级生物、化学和物理科学推理;高分设置 Astra 96.0%。低成本设置 Astra 94.9%,高于 Sol 最佳 94.6%,且估计 API 成本低约 37%。
| 基准(表格或正文对应设置) | GPT-6 Astra | GPT-5.6 Sol | 关键条件 |
|---|---|---|---|
| Agents’ Last Exam | 59.3% | 53.6% | 最高分设置;专业软件任务 |
| OSWorld 2.0 | 72.6% | 65.7% | v2026.08.08、offline set、partial score;约 40 vs 75 分钟/任务 |
| BenchCAD(with tools) | 95.9% | 83.3% | 几何重叠分数;估计 Astra 成本低约 43% |
| Terminal-Bench 4.0 | 57.9% | 37.3% | 复杂终端任务;估计 Astra 每任务成本低约 9% |
| GPQA Diamond | 96.0% | 94.6% | 高分设置;低成本设置为 Astra 94.9% vs Sol 94.6% |
发布页开头的概述使用了另一项基准 Terminal-Bench Science 0.1:Astra 64.6% vs Fable 52.6%,低成本设置为 Astra 61.1% vs Sol 最佳 22.4%;这些数字不能替换另一项基准 Terminal-Bench 4.0 表格中的 57.9% vs 37.3%。读取时应保留项目名称、设置和表格精度。
官方证据支持 Astra 在这些公开比较中的强势定位,尤其是 BenchCAD、Terminal-Bench 4.0 和 Agents’ Last Exam。OSWorld 的比较同时包含耗时模拟,GPQA 还区分高分与低成本设置;因此“更高分”与“更快/更便宜”是不同维度。页面没有提供完整输入、随机种子、每题输出、失败日志和独立复现实验,且部分项目是内部任务或特定 harness。Cybersecurity 与 alignment 部分还明确提到是否启用 production safeguards 会改变结果,不能把无 safeguards 的安全评测数字当成普通产品体验。
逐项锁定 benchmark 数据版本、offline/online 集合、工具权限、harness、模型快照、effort、token 上限和成本计算规则。
先复现表格中的五项,单独记录分数、任务耗时、输入/输出/推理 token、工具步数和失败类型。
将高分设置与低成本设置分开跑,不能用一个设置的得分和另一个设置的价格作比较。
对 OSWorld 同时报告 pass/partial score 和每任务耗时;对 BenchCAD 报告几何重叠指标与工具调用。
对 GPT-5.6 Sol 复现时,明确使用表格中的版本和 harness;不要把正文 Terminal-Bench Science 0.1 的 Sol 数字与 Terminal-Bench 4.0 混列。
页面明确把 OSWorld 数字标为 offline set, partial score,并将 Terminal-Bench Science 与 Terminal-Bench 4.0 分开。这个标注决定了不同段落的数字不能直接拼成一个总榜。
GPT-6 Astra