GPT-6 Astra 是 OpenAI 面向复杂推理、编程、浏览器、桌面软件、研究和文档创建的高端模型。直接结论是:当完成复杂任务比最低 token 价格更重要时值得测试;简单问题不应默认使用。
这篇文章的决策锚点来自 2026 年 9 月 3 日 OpenAI 发布页:在 OpenAI 的 OSWorld 2.0 延迟模拟中,Astra 得分 72.6%,每项任务约 40 分钟;GPT-5.6 Sol 得分 65.7%,约 75 分钟。模拟任务时间约少 47%,但这不是通用速度保证,工具、护栏、任务集和测试 harness 都属于结果的一部分。(OpenAI)
先看结论
API 模型 ID 是
gpt-6-astra,定位是复杂推理、编程、计算机操作、研究和文档创建。API 页面列出 1,050,000 token 上下文、128,000 token 最大输出、2026 年 4 月 30 日知识截止,以及 low、medium、high、xhigh、max 推理档位。
相比 GPT-5.6 Sol,公开变化最集中在计算机操作和长程执行;官方模拟不能替代你的仓库或浏览器任务复测。
标准 API 价格是每百万输入 10 美元、输出 50 美元,缓存另计;超过 272K 输入 token 会提高整次请求的费率。
ChatGPT、API、Azure、Bedrock、Codex 和浏览器选择器是不同入口,必须逐个确认。
独立评测和社区体验并不完全一致:工具密集任务的信号较强,但普通问答、成本、延迟和整体价值仍取决于条件。
GPT-6 Astra 规格速查
OpenAI API 模型页是限制与价格的首要来源。GPT-6 Astra 模型资源、提示词集合和评测集合补充来源边界,但都不能证明你的账号已获得 Astra。
| 项目 | 当前信息 | 决策含义 |
|---|---|---|
| 模型 ID | gpt-6-astra | API 和集成中固定准确 ID,不要只使用“GPT-6”家族名。 |
| 发布日期 | 2026-09-03 | 发布日期不等于当前账号已获得权限。 |
| 上下文/输出 | 1,050,000 / 128,000 token | API 上限,客户端或订阅可能更低。 |
| 知识截止 | 2026-04-30 | 后续事实需要搜索或提供来源。 |
| 推理档位 | low、medium、high、xhigh、max | 更高档位可能提高难题完成度,也会增加 token 和等待。 |
| 标准 API 费率 | 输入 $10、缓存输入 $1、缓存写入 $12.50、输出 $50/百万 token | 长提示、输出、缓存和重试都会改变任务成本。 |
| 大输入边界 | 超过 272K 输入 token,整次请求按更高费率计 | 一百万上下文不是一百万 token 预算。 |
| 获取入口 | ChatGPT Plus/Pro/Business/Enterprise、OpenAI API、Azure、Bedrock | 检查账号、组织、地区、provider 和计费路由。 |
OpenAI 还表示 Astra 达到其 Preparedness Framework 的网络安全 Critical 能力级别。安全说明同时介绍了更强的防护、监控、隔离和阻断评估。这个事实说明部署风险更高,不代表普通任务一定安全完成。
相比 GPT-5.6 Sol 变化了什么?
| 维度 | GPT-5.6 Sol | GPT-6 Astra | 选择含义 |
|---|---|---|---|
| 定位 | 通用前沿推理和编程 | 面向软件与计算机环境的复杂端到端工作 | 把多步骤、审查成本高的任务交给 Astra。 |
| 计算机操作 | 具备能力,但同一官方比较中的 OSWorld 得分较低 | 同一设置中 72.6%,Sol 为 65.7% | 这是任务和 harness 信号,要在自己的流程复测。 |
| 模拟时间 | 约 75 分钟 | 约 40 分钟 | 47% 差异是研究假设,不是延迟 SLA。 |
| 长上下文 | 取决于产品和路由 | API 为 1.05M,上限输出 128K | 大上下文保留连续性,也可能增加成本。 |
| 推理 | 检查具体入口 | API 提供 low 到 max | 先比较档位,不要默认 max。 |
| 价格 | 对照路由更低 | 标准输入/输出 $10/$50 | 只有少重试和少审查时,才可能抵消价格。 |
为什么 ARC-AGI-3 分数必须带 harness
OpenAI 强调 ARC-AGI-3 的 99.9%。独立分析记录了标准 provider-neutral harness 的 62.7%,以及使用保留隐藏推理状态和长对话压缩的 OpenAI provider adapter 得到的 99.9%。两者可以同时成立,因为测的是不同系统。Joween Flores 评测和 Agent.Space 分析都提醒,prompt、工具、记忆、重试、推理和评估器会改变结果。
如何获取
API:在支持的 Responses API 请求中设置
model: "gpt-6-astra",确认组织资格、计费、地区、工具和数据策略。ChatGPT:OpenAI 表示 Plus、Pro、Business、Enterprise 正在逐步开放。计划名称不等于当前模式已显示 Astra,先检查实时选择器。
Codex:客户端理解模型与账号获得权限是两件事。不要只修改本地模型名,就假设权限已开通。
Azure 与 AWS Bedrock:两者的模型 ID、地区、配额、安全控制和数据政策分别核对。
企业:管理员可能需要启用,并确认工作区、日志、保留、工具权限和 fallback 策略。
身份与场景自检
| 你的情况 | 当前判断 | 现在做什么 |
|---|---|---|
| 我在做 API 产品 | 模型 ID 和费率公开,但组织权限和限额按账号变化 | 用脱敏 smoke test 记录 ID、effort、工具、token、重试和真实计费路由。 |
| 我使用 ChatGPT 或 Codex | rollout 与 API 分开,客户端目录也不保证选择器可见 | 在准确的产品和工作区检查选择器,记录日期和模式。 |
| 我管理团队 | Enterprise 入口和安全控制公开,但管理员决定实际边界 | 确认启用、地区、日志、保留、工具和 fallback。 |
| 我需要浏览器或桌面操作 | 公开优势集中在工具任务,不保证每个浏览器流程 | 用可回滚任务和明确验收,再保留人工复核。 |
| 我主要问简单问题 | 高 token 价格和推理成本未必划算 | 保留低成本默认模型,只把难题路由给 Astra。 |
社区实际怎么说
社区反馈只能说明用户遇到什么,不能证明模型级成功率。Hacker News 用户 kingkongjaffa 说,在相同 effort 下,用同一研究提示比较 Sol 和 Astra 时,Astra 找到的网页来源数量约为 3–5 倍;但没有公开查询集、质量评分和重复次数。(原评论)
另一位用户 Skiffssh 认为 Astra 的 3D 建模“非常好”,但仍准备暂时使用 Claude。这说明单个创意工作流的惊艳表现,不等于所有工具链都应替换。(原评论)
反面体验同样具体:kbrannigan 认为 Astra“非常贵”,15 条消息就消耗了五小时额度;zof3 形容它一开始“过于对齐”、解释偏法律化。两条反馈都没有计划、token 日志或受控任务,只能作为风险假设。(HN 讨论)
Reddit 用户 u/Synstar_Joey 分享了一次 Codex Desktop Python API client 任务:33 分 29 秒、13 次尝试、约 328K 输入 token、成功请求成本约 0.57 美元,并通过编译检查;同时有请求首 token 超过一分钟和超时。这个结果支持“单一路由可完成且成本可测”,不支持通用价格或延迟保证。(原帖)
另一条 Reddit 讨论质疑 Artificial Analysis 分数与单位成本,但没有共享任务、effort 或账单。它证明公众存在分歧,不证明 Astra 在受控编码测试中必然落败。(原讨论)
浏览器层面的第三条路:Tabbit Browser
有些 Astra 任务从实时网页、标签组、截图或本地文档开始,而不是空 API 请求。这时 Tabbit Browser可以作为第三条路:当账号开放相应模型时,在浏览器上下文附近选择模型。它不是 OpenAI API 计费层,也不是 Astra 资格保证。AI 浏览器指南和 Agent 浏览器概览介绍了周边流程;需要改变网页状态时,先看浏览器自动化指南。
本文没有进行 Tabbit 账号级 Astra 测试。使用前打开实时选择器,确认模型标签,用公开或脱敏材料做可回滚小任务,并保留人工复核;也可先了解什么是 Agent 浏览器。
该按钮下载 Tabbit Browser,不会下载 GPT-6 Astra、提供 OpenAI API 额度或绕过 rollout。浏览器选择应与 Tabbit 定价页和 API 账单分开判断。
依赖前要确认的未知风险
Harness 风险:ARC-AGI-3 的差距说明 provider 状态和压缩策略非常重要。
成本风险:max、长输出、重试和超过 272K 的输入都会快速推高账单。
访问风险:ChatGPT、Codex、API、Azure、Bedrock 和 Tabbit 的 rollout 规则不同。
安全与授权风险:网络安全能力更强不等于允许执行破坏性动作。
信息风险:API 知识截止为 2026-04-30,之后的事实需要搜索。
Verdict
GPT-6 Astra 值得作为跨代码、浏览器、桌面软件和长程工具循环的候选执行器。47% 的 OSWorld 模拟时间差是值得复测的信号,但不是把所有请求切到 Astra 的理由。独立分数并不统一,最高分依赖专门 harness,早期用户同时报告了高完成度、昂贵、慢和过度谨慎。
当任务有明确终点、失败或审查成本高时测试 Astra;日常工作保留 GPT-5.6 Sol 或其他低成本模型。浏览器任务先检查 Tabbit 实时选择器;API 任务固定模型 ID、effort、provider、工具、token 预算和计费路由。四件套中的评测、定价和替代品文章尚未发布,在此之前以 GPT-6 Astra 模型资源和上方官方链接为准。
常见问题
GPT-6 Astra 是什么?
GPT-6 Astra 是 OpenAI 面向复杂推理、编程、计算机操作、研究和文档创建的高端模型。API 模型 ID 是 gpt-6-astra,但 API、ChatGPT、Codex、Azure 和 Bedrock 的获取资格分别判断。
GPT-6 Astra 相比 GPT-5.6 Sol 变化了什么?
OpenAI 报告它在计算机操作、软件工程、浏览器工作和长程专业任务上更强。API 页面列出 1,050,000 token 上下文和 low 到 max 的推理档位,但更高推理也可能带来更高成本和等待时间。
GPT-6 Astra 的上下文和输出限制是多少?
OpenAI API 模型页列出 1,050,000 token 上下文窗口和 128,000 token 最大输出。这是 API 规格,不代表 ChatGPT、Codex、Azure、Bedrock 或浏览器产品一定开放相同上限。
GPT-6 Astra 怎么收费?
2026 年 9 月 20 日核对的标准 API 价格是每百万输入 token 10 美元、缓存输入 1 美元、缓存写入 12.50 美元、输出 50 美元。超过 272K 输入 token 的请求按更高费率计算整次请求;订阅和浏览器费用另算。
在哪里可以使用 GPT-6 Astra?
OpenAI 表示 Astra 正逐步开放给 ChatGPT Plus、Pro、Business 和 Enterprise 用户,并通过 OpenAI API、Microsoft Azure 和 AWS Bedrock 提供。组织权限、地区和具体产品的开放时间可能不同。
我能在 Tabbit Browser 使用 GPT-6 Astra 吗?
本文没有进行 Tabbit 账号级 Astra 测试,因此不宣称已可用。打开 Tabbit Browser 检查实时模型选择器,确认具体模型后再规划任务;只有该路由确实出现时,才把页面、标签组、截图或本地文件交给它。