Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体GPT-6 Astra

GPT-6 Astra:Artificial Analysis 六档推理智能、速度与成本对照

原始来源

Artificial Analysis

作者Artificial Analysis

原文日期2026-09

Tabbit 整理2026-09-08

查看原文

一句话结论

Artificial Analysis 的同页六档对照显示,Astra Max 智能指数最高但单任务成本也最高,Low 的首 token 延迟和成本最低,适合按任务价值分层路由而非统一使用最高档。

适用场景

  • 适合的任务:在 Astra 的 Low、Medium、High、XHigh、Max 和该站标记的 Non-reasoning 变体之间做初步路由,比较综合智能、生成速度和每任务成本。

  • 不适合的任务:用综合指数代替特定代码库、浏览器、法律或医疗任务的验收;页面数据也不等同于 SLA。

  • 适用的模型版本:Artificial Analysis 页面在 2026-09-08 展示的 GPT-6 Astra 六个测试配置。

  • 适用的客户端、Agent 或 API:页面称速度取第一方 API;具体请求参数、重复次数和模型快照需结合其方法页进一步核对。

  • 推荐的推理档位和参数:低风险、低延迟或成本敏感任务先测 Low;需要更高综合分时测试 High/Max,并用任务级成功率判断额外成本是否值得。

测试环境、输入与配置

  • Intelligence Index v4.3 组合 10 项评测:AA-Briefcase、GDPval-AA v2、AutomationBench-AA、Terminal-Bench v4.0、SciCode、Humanity's Last Exam、GDP.pdf、CritPt、AA-Omniscience、AA-LCR v1.1。

  • 每任务成本是加权平均:各评测的输入、缓存命中、缓存写入、推理和答案 token 价格除以任务数,再按 Intelligence Index 权重汇总。

  • 输出速度定义为收到首个 API chunk 后的生成 tokens/s;第一方模型使用第一方 API 表现。

  • 页面没有在可见正文中提供每道输入、随机种子、重复次数、置信区间或失败日志。

原始数据

Astra 配置Intelligence Index v4.3输出速度每 Intelligence Index 任务成本
Max5361 tokens/s$3.26
XHigh5357 tokens/s$2.31
High5157 tokens/s$1.72
Medium5055 tokens/s$1.54
Low4653 tokens/s$0.82
Non-reasoning(页面标签)45未显示$1.71

页面同时显示:Low 的 time to first answer token 最低,为 2.55 秒;六档每任务成本相差最多约 4 倍。进一步信息表中六档上下文均为 1M,列出的综合 token 价格字段均为 $7.7,不能把该字段与上表的“每评测任务成本”混为一谈。

作为同站同版本的相邻发布对照,页面列出 GPT-5.6 Sol 最高 Intelligence 为 47、Terra 为 42、Luna 为 38;这些是各发布系列的最高值,不是相同 effort 的逐档对照。

结论与适用边界

Max 相对 High 增加 2 分但每任务成本从 $1.72 升到 $3.26;XHigh 与 Max 在采集快照中同为 53 分,但 XHigh 的速度和成本更低。这个结果支持先用 High 或 XHigh 做候选,再对最难任务验证 Max,而不是默认最高档。

页面把一个配置标为 Non-reasoning,但 OpenAI 官方模型指南在同一采集日明确说 GPT-6 Astra 不支持 none reasoning effort。两者的标签或测试路径可能不同;在 Artificial Analysis 未公开该标签的精确 API 请求前,不应据此向 OpenAI API 发送 none。

这是动态榜单快照。采集过程中搜索缓存曾显示与当前页面不同的分数,最终以直接打开原始页面后可见的 2026-09-08 数据为准。后续复核必须记录采集日期和 Index 版本。

复现步骤

  1. 锁定 Intelligence Index v4.3、10 项组成评测、题集版本、权重和评分脚本。

  2. 固定 OpenAI 模型快照、请求端点、reasoning effort、上下文、缓存策略、最大输出和重试规则。

  3. 对每档运行同一题集并保存逐题输入、输出、评分、输入/缓存写入/缓存读取/推理/答案 token、首 token 延迟和生成速度。

  4. 按页面公开的加权公式重算每任务成本,并报告重复次数、均值、离散程度和失败率。

  5. 在目标业务任务上补充成功率和人工验收时间,因为综合指数相近不代表生产工作流成本相同。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-6 Astra

在 Tabbit 中使用并对比模型

GPT-6 Astra

相关测评

官方OpenAI 官方发布页

GPT-6 Astra:OpenAI 官方发布页的五项基准与 GPT-5.6 Sol 对照

官方Reddit(r/codex)与 OpenAI Codex GitHub issue 评论2026-09-08

GPT-6 Astra:子代理 30 秒轮询造成额度消耗的可复现遥测

媒体CodeRabbit Blog2026-09-04

GPT-6 Astra:CodeRabbit 代码审查中的跨文件缺陷与成本评测

社区Reddit(r/codex)2026-09-08

GPT-6 Astra:100K+ LOC 长任务、推理档位与 Fast 模式现场报告

GPT-6 Astra

相关提示词

官方OpenAI Developers

OpenAI GPT-6 Astra 提示词与配置指南

官方OpenAI Developers

OpenAI GPT-6 Astra API 模型配置与成本边界

社区X2026-09-05

GPT-6 Astra:Skills 与 AGENTS.md 指令清理指南

社区Reddit(r/codex)2026-09-05

GPT-6 Astra:Codex 仓库指令审计完整提示词