Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GPT-5.6 Sol · 社区来源 · 个人体验

Reddit Codex Pro 20x:一次 Sol Standard 额度与 API 等值记录

一位用户在单个 Pro 20x 账户上用 CLI 与修正版 ccusage 核对两个重置窗口:合计 42,559 credits、估算约 1,702 美元 Standard API 等值;这是订阅预算记录,不是模型质量或通用配额。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源个人体验编辑日期 2026-09-20

测试条件速查

模型版本
GPT-5.6 Sol Standard
提供商 / 客户端
一个 Codex Pro 20x 账户;本地 CLI 与 ccusage
推理档位
Standard
工具
作者 CLI 与修正版 ccusage;无固定质量任务
任务集
订阅 credits 计量,不是固定代码/知识任务
样本 / 单次
一次 banked reset 与一次 global reset,两个窗口、一个账户
发布日期 / 采集日期
约 2026-07-26 / 2026-08-18
可回溯结果
6,643 + 35,915 = 42,559 credits;约 $1,702 等值;约 25 credits/$1

关键数据与适用场景

测试环境

  • 账户:一个 Codex Pro 20x 账户,仅使用 GPT‑5.6 Sol Standard。

  • 计量:作者用自己用 Codex 写的 CLI 统计本地 token,并与修正版 ccusage 交叉核对,两者结果一致。

  • 窗口:一次 banked reset 和约三小时后的一次 global reset,分两个独立额度周期记录。

输入/配置

  • 文章测的是订阅额度和 Standard API 等价值,不是固定代码任务的模型质量。

  • 记录了 OpenAI 显示的使用百分比、credits、本地 token 计量和按官方费率折算的美元值。

  • 作者提醒 ccusage 旧版本存在约 20% 的高估问题,需使用修正版。

结果数据

  • Banked reset 后:6,643 credits(13%)。

  • Global reset 后:35,915 credits(67%)。

  • 两个窗口合计:42,559 credits,折算 Standard API 约 $1,702。

  • 由百分比外推,一周 Pro 20x 窗口约 52,000–56,000 credits,中值 53,600 credits,约等于 $2,144 Standard API 用量。

  • 观察到的折算关系约为 25 Codex credits = $1 Standard API usage;作者称与官方费率和百分比仪表盘在取整误差内一致。

  • 作者据此估计四个周窗口约 $8,300–$8,900,平均月份约 $9,000–$9,700。

结论

这是一份有本地计量和交叉核对的订阅额度记录,适合估算 Sol Standard 的消费预算;它不能说明 Sol 的任务成功率,也不能把一次账户、两次 reset 外推为所有 Pro 20x 用户的配额。

局限

  • 单账户、短观察期,且包含 banked/global reset,不能排除账户、时期或重置策略差异。

  • 没有固定任务集、输入 prompt、工具链、缓存命中率和每任务质量结果。

  • credits 到 API 美元的折算依赖产品内部计量规则;25:1 只由该报告观察,不是本文独立验证的官方承诺。

  • 文章评论区存在不同额度体验,进一步说明使用量受任务和 harness 影响。

复现步骤

  1. 只用一个明确订阅层级和一个模型档位,记录窗口开始时的 credits/百分比。

  2. 用 CLI 记录输入、输出、缓存 token,并用当前修正版 ccusage 独立复核。

  3. 分开记录普通、banked 和 global reset,不把多个窗口混成单次实验。

  4. 依据当日官方费率换算 API 等价值,同时保存原始计量和换算公式。

  5. 在多个账户和多个周窗口重复,报告中位数、范围和任务类型。

原始证据与数据

  • 主帖公开了两个窗口的 credits、使用百分比、总量、换算值和估算区间。

  • 作者公开说明交叉计量工具和旧版 ccusage 的高估问题,使该报告比单纯“额度很快用完”的感受更可核对。

适用边界

  • 适合做订阅预算、额度监控和复核工具的起点。

  • 不适合比较 Sol 与其他模型的智能、代码质量或长程 Agent 成功率。

  • 若产品计量、费率或套餐在之后变更,旧报告应重新采集。

来源摘录或观察(仅做合规短引)

作者把自己的方法概括为 “controlled test using only one Pro 20x account”。

能支持的判断

  • 支持把单账户 credits、重置窗口和 API 等值作为预算参考。
  • 支持保留原始 credits 与换算公式,避免 ccusage 版本误差。

不能支持的判断

  • 不支持所有 Pro 20x 用户的配额、费率或月度预测。
  • 25:1 是报告观察,不是官方承诺;配额、价格和可用性需重开。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Reddit r/codex · DaC2k26 · 原文发布日期 2026-07-26 · 本站编辑日期 2026-09-20

打开原始来源

GPT-5.6 Sol

在 Tabbit 中比较 GPT-5.6 Sol

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GPT-5.6 Sol 是什么:规格、获取方式、变化与仍需留意的风险

OpenAI 当前模型页列出 GPT-5.6 Sol 的 105 万 token 上下文、12.8 万最大输出和推理控制。本文区分 API 规格、Codex 客户端与浏览器使用边界。

相关评测

Lynkr ITSMBench:路由降低成本,但 Sol 的二值通过率仍有限Lynkr 通过 pi 路由 Sol 完成 89 个企业 IT 服务台任务:全套 Pass@1 为 31%,匹配方法为 35%/40% Pass@1/Pass@2,约 0.87–0.90 美元/任务,缓存命中率 92–95%;许多失败只差少量断言。Nate Herk:Sol 的创意构建成本较低,但 Fable 更常赢得盲选Nate Herk 用相同 /goal 比较 Codex 的 Sol 与 Claude Code 的 Fable:三项构建中 Sol 在约 7 分钟/$1 的视觉对象胜出,但自行车游戏和滚动网站选 Fable;API 小样本受拒答影响。OpenAI 发布说明:Sol 在长程工作、编程与知识任务中的官方结果OpenAI 报告 Sol 在 Agents’ Last Exam 得分 53.6、Artificial Analysis Intelligence Index 接近 Fable 5、Coding Agent Index 为 80,并给出 BrowseComp 92.2% 与 OSWorld 2.0 62.6%;这些是厂商自报且受基准条件限制。Artificial Analysis:Sol 的智能、编程 Agent 与单位任务成本Artificial Analysis 记录 Sol max 的 Intelligence Index 为 59、每任务约 1.04 美元、Coding Agent Index 为 80,并报告约 1.5 万输出 token/任务;模型与 Codex 等完整 harness 绑定,不能当作裸模型排名。用 Responses API 设计可复核的多代理工作流将判断任务与确定性处理分开,用程序化工具调用、并行子代理和提示缓存构建可记录成本、延迟与失败状态的长任务流程。为 Codex 配置百万上下文与自动压缩来源给出 config.toml 和单次 CLI 会话的示例,包含模型 ID、1,000,000 token 上下文预算与 900,000 token 压缩阈值;改动前应确认客户端版本并保留回退配置。用预测、规划、评审和验证交付代码把长程编码拆为预测、规划、实现、对抗评审和独立验证,逐项对照计划、测试与停止条件;这是评论者报告的个人工作流,不是 Codex 默认配置。用 Occam 规则限制 Codex 的过度工程将“满足当前已验证需求的最简单实现”设为代码代理约束,并要求先复用、删除或合并现有代码;评论同时提醒简单不等于取消清晰的模块边界。