Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GPT-5.6 Sol · 社区来源 · 个人体验

Nate Herk:Sol 的创意构建成本较低,但 Fable 更常赢得盲选

Nate Herk 用相同 /goal 比较 Codex 的 Sol 与 Claude Code 的 Fable:三项构建中 Sol 在约 7 分钟/$1 的视觉对象胜出,但自行车游戏和滚动网站选 Fable;API 小样本受拒答影响。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源个人体验编辑日期 2026-09-20

测试条件速查

模型版本
GPT-5.6 Sol;对照 Claude Fable 5
提供商 / 客户端
Sol 用 Codex;Fable 用 Claude Code
推理档位
未公开
工具
Agent /goal 构建与无状态 API 回合;权限未公开
任务集
自行车游戏、滚动网站、五个视觉对象及 API 回合
样本 / 单次
三项构建各一次;API 返回 Sol 24、Fable 3;作者盲选
发布日期 / 采集日期
2026-07-10 / 2026-08-18
可回溯结果
Sol:自行车约 23m/$4.50、网站约 7m/$1、视觉对象约 7m/$1;Fable 前两项、Sol 第三项

关键数据与适用场景

测试环境

  • Agent 构建:相同 /goal 提示、给予完全创作自由;Fable 在 Claude Code,Sol 在 Codex;作者先盲看结果再揭晓模型。

  • 三项构建:可玩自行车游戏、互动滚动网站、五个完全不同的视觉对象。

  • API 回合:无 Agent 循环的快速、无状态任务,比较返回率、能力分数、速度和成本。

输入/配置

  • 自行车游戏提示要求浏览器中的开放世界游戏、WASD 转向、空格跳跃、Q/E 空中特技、Shift 加速。

  • 网站提示要求制作“最令人印象深刻的互动滚动网站”。

  • 第三项只要求设计五个根本不同的视觉元素,并让模型返回 gallery 和五个 sister sites。

  • 这些构建使用不同 harness,因此结果比较的是完整工作配置,而非裸模型。

结果数据

任务Fable 5GPT‑5.6 Sol作者选择
自行车游戏21m37s,$14.22,约 90k 输出 token23m,$4.50,约 31kFable
互动滚动网站23m,$19.24,约 80k约 7m,约 $1,约 20kFable
五个视觉对象15m,约 $15,约 65k7m,约 $1,约 22kSol
  • API 快速任务的返回记录是 Sol 24、Fable 3;作者说明多数差异来自 Fable 拒绝回答。

  • 在实际返回的答案中,Sol 能力分数 0.98,Fable 0.966;该批次花费 Sol $16、Fable $63。

  • 作者的路由判断是 Fable 做经理/策略,Sol 做执行、验证和交付。

结论

在这组个人盲测中,Sol 的 token 和成本效率明显更好,且在“五个对象”这类开放任务中胜出;Fable 在创意构建的最终审美和完整度上更常被选中。这个结果支持“Fable 定方向、Sol 执行”的工作流假设,但不构成模型能力总排名。

局限

  • 三个构建各一次,主观选择和作者设计偏好会影响结果。

  • Codex 与 Claude Code 的工具链、默认提示和上下文管理不同,不能把成本差异全部归因于模型。

  • API 24–3 的差距被拒答混淆;0.98 与 0.966 也不是公开标准 benchmark。

  • 文章没有给出完整 API 输入、评分器、延迟分布或随机种子。

复现步骤

  1. 在两个隔离仓库中固定同一 commit、同一 /goal 文本和相同资产权限。

  2. 随机化模型运行顺序,清理 git 历史和缓存,避免第二个模型读取第一个模型的产物。

  3. 对每个构建记录完成时间、输入/输出 token、工具调用、可玩性和盲评结果。

  4. API 任务逐题记录“完成、拒答、错误、超时”,不要把拒答和能力失败混为一类。

  5. 至少重复多轮并报告均值、离散程度和 harness 差异。

原始证据与数据

  • 文章公开了三个构建的提示意图、耗时、成本和大致输出 token。

  • 作者明确说 Sol 约为 Fable 一半 token 成本,并把 Sol 与 Opus 4.8 的价格层级视为更接近的比较。

适用边界

  • 适合参考 Agent 构建的成本/质量权衡,不适合作为通用写作、数学或代码基准。

  • “Sol 是 worker”是作者的经验模型;在其他 harness、任务边界或设计标准下可能反转。

  • 涉及创意输出时,必须预先定义盲评 rubric,避免把个人审美写成客观胜负。

来源摘录或观察(仅做合规短引)

作者的核心路由比喻是 “Fable is the manager, Sol is the worker”。

能支持的判断

  • 支持分离完整 Agent 工作流的成本、速度和最终选择。
  • 支持“Fable 定方向、Sol 执行”的个人路由假设,但仅作条件化建议。

不能支持的判断

  • 不支持裸模型成本比较或创意总排名;两种 harness 不同。
  • 三次构建和 API 小样本不足以估计稳定胜率,拒答还改变了 API 样本。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

X · Nate Herk(@nateherk) · 原文发布日期 2026-07-10 · 本站编辑日期 2026-09-20

打开原始来源

GPT-5.6 Sol

在 Tabbit 中比较 GPT-5.6 Sol

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GPT-5.6 Sol 是什么:规格、获取方式、变化与仍需留意的风险

OpenAI 当前模型页列出 GPT-5.6 Sol 的 105 万 token 上下文、12.8 万最大输出和推理控制。本文区分 API 规格、Codex 客户端与浏览器使用边界。

相关评测

Lynkr ITSMBench:路由降低成本,但 Sol 的二值通过率仍有限Lynkr 通过 pi 路由 Sol 完成 89 个企业 IT 服务台任务:全套 Pass@1 为 31%,匹配方法为 35%/40% Pass@1/Pass@2,约 0.87–0.90 美元/任务,缓存命中率 92–95%;许多失败只差少量断言。X 单次视觉构建:Sol 界面较好,但本次游戏不可玩且更贵同一 /design 提示、一次尝试的 Command Code 对比中,Sol 花费 0.32 美元,界面不错但浏览器游戏不可玩;GLM 5.3 为 0.016 美元且可玩,Opus 5 为 0.37 美元且克隆完成度最高。OpenAI 发布说明:Sol 在长程工作、编程与知识任务中的官方结果OpenAI 报告 Sol 在 Agents’ Last Exam 得分 53.6、Artificial Analysis Intelligence Index 接近 Fable 5、Coding Agent Index 为 80,并给出 BrowseComp 92.2% 与 OSWorld 2.0 62.6%;这些是厂商自报且受基准条件限制。Artificial Analysis:Sol 的智能、编程 Agent 与单位任务成本Artificial Analysis 记录 Sol max 的 Intelligence Index 为 59、每任务约 1.04 美元、Coding Agent Index 为 80,并报告约 1.5 万输出 token/任务;模型与 Codex 等完整 harness 绑定,不能当作裸模型排名。为 Codex 配置百万上下文与自动压缩来源给出 config.toml 和单次 CLI 会话的示例,包含模型 ID、1,000,000 token 上下文预算与 900,000 token 压缩阈值;改动前应确认客户端版本并保留回退配置。用预测、规划、评审和验证交付代码把长程编码拆为预测、规划、实现、对抗评审和独立验证,逐项对照计划、测试与停止条件;这是评论者报告的个人工作流,不是 Codex 默认配置。用 Responses API 设计可复核的多代理工作流将判断任务与确定性处理分开,用程序化工具调用、并行子代理和提示缓存构建可记录成本、延迟与失败状态的长任务流程。用 Occam 规则限制 Codex 的过度工程将“满足当前已验证需求的最简单实现”设为代码代理约束,并要求先复用、删除或合并现有代码;评论同时提醒简单不等于取消清晰的模块边界。