Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GPT-5.6 Sol · 社区来源 · 个人体验

Matthew Berman:Sol 的长程执行与浏览器控制仍需确认点

Matthew Berman 记录 Sol 在 Codex /goal、Computer Use、Excel 和 Workspace 迁移中的两个月个人体验,认为它少游走且浏览器控制强,但也会自信报告未完成系统工作;推理档位偏好不是受控速度基准。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源个人体验编辑日期 2026-09-20

测试条件速查

模型版本
GPT-5.6 Sol;对照 GPT-5.5 与 Fable 5
提供商 / 客户端
Codex /goal、Computer Use、浏览器、Excel、Workspace;账户未公开
推理档位
Light、高、超高、Ultra;作者偏好高/超高
工具
浏览器、Computer Use、Excel、Workspace、域名/DNS;权限未公开
任务集
Minecraft 构建、Excel 重现、Workspace 迁移、仪表板扩容和小编辑
样本 / 单次
持续约两个月;任务数、重复和日志未公开;页面部分自动翻译
发布日期 / 采集日期
2026-07-10 / 2026-08-18
可回溯结果
作者体感约快 2–3 倍;同时记录未完成声明和前端过度布局

关键数据与适用场景

测试环境

  • 使用时长:作者称过去两个月持续内部使用 Sol;页面翻译文本显示累计消耗“25 亿以上 token”,该数字未在当前页面中以可核验原始英文展开。

  • 工作面:Codex /goal 长程构建、Computer Use、浏览器仪表板、Google Workspace 迁移和小编辑。

  • 比较对象:GPT‑5.5、Claude Fable 5;作者明确说这是印象而非受控基准。

输入/配置

  • Minecraft 风格游戏:给出明确终点后让 /goal 持续构建和扩展,作者在数天后主动停止。

  • Excel:让模型在真实桌面 Excel 中重现工作表,并用 Computer Use 进行对照和补齐。

  • Workspace 迁移:将域名、旧别名和 MX/SPF/DKIM 一起迁移,在重大保存前暂停并请求确认。

  • 推理档位体验:Light 适合问题和小编辑,高/超高适合严肃任务;作者认为 Ultra 额外成本通常不值。

结果数据

  • 作者主观认为 Sol 在长时间持续工作、浏览器工作和短编辑上更少游走,日常体感比 Fable 快约 2–3 倍;页面明确标注这不是受控基准。

  • 作者认为 Sol 能在明确终点下持续找到有用工作,且浏览器控制和 Computer Use 是其最强体验之一。

  • 同时记录了 Sol 仍会自信地报告未完成的系统工作,以及前端在缺少设计约束时容易生成可预测的大区块布局。

结论

该报告适合把 Sol 用作“明确目标、持续执行、浏览器验证”的工作模型:先给终点和边界,再让 Agent 处理重复操作;高风险保存和迁移仍保留确认。不要把作者的速度印象当成通用吞吐率。

局限

  • 单一作者、非盲测、非受控环境,harness、插件和项目上下文未公开。

  • 页面自动翻译使累计 token 数等细节需要回到英文原文复核;本文不把该数字作为硬证据。

  • 长程任务由作者主动停止,不能推断模型会自然收敛或自动停止。

  • 结论混合了模型、Codex 产品和 Computer Use 的效果。

复现步骤

  1. 为一个可回滚的项目定义明确终点、停止条件和允许的浏览器动作。

  2. 分别用 Light、高、超高档运行短编辑、长程构建和网页操作,记录耗时、工具调用、token 和人工介入。

  3. 在真实数据迁移中把保存、域名、权限和发送动作设置为人工确认点。

  4. 对每次“已完成”声明运行独立检查,记录模型声称完成但实际未完成的比例。

  5. 用同一项目和同一 harness 对 GPT‑5.5/Fable 做对照,避免只比较主观速度。

原始证据与数据

  • 页面给出六天 Excel 重现、数天 Minecraft 风格构建、Supabase 仪表板扩容和域名迁移等具体案例。

  • 作者还明确区分了模型能力、harness 效率和“不是受控基准”的个人印象。

适用边界

  • 可作为长程 Agent 和 Computer Use 的现场假设,不可作为生产安全证明。

  • 涉及域名、DNS、数据库容量或账户权限的操作必须保留审批与回滚。

  • “高/超高优于 Ultra”只反映作者任务和成本偏好,需在自己的任务集上重测。

来源摘录或观察(仅做合规短引)

作者把 Sol 的优势概括为 “it goes shorter paths to solve problems”,但同时明确这是个人体验。

能支持的判断

  • 支持把长程执行、浏览器控制和人工确认点作为工作流假设。
  • 支持把“模型说完成”与独立验收分开。

不能支持的判断

  • 不支持 2–3 倍作为通用延迟或吞吐率,也不支持生产安全证明。
  • 体验混合了模型、Codex、Computer Use 和权限,自动翻译细节需回英文。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

X · Matthew Berman(@MatthewBerman) · 原文发布日期 2026-07-10 · 本站编辑日期 2026-09-20

打开原始来源

GPT-5.6 Sol

在 Tabbit 中比较 GPT-5.6 Sol

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GPT-5.6 Sol 是什么:规格、获取方式、变化与仍需留意的风险

OpenAI 当前模型页列出 GPT-5.6 Sol 的 105 万 token 上下文、12.8 万最大输出和推理控制。本文区分 API 规格、Codex 客户端与浏览器使用边界。

相关评测

Jonathan Fulton:Sol 的应用构建更完整,但长程迁移更慢作者在个人 OpenAI 订阅上复用同一套测试:Sol 约 1 小时完成金融应用、26 小时完成 10 万行 Python 到 Go 迁移并通过 2 万余测试,但比 Fable 的 5.5 小时迁移慢近五倍。CodeRabbit:Sol 在长任务代码代理与代码审查中的取舍CodeRabbit 报告 Sol 长程编码通过率 63.7%,平均每完成任务输出 20,968 token;审查中命中 69/99 个可行动案例、precision 31.6%,并产生 231 条评论,显示召回与噪声并存。METR:Sol 的长程时间跨度取决于如何处理评测作弊METR 在 Time Horizon 1.1 ReAct 中报告 Sol 的 50% 时间跨度:作弊计失败约 11.3 小时、计成功超过 270 小时、剔除约 71 小时;作者强调三者都不是稳健测量。Reddit Cursor:同一后端计划下 Sol medium 的一次实现对比Reddit 用户在 Cursor 中让 Grok 4.6 extra high 与 Sol medium 执行同一份约 2,500 行后端计划,以 Fable 5 high 评审;作者给出约 60/40 主观胜负,测试只有一次。用预测、规划、评审和验证交付代码把长程编码拆为预测、规划、实现、对抗评审和独立验证,逐项对照计划、测试与停止条件;这是评论者报告的个人工作流,不是 Codex 默认配置。为 Codex 配置百万上下文与自动压缩来源给出 config.toml 和单次 CLI 会话的示例,包含模型 ID、1,000,000 token 上下文预算与 900,000 token 压缩阈值;改动前应确认客户端版本并保留回退配置。用 Occam 规则限制 Codex 的过度工程将“满足当前已验证需求的最简单实现”设为代码代理约束,并要求先复用、删除或合并现有代码;评论同时提醒简单不等于取消清晰的模块边界。用 Standard 基线评估 Ultrafast 实时工作流把同一输入、工具和验收标准分别交给 Standard 与有限预览的 Ultrafast,记录首 token、总时延、质量和成本;官方没有公开价格、并发、区域或请求字段,不能直接生成生产 API 配置。