GPT-5.6 Sol

GPT-5.6 Sol 模型测评导航

汇总 GPT-5.6 Sol 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。

17 条已核对来源的资料官方 · 媒体 · 社区

官方

2 条已核对来源的资料

媒体

6 条已核对来源的资料
媒体Artificial Analysis

GPT-5.6 benchmarks across Intelligence, Speed and Cost

第三方基准记录了 GPT-5.6 Sol 在 Intelligence Index 和 Coding Agent Index 中的表现,并将分数、每任务成本和延迟与 Claude Fable 5 等模型对比。

媒体CodeRabbit

OpenAI GPT-5.6 Sol and Terra: Benchmark

CodeRabbit 以代码代理和代码审查为重点,评估 Sol 的长任务跟进能力、代码审查发现能力、成本,以及与 Claude Fable 5、Sonnet 5 的差异。

媒体Visual Studio Magazine

GPT-5.6 Sol Ascends for Token Efficiency; How Does It Stack Up Against Other Models?

文章从 ChatGPT Plus/Pro 的实际使用和 Artificial Analysis 数据出发,讨论 Sol 的 Token 效率、快速与深度回答模式,以及它并非在所有评测中都领先。

媒体Every

Vibe Check: GPT-5.6 Sol Is Our Favorite Model to Collaborate With

Every 的长期协作体验记录,重点观察 Sol 在邮件、会议、营销内容、资料检索、持续任务和方向切换中的表现,并与 Fable 5 的委派式工作方式比较。

媒体Medium

A Short Review of GPT 5.6 Sol. Nearly as capable as Claude Fable 5…

作者沿用评测 Fable 5 时的提示词、方法和 10 万行代码迁移任务,记录 Sol 在金融规划应用、浏览器测试、用户体验和领域决策上的表现。

媒体METR

METR:GPT‑5.6 Sol 预部署独立评估与作弊率边界

模型与接口:OpenAI 提供 GPT‑5.6 Sol 最终 checkpoint、railfree 版本和 raw chain-of-thought API。 评测套件:METR Time Horizon 1.1 软件任务;另提供 Codex harness setup guide。

社区

9 条已核对来源的资料
社区Reddit r/cursor

I compared grok 4.6 and gpt 5.6 sol

同一后端方案和起点下,在 Cursor 中比较 Grok 4.6 extra high 与 GPT-5.6 Sol medium;发帖者认为 Sol 在资金边界、竞态风险和测试质量上更好,并给出约 60/40 的结果。

社区Reddit r/WritingWithAI

GPT-5.6 Sol is the first AI that has actually felt useful to me as a screenwriter

编剧用户分享 Sol 在剧本二稿中的逐行讨论、人物心理、潜台词、节奏和伏笔检查体验,强调它会质疑削弱场景的选择,而不是一味附和。

社区X

ITSMBench Results for Lynkr

Lynkr 公布通过 pi 调用 GPT-5.6 Sol 的 ITSMBench 结果:89 个企业 IT 服务台任务、Pass@1/Pass@2、成本、缓存命中率和按任务族拆分的数据,并讨论二值评分的局限。

社区X

GLM 5.3 just outplayed GPT-5.6 Sol at its own game — for 20× less.

同一 /design 提示下比较 GLM 5.3、GPT-5.6 Sol 和 Opus 5 的可玩浏览器游戏结果;Sol 的界面不错但游戏不可玩,成本高于另外两者。

社区X(Box)

Box Complex Work Eval:GPT‑5.6 Sol 的企业文档定量任务

基准:Box Complex Work Eval,覆盖十二个行业的真实文档驱动任务。 任务类型:读取源文档、核对数字、尽调、发现专家输出错误和定量分析。 比较:GPT‑5.6 Sol、Terra、Luna 与 GPT‑5.5;页面没有公开完整样本数或 harness 版本。

社区X

Nate Herk:GPT‑5.6 Sol 与 Fable 5 的盲测创意构建及成本比较

Agent 构建:相同 /goal 提示、给予完全创作自由;Fable 在 Claude Code,Sol 在 Codex;作者先盲看结果再揭晓模型。 三项构建:可玩自行车游戏、互动滚动网站、五个完全不同的视觉对象。 API 回合:无 Agent 循环的快速、无状态任务,比较返回率、能力分数、速度和成本。

社区X

Matthew Berman:GPT‑5.6 Sol 的长程 Goal、浏览器和推理档位体验

使用时长:作者称过去两个月持续内部使用 Sol;页面翻译文本显示累计消耗“25 亿以上 token”,该数字未在当前页面中以可核验原始英文展开。 工作面:Codex /goal 长程构建、Computer Use、浏览器仪表板、Google Workspace 迁移和小编辑。

社区X

SlopCodeBench:Fable 5、GPT‑5.6 Sol 与 Kimi K3 的长程编码复现实验

基准:SlopCodeBench,任务不会一次性公开全部需求,而是在多个 checkpoint 逐步追加要求,测试代码库随时间退化的风险。 规模:6 个 challenge、30 个 checkpoint,每个 checkpoint 使用新上下文;四个模型各跑一次。

社区Reddit r/codex

Reddit Codex Pro 20x:GPT‑5.6 Sol Standard 模式额度测量

账户:一个 Codex Pro 20x 账户,仅使用 GPT‑5.6 Sol Standard。 计量:作者用自己用 Codex 写的 CLI 统计本地 token,并与修正版 ccusage 交叉核对,两者结果一致。 窗口:一次 banked reset 和约三小时后的一次 global reset,分两个独立额度周期记录。

GPT-5.6 Sol

在 Tabbit 中使用并对比模型

汇总 GPT-5.6 Sol 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。