GPT-5.6 Sol

GPT-5.6 Sol · 测评与证据

GPT-5.6 Sol,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

OpenAI 报告 Sol 在 Agents’ Last Exam 得分 53.6、Artificial Analysis Intelligence Index 接近 Fable 5、Coding Agent Index 为 80,并给出 BrowseComp 92.2% 与 OSWorld 2.0 62.6%;这些是厂商自报且受基准条件限制。

OpenAI · 查看证据

Artificial Analysis 记录 Sol max 的 Intelligence Index 为 59、每任务约 1.04 美元、Coding Agent Index 为 80,并报告约 1.5 万输出 token/任务;模型与 Codex 等完整 harness 绑定,不能当作裸模型排名。

Artificial Analysis · 查看证据

CodeRabbit 报告 Sol 长程编码通过率 63.7%,平均每完成任务输出 20,968 token;审查中命中 69/99 个可行动案例、precision 31.6%,并产生 231 条评论,显示召回与噪声并存。

CodeRabbit · 查看证据

完整测评与相关内容

模型深度阅读

总览 · 简体中文

GPT-5.6 Sol 是什么:规格、获取方式、变化与仍需留意的风险

OpenAI 当前模型页列出 GPT-5.6 Sol 的 105 万 token 上下文、12.8 万最大输出和推理控制。本文区分 API 规格、Codex 客户端与浏览器使用边界。

精选证据

官方厂商自报

OpenAI 发布说明:Sol 在长程工作、编程与知识任务中的官方结果

OpenAI 报告 Sol 在 Agents’ Last Exam 得分 53.6、Artificial Analysis Intelligence Index 接近 Fable 5、Coding Agent Index 为 80,并给出 BrowseComp 92.2% 与 OSWorld 2.0 62.6%;这些是厂商自报且受基准条件限制。

来源OpenAI
原文日期2026-07-09
采集2026-08-17

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol;发布说明同时讨论 Terra、Luna 与 GPT-5.5
提供商 / 客户端
OpenAI 官方发布说明;具体运行客户端未公开
推理档位
部分图表为 max;其他项目档位未全部公开
推理编程Agent能力
媒体 / 基准方独立测量

Artificial Analysis:Sol 的智能、编程 Agent 与单位任务成本

Artificial Analysis 记录 Sol max 的 Intelligence Index 为 59、每任务约 1.04 美元、Coding Agent Index 为 80,并报告约 1.5 万输出 token/任务;模型与 Codex 等完整 harness 绑定,不能当作裸模型排名。

来源Artificial Analysis
原文日期2026-07-09
采集2026-08-17

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol max;同时比较 Terra、Luna、GPT-5.5
提供商 / 客户端
Artificial Analysis;Coding Agent 中 Sol 运行于 OpenAI Codex harness
推理档位
max;同时展示多个 GPT-5.6 档位成本前沿
推理编程成本速度与延迟
媒体 / 基准方独立测量

CodeRabbit:Sol 在长任务代码代理与代码审查中的取舍

CodeRabbit 报告 Sol 长程编码通过率 63.7%,平均每完成任务输出 20,968 token;审查中命中 69/99 个可行动案例、precision 31.6%,并产生 231 条评论,显示召回与噪声并存。

来源CodeRabbit
原文日期2026-07-09
采集2026-08-17

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol;对照 Terra、Fable 5、Sonnet 5、Opus 4.8
提供商 / 客户端
CodeRabbit 代码代理和代码审查 harness
推理档位
Sol 具体档位未公开;对照模型按各自来源设置
编程Agent稳定性
媒体 / 基准方独立测量

METR:Sol 的长程时间跨度取决于如何处理评测作弊

METR 在 Time Horizon 1.1 ReAct 中报告 Sol 的 50% 时间跨度:作弊计失败约 11.3 小时、计成功超过 270 小时、剔除约 71 小时;作者强调三者都不是稳健测量。

来源METR
原文日期2026-06-26
采集2026-08-18

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol final checkpoint、railfree、raw CoT API
提供商 / 客户端
OpenAI 提供模型;METR ReAct harness
推理档位
未公开
Agent编程稳定性推理

全部来源

全部来源

17 / 17
官方厂商自报

OpenAI 发布说明:Sol 在长程工作、编程与知识任务中的官方结果

OpenAI 报告 Sol 在 Agents’ Last Exam 得分 53.6、Artificial Analysis Intelligence Index 接近 Fable 5、Coding Agent Index 为 80,并给出 BrowseComp 92.2% 与 OSWorld 2.0 62.6%;这些是厂商自报且受基准条件限制。

来源OpenAI
原文日期2026-07-09
采集2026-08-17

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol;发布说明同时讨论 Terra、Luna 与 GPT-5.5
提供商 / 客户端
OpenAI 官方发布说明;具体运行客户端未公开
推理档位
部分图表为 max;其他项目档位未全部公开
推理编程Agent能力
媒体 / 基准方独立测量

Artificial Analysis:Sol 的智能、编程 Agent 与单位任务成本

Artificial Analysis 记录 Sol max 的 Intelligence Index 为 59、每任务约 1.04 美元、Coding Agent Index 为 80,并报告约 1.5 万输出 token/任务;模型与 Codex 等完整 harness 绑定,不能当作裸模型排名。

来源Artificial Analysis
原文日期2026-07-09
采集2026-08-17

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol max;同时比较 Terra、Luna、GPT-5.5
提供商 / 客户端
Artificial Analysis;Coding Agent 中 Sol 运行于 OpenAI Codex harness
推理档位
max;同时展示多个 GPT-5.6 档位成本前沿
推理编程成本速度与延迟
媒体 / 基准方独立测量

CodeRabbit:Sol 在长任务代码代理与代码审查中的取舍

CodeRabbit 报告 Sol 长程编码通过率 63.7%,平均每完成任务输出 20,968 token;审查中命中 69/99 个可行动案例、precision 31.6%,并产生 231 条评论,显示召回与噪声并存。

来源CodeRabbit
原文日期2026-07-09
采集2026-08-17

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol;对照 Terra、Fable 5、Sonnet 5、Opus 4.8
提供商 / 客户端
CodeRabbit 代码代理和代码审查 harness
推理档位
Sol 具体档位未公开;对照模型按各自来源设置
编程Agent稳定性
媒体 / 基准方独立测量

METR:Sol 的长程时间跨度取决于如何处理评测作弊

METR 在 Time Horizon 1.1 ReAct 中报告 Sol 的 50% 时间跨度:作弊计失败约 11.3 小时、计成功超过 270 小时、剔除约 71 小时;作者强调三者都不是稳健测量。

来源METR
原文日期2026-06-26
采集2026-08-18

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol final checkpoint、railfree、raw CoT API
提供商 / 客户端
OpenAI 提供模型;METR ReAct harness
推理档位
未公开
Agent编程稳定性推理
官方厂商自报

OpenAI 系统卡:Sol 的工具安全分数与确认边界

系统卡报告 Sol 在连接器提示注入得分 1.000、搜索/函数调用 0.910,计算机使用确认在金融交易/高风险通信/一般确认分别为 0.98/0.99/0.93;这是安全评估,不是普通任务成功率。

来源OpenAI Deployment Safety Hub
原文日期2026-07-09
采集2026-08-18

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol;GPT-Red 结果于 2026-08-03 增补
提供商 / 客户端
OpenAI Deployment Safety Hub;自有评测与生产模拟
推理档位
按 reasoning effort 曲线;具体档位未全公开
Agent稳定性推理
媒体 / 基准方编辑分析

Visual Studio Magazine:Sol 的 Token 效率与推理滑块边界

文章记录 Plus/Pro 用同一 Sol 覆盖快速与深度回答,并引用 Sol 在 Coding Agent Index 得分 80、SWE-Bench Pro 64.6%、每项 Intelligence 任务约 1.5 万输出 token;Sol 并非每项评测第一。

来源Visual Studio Magazine
原文日期2026-08-06
采集2026-08-17

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol;区分 2026-08-06 ChatGPT 更新版与 7 月评测版
提供商 / 客户端
OpenAI ChatGPT Plus/Pro 网页账户;作者使用公司账户
推理档位
Sol Light 与更深推理滑块;引用基准为原评测档位
速度与延迟推理成本编程
媒体 / 基准方个人体验

Every:Sol 适合协作式知识工作,但不替代高层判断

Every 记录 Sol 在 24 篇草稿、邮件、会议和检索中快速可转向,但 Senior Engineer 基准为 56/100(Fable 90/100),写作基准六模型垫底,说明上下文协作不等于自主判断。

来源Every
原文日期2026-07-08
采集2026-08-17

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol;对照 GPT-5.5、Fable 5、Sonnet 5、Opus 4.8
提供商 / 客户端
Every 团队 ChatGPT/Codex 工作流;账户配置未公开
推理档位
未公开
writingAgent编程推理
媒体 / 基准方个人体验

Jonathan Fulton:Sol 的应用构建更完整,但长程迁移更慢

作者在个人 OpenAI 订阅上复用同一套测试:Sol 约 1 小时完成金融应用、26 小时完成 10 万行 Python 到 Go 迁移并通过 2 万余测试,但比 Fable 的 5.5 小时迁移慢近五倍。

来源Medium
原文日期2026-07-16
采集2026-08-17

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol;对照 Claude Fable 5
提供商 / 客户端
个人 OpenAI 订阅;Codex /goal;工作账户不用于对比
推理档位
Ultra;具体参数未公开
编程Agent速度与延迟稳定性
社区个人体验

Reddit Cursor:同一后端计划下 Sol medium 的一次实现对比

Reddit 用户在 Cursor 中让 Grok 4.6 extra high 与 Sol medium 执行同一份约 2,500 行后端计划,以 Fable 5 high 评审;作者给出约 60/40 主观胜负,测试只有一次。

来源Reddit r/cursor
原文日期2026-08-14
采集2026-08-17

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol medium;Grok 4.6 extra high;Fable 5 high 评审
提供商 / 客户端
Cursor;作者评论澄清为 Cursor 订阅
推理档位
Sol medium;Grok extra high;Fable high
编程Agent稳定性
社区个人体验

Reddit 编剧体验:Sol 用于剧本逐行讨论,而非代写

一位编剧数小时用 ChatGPT Sol 逐行检查短片二稿的角色心理、潜台词、节奏和伏笔,并在语音模式持续追问;这是单个创作者体验,仍需作者自己的判断。

来源Reddit r/WritingWithAI
原文日期2026-08-04
采集2026-08-17

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol;评论提到 Claude/Gemini 但无同等记录
提供商 / 客户端
ChatGPT,含语音模式;方案未公开
推理档位
未公开
writing推理
社区平台遥测

Lynkr ITSMBench:路由降低成本,但 Sol 的二值通过率仍有限

Lynkr 通过 pi 路由 Sol 完成 89 个企业 IT 服务台任务:全套 Pass@1 为 31%,匹配方法为 35%/40% Pass@1/Pass@2,约 0.87–0.90 美元/任务,缓存命中率 92–95%;许多失败只差少量断言。

来源X
原文日期2026-08-17
采集2026-08-17

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol high;对照 native Sol high/xhigh
提供商 / 客户端
Lynkr 通过 pi 路由;对照为原生 harness
推理档位
high;对照含 xhigh
Agent编程成本稳定性
社区个人体验

X 单次视觉构建:Sol 界面较好,但本次游戏不可玩且更贵

同一 /design 提示、一次尝试的 Command Code 对比中,Sol 花费 0.32 美元,界面不错但浏览器游戏不可玩;GLM 5.3 为 0.016 美元且可玩,Opus 5 为 0.37 美元且克隆完成度最高。

来源X
原文日期2026-08-17
采集2026-08-17

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol;对照 GLM 5.3 与 Opus 5
提供商 / 客户端
Command Code;提供商和账户未公开
推理档位
未公开
视觉生成编程成本
社区独立测量

Box Complex Work:Sol 的优势集中在企业文档数字链条

Box 十二行业文档评测中,Sol 在金融、公共部门、零售、能源、生命科学、医疗为 76%、74%、72%、61%、60%、58%,GPT-5.5 为 71%、63%、66%、54%、51%、46%;完整样本和评分器未公开。

来源X(Box)
原文日期2026-07-10
采集2026-08-18

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol;对照 Terra、Luna 与 GPT-5.5
提供商 / 客户端
Box Complex Work Eval;harness 未公开
推理档位
未公开
推理信息抽取稳定性
社区个人体验

Nate Herk:Sol 的创意构建成本较低,但 Fable 更常赢得盲选

Nate Herk 用相同 /goal 比较 Codex 的 Sol 与 Claude Code 的 Fable:三项构建中 Sol 在约 7 分钟/$1 的视觉对象胜出,但自行车游戏和滚动网站选 Fable;API 小样本受拒答影响。

来源X
原文日期2026-07-10
采集2026-08-18

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol;对照 Claude Fable 5
提供商 / 客户端
Sol 用 Codex;Fable 用 Claude Code
推理档位
未公开
视觉生成编程成本Agent
社区个人体验

Matthew Berman:Sol 的长程执行与浏览器控制仍需确认点

Matthew Berman 记录 Sol 在 Codex /goal、Computer Use、Excel 和 Workspace 迁移中的两个月个人体验,认为它少游走且浏览器控制强,但也会自信报告未完成系统工作;推理档位偏好不是受控速度基准。

来源X
原文日期2026-07-10
采集2026-08-18

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol;对照 GPT-5.5 与 Fable 5
提供商 / 客户端
Codex /goal、Computer Use、浏览器、Excel、Workspace;账户未公开
推理档位
Light、高、超高、Ultra;作者偏好高/超高
Agent编程速度与延迟稳定性
社区独立测量

SlopCodeBench:Sol 与 Fable 在长程编码严格通过率打平

SlopCodeBench 用 6 个挑战、30 个逐步追加需求的 checkpoint 和新上下文测试长程编码;Sol 在 Codex CLI 0.145.0 严格通过 10/30(33.3%),与 Fable 持平,但每模型仅一次。

来源X
原文日期2026-08-05
采集2026-08-18

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol;对照 Fable 5 与 Kimi K3 两提供商
提供商 / 客户端
Sol Codex CLI 0.145.0;Fable Claude Code 2.1.219;Kimi OpenCode 1.18.0
推理档位
未公开
编程Agent稳定性
社区个人体验

Reddit Codex Pro 20x:一次 Sol Standard 额度与 API 等值记录

一位用户在单个 Pro 20x 账户上用 CLI 与修正版 ccusage 核对两个重置窗口:合计 42,559 credits、估算约 1,702 美元 Standard API 等值;这是订阅预算记录,不是模型质量或通用配额。

来源Reddit r/codex
原文日期2026-07-26
采集2026-08-18

待验证:本次未能重新核实原文。

模型版本
GPT-5.6 Sol Standard
提供商 / 客户端
一个 Codex Pro 20x 账户;本地 CLI 与 ccusage
推理档位
Standard
成本Agent

GPT-5.6 Sol

在 Tabbit 中比较 GPT-5.6 Sol

客户端中的模型、功能和权限以当前账户为准。