Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GPT-5.6 Sol · 社区来源 · 独立测量

Box Complex Work:Sol 的优势集中在企业文档数字链条

Box 十二行业文档评测中,Sol 在金融、公共部门、零售、能源、生命科学、医疗为 76%、74%、72%、61%、60%、58%,GPT-5.5 为 71%、63%、66%、54%、51%、46%;完整样本和评分器未公开。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源独立测量编辑日期 2026-09-20

测试条件速查

模型版本
GPT-5.6 Sol;对照 Terra、Luna 与 GPT-5.5
提供商 / 客户端
Box Complex Work Eval;harness 未公开
推理档位
未公开
工具
文档读取、数字核对、尽调和定量分析;权限未公开
任务集
十二行业文档驱动任务,含财务预测、成绩重算、零售、能源、生命科学和临床
样本 / 单次
完整样本、评分器、随机种子和重复次数未公开
发布日期 / 采集日期
2026-07-10 / 2026-08-18
可回溯结果
六行业 Sol/GPT-5.5:76/71、74/63、72/66、61/54、60/51、58/46%;数据分析 64/57%

关键数据与适用场景

测试环境

  • 基准:Box Complex Work Eval,覆盖十二个行业的真实文档驱动任务。

  • 任务类型:读取源文档、核对数字、尽调、发现专家输出错误和定量分析。

  • 比较:GPT‑5.6 Sol、Terra、Luna 与 GPT‑5.5;页面没有公开完整样本数或 harness 版本。

输入/配置

  • 输入是多年度财务预测、学生成绩重算、零售产品性能、能源运营报告、生命科学测试记录和临床案例等文档任务。

  • 关键验收是数字链条能否保持一致、分母是否正确、报告是否有依据,以及是否避免高风险判断错误。

  • Box 将模型定位为未来 Box AI / Box AI Studio 的企业工作流选项。

结果数据

行业任务GPT‑5.6 SolGPT‑5.5
Financial Services76%71%
Public Sector74%63%
Retail72%66%
Energy61%54%
Life Sciences60%51%
Healthcare58%46%
  • 总体上 Sol 比 GPT‑5.5 高约 1%,但 Box 认为差距集中在更困难、后果更高的数字任务。

  • 数据分析任务总体 Sol 64% 对 GPT‑5.5 57%;零售 80% 对 63%,生命科学 51% 对 27%,医疗 62% 对 50%,金融 78% 对 75%。

  • 平均延迟方面 Terra 比 Sol 快约 16%,Luna 比 Sol 快约 19%;在零售库存/利润分析中,Luna 约以 Sol 一半时间返回完整答案。

结论

Sol 的优势更像“把源文档中的数字链条算对并保持可辩护”,而不是所有知识工作都统一领先。高风险定量分析优先试 Sol;重复、结构化、高吞吐任务再用 Terra/Luna,并以准确率和延迟共同路由。

局限

  • Box 的内部 benchmark、评分器、样本量、随机种子和原始文档未公开,外部不能完全复跑。

  • Box 是潜在产品合作方,存在发布选择和场景偏差;结果不能替代跨供应商盲测。

  • 页面用“about 1%”描述总体提升,未给出总样本数和置信区间。

复现步骤

  1. 建立十二行业的文档任务集,保留源文档、目标答案和数字核对规则。

  2. 对 Sol、Terra、Luna、GPT‑5.5 固定上下文、工具和输出格式。

  3. 对金融预测、分母计算、记录重算和临床判断分别设计单独评分器。

  4. 记录任务正确率、延迟、成本和错误类型;不要只记录总体平均分。

  5. 用隐藏文档和第二批行业任务做外部复核。

原始证据与数据

  • Box 明确把“读取源文件、核对数字、运行尽调、审查专家输出”作为 benchmark 任务,而不是聊天偏好问卷。

  • 文章给出了六个行业的 Sol/GPT‑5.5 数值以及数据分析子集的分数。

适用边界

  • 结论更适合文档驱动的企业分析,不等于 Sol 在开放式写作、前端视觉或长程代码上同样占优。

  • latency 只给相对百分比,没有服务区域、并发和 token 统计。

  • 这是 Box 自有评测,不应与 Artificial Analysis 的分数直接拼接成统一排名。

来源摘录或观察(仅做合规短引)

Box 将总体结果概括为 Sol “edges past” GPT‑5.5,但随后强调优势集中在最困难的定量任务。

能支持的判断

  • 支持把优势限定为文档驱动、数字一致性和高后果定量分析。
  • 支持按行业查看结果而非只展示总体约 1%。

不能支持的判断

  • 不支持开放式写作、视觉构建或开放式编码的同等结论。
  • Box 是潜在产品合作方,不能与 AA 分数拼统一排名。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

X(Box) · @sidharths00 / Box · 原文发布日期 2026-07-10 · 本站编辑日期 2026-09-20

打开原始来源

GPT-5.6 Sol

在 Tabbit 中比较 GPT-5.6 Sol

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GPT-5.6 Sol 是什么:规格、获取方式、变化与仍需留意的风险

OpenAI 当前模型页列出 GPT-5.6 Sol 的 105 万 token 上下文、12.8 万最大输出和推理控制。本文区分 API 规格、Codex 客户端与浏览器使用边界。

相关评测

METR:Sol 的长程时间跨度取决于如何处理评测作弊METR 在 Time Horizon 1.1 ReAct 中报告 Sol 的 50% 时间跨度:作弊计失败约 11.3 小时、计成功超过 270 小时、剔除约 71 小时;作者强调三者都不是稳健测量。OpenAI 系统卡:Sol 的工具安全分数与确认边界系统卡报告 Sol 在连接器提示注入得分 1.000、搜索/函数调用 0.910,计算机使用确认在金融交易/高风险通信/一般确认分别为 0.98/0.99/0.93;这是安全评估,不是普通任务成功率。OpenAI 发布说明:Sol 在长程工作、编程与知识任务中的官方结果OpenAI 报告 Sol 在 Agents’ Last Exam 得分 53.6、Artificial Analysis Intelligence Index 接近 Fable 5、Coding Agent Index 为 80,并给出 BrowseComp 92.2% 与 OSWorld 2.0 62.6%;这些是厂商自报且受基准条件限制。Artificial Analysis:Sol 的智能、编程 Agent 与单位任务成本Artificial Analysis 记录 Sol max 的 Intelligence Index 为 59、每任务约 1.04 美元、Coding Agent Index 为 80,并报告约 1.5 万输出 token/任务;模型与 Codex 等完整 harness 绑定,不能当作裸模型排名。为长文档、图像和检索任务设计 Sol 请求用角色、目标、格式和标准组织请求;先建立长文档索引,再定位段落,图像任务明确提取对象,最新事实要求来源核验。该指南的客户端能力描述需按实际入口复核。用预测、规划、评审和验证交付代码把长程编码拆为预测、规划、实现、对抗评审和独立验证,逐项对照计划、测试与停止条件;这是评论者报告的个人工作流,不是 Codex 默认配置。按任务在 ChatGPT 切换 Sol 思考档位用同一任务在较快与较高思考档之间做对照:短问答先追求速度,多步骤规划、研究、写作、编程和决策再提高思考投入;官方的 68% 数字是内部相对变化,不是公开准确率。为 Sol 选择提示长度与推理档位根据任务难度先用最小提示和合适的 reasoning effort,再用代表性任务验证是否需要 Pro、工具调用或额外约束;文章同时比较 Claude Fable 5,不能当作 Sol 的独立官方文档。