Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区GPT-5.6 Sol

Box Complex Work Eval:GPT‑5.6 Sol 的企业文档定量任务

原始来源

X(Box)

作者@sidharths00 / Box

原文日期2026-07-10

Tabbit 整理2026-08-19

查看原文

测试环境

  • 基准:Box Complex Work Eval,覆盖十二个行业的真实文档驱动任务。

  • 任务类型:读取源文档、核对数字、尽调、发现专家输出错误和定量分析。

  • 比较:GPT‑5.6 Sol、Terra、Luna 与 GPT‑5.5;页面没有公开完整样本数或 harness 版本。

输入/配置

  • 输入是多年度财务预测、学生成绩重算、零售产品性能、能源运营报告、生命科学测试记录和临床案例等文档任务。

  • 关键验收是数字链条能否保持一致、分母是否正确、报告是否有依据,以及是否避免高风险判断错误。

  • Box 将模型定位为未来 Box AI / Box AI Studio 的企业工作流选项。

结果数据

行业任务GPT‑5.6 SolGPT‑5.5
Financial Services76%71%
Public Sector74%63%
Retail72%66%
Energy61%54%
Life Sciences60%51%
Healthcare58%46%
  • 总体上 Sol 比 GPT‑5.5 高约 1%,但 Box 认为差距集中在更困难、后果更高的数字任务。

  • 数据分析任务总体 Sol 64% 对 GPT‑5.5 57%;零售 80% 对 63%,生命科学 51% 对 27%,医疗 62% 对 50%,金融 78% 对 75%。

  • 平均延迟方面 Terra 比 Sol 快约 16%,Luna 比 Sol 快约 19%;在零售库存/利润分析中,Luna 约以 Sol 一半时间返回完整答案。

结论

Sol 的优势更像“把源文档中的数字链条算对并保持可辩护”,而不是所有知识工作都统一领先。高风险定量分析优先试 Sol;重复、结构化、高吞吐任务再用 Terra/Luna,并以准确率和延迟共同路由。

局限

  • Box 的内部 benchmark、评分器、样本量、随机种子和原始文档未公开,外部不能完全复跑。

  • Box 是潜在产品合作方,存在发布选择和场景偏差;结果不能替代跨供应商盲测。

  • 页面用“about 1%”描述总体提升,未给出总样本数和置信区间。

复现步骤

  1. 建立十二行业的文档任务集,保留源文档、目标答案和数字核对规则。

  2. 对 Sol、Terra、Luna、GPT‑5.5 固定上下文、工具和输出格式。

  3. 对金融预测、分母计算、记录重算和临床判断分别设计单独评分器。

  4. 记录任务正确率、延迟、成本和错误类型;不要只记录总体平均分。

  5. 用隐藏文档和第二批行业任务做外部复核。

原始证据与数据

  • Box 明确把“读取源文件、核对数字、运行尽调、审查专家输出”作为 benchmark 任务,而不是聊天偏好问卷。

  • 文章给出了六个行业的 Sol/GPT‑5.5 数值以及数据分析子集的分数。

适用边界

  • 结论更适合文档驱动的企业分析,不等于 Sol 在开放式写作、前端视觉或长程代码上同样占优。

  • latency 只给相对百分比,没有服务区域、并发和 token 统计。

  • 这是 Box 自有评测,不应与 Artificial Analysis 的分数直接拼接成统一排名。

来源摘录或观察(仅做合规短引)

Box 将总体结果概括为 Sol “edges past” GPT‑5.5,但随后强调优势集中在最困难的定量任务。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GPT-5.6 Sol

在 Tabbit 中使用并对比模型

GPT-5.6 Sol

相关测评

官方OpenAI2026-07-09

GPT-5.6:随宏大目标灵活扩展的前沿智能

官方OpenAI Deployment Safety Hub2026-07-09

OpenAI GPT‑5.6 System Card:安全、提示注入与 Agent 边界

媒体Artificial Analysis2026-07-09

GPT-5.6 benchmarks across Intelligence, Speed and Cost

媒体CodeRabbit2026-07-09

OpenAI GPT-5.6 Sol and Terra: Benchmark

GPT-5.6 Sol

相关提示词

官方OpenAI2026-08-13

The builder’s guide to GPT‑5.6

官方OpenAI2026-08-06

GPT‑5.6 Sol:ChatGPT 思考滑块与任务路由配置

官方OpenAI2026-08-13

GPT‑5.6 Sol Ultrafast:实时工作流配置与接入边界

社区The Prompt Index2026-07-09

GPT-5.6 (Sol) & Claude Fable 5 Prompting Guide (2026)