基准:Box Complex Work Eval,覆盖十二个行业的真实文档驱动任务。
任务类型:读取源文档、核对数字、尽调、发现专家输出错误和定量分析。
比较:GPT‑5.6 Sol、Terra、Luna 与 GPT‑5.5;页面没有公开完整样本数或 harness 版本。
输入是多年度财务预测、学生成绩重算、零售产品性能、能源运营报告、生命科学测试记录和临床案例等文档任务。
关键验收是数字链条能否保持一致、分母是否正确、报告是否有依据,以及是否避免高风险判断错误。
Box 将模型定位为未来 Box AI / Box AI Studio 的企业工作流选项。
| 行业任务 | GPT‑5.6 Sol | GPT‑5.5 |
|---|---|---|
| Financial Services | 76% | 71% |
| Public Sector | 74% | 63% |
| Retail | 72% | 66% |
| Energy | 61% | 54% |
| Life Sciences | 60% | 51% |
| Healthcare | 58% | 46% |
总体上 Sol 比 GPT‑5.5 高约 1%,但 Box 认为差距集中在更困难、后果更高的数字任务。
数据分析任务总体 Sol 64% 对 GPT‑5.5 57%;零售 80% 对 63%,生命科学 51% 对 27%,医疗 62% 对 50%,金融 78% 对 75%。
平均延迟方面 Terra 比 Sol 快约 16%,Luna 比 Sol 快约 19%;在零售库存/利润分析中,Luna 约以 Sol 一半时间返回完整答案。
Sol 的优势更像“把源文档中的数字链条算对并保持可辩护”,而不是所有知识工作都统一领先。高风险定量分析优先试 Sol;重复、结构化、高吞吐任务再用 Terra/Luna,并以准确率和延迟共同路由。
Box 的内部 benchmark、评分器、样本量、随机种子和原始文档未公开,外部不能完全复跑。
Box 是潜在产品合作方,存在发布选择和场景偏差;结果不能替代跨供应商盲测。
页面用“about 1%”描述总体提升,未给出总样本数和置信区间。
建立十二行业的文档任务集,保留源文档、目标答案和数字核对规则。
对 Sol、Terra、Luna、GPT‑5.5 固定上下文、工具和输出格式。
对金融预测、分母计算、记录重算和临床判断分别设计单独评分器。
记录任务正确率、延迟、成本和错误类型;不要只记录总体平均分。
用隐藏文档和第二批行业任务做外部复核。
Box 明确把“读取源文件、核对数字、运行尽调、审查专家输出”作为 benchmark 任务,而不是聊天偏好问卷。
文章给出了六个行业的 Sol/GPT‑5.5 数值以及数据分析子集的分数。
结论更适合文档驱动的企业分析,不等于 Sol 在开放式写作、前端视觉或长程代码上同样占优。
latency 只给相对百分比,没有服务区域、并发和 token 统计。
这是 Box 自有评测,不应与 Artificial Analysis 的分数直接拼接成统一排名。
Box 将总体结果概括为 Sol “edges past” GPT‑5.5,但随后强调优势集中在最困难的定量任务。
GPT-5.6 Sol