GPT-5.6 Sol · 社区来源 · 平台遥测
Lynkr 通过 pi 路由 Sol 完成 89 个企业 IT 服务台任务:全套 Pass@1 为 31%,匹配方法为 35%/40% Pass@1/Pass@2,约 0.87–0.90 美元/任务,缓存命中率 92–95%;许多失败只差少量断言。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
Lynkr 公布通过 pi 调用 GPT-5.6 Sol 的 ITSMBench 结果:89 个企业 IT 服务台任务、Pass@1/Pass@2、成本、缓存命中率和按任务族拆分的数据,并讨论二值评分的局限。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
X · LynkrDev · 原文发布日期 2026-08-17 · 本站编辑日期 2026-09-20
打开原始来源GPT-5.6 Sol
下载 Tabbit 客户端后检查模型可用性