用 Responses API 设计可复核的多代理工作流
将判断任务与确定性处理分开,用程序化工具调用、并行子代理和提示缓存构建可记录成本、延迟与失败状态的长任务流程。
- 准备输入
- 用户目标、工具 schema、代理分工、缓存边界、验收标准
- 运行环境
- OpenAI Responses API;生产 Agent harness;需自行定义工具调用和人工复核点

在 Tabbit 中使用 GPT-5.6 Sol
GPT-5.6 Sol · 模型速览
这里集中放置已审核的任务指南、公开测评和证据边界。客户端是否开放模型,仍以当前账户为准。
Tabbit 模型与权限需以当前账户核实。
把资料整理成结构化结果,制作视觉原型,或开始一个编码任务。
将判断任务与确定性处理分开,用程序化工具调用、并行子代理和提示缓存构建可记录成本、延迟与失败状态的长任务流程。
用同一任务在较快与较高思考档之间做对照:短问答先追求速度,多步骤规划、研究、写作、编程和决策再提高思考投入;官方的 68% 数字是内部相对变化,不是公开准确率。
来源给出 config.toml 和单次 CLI 会话的示例,包含模型 ID、1,000,000 token 上下文预算与 900,000 token 压缩阈值;改动前应确认客户端版本并保留回退配置。
把长程编码拆为预测、规划、实现、对抗评审和独立验证,逐项对照计划、测试与停止条件;这是评论者报告的个人工作流,不是 Codex 默认配置。
公开结果来自不同版本、档位和测试方法;未知值保持未知。
OpenAI 报告 Sol 在 Agents’ Last Exam 得分 53.6、Artificial Analysis Intelligence Index 接近 Fable 5、Coding Agent Index 为 80,并给出 BrowseComp 92.2% 与 OSWorld 2.0 62.6%;这些是厂商自报且受基准条件限制。
Artificial Analysis 记录 Sol max 的 Intelligence Index 为 59、每任务约 1.04 美元、Coding Agent Index 为 80,并报告约 1.5 万输出 token/任务;模型与 Codex 等完整 harness 绑定,不能当作裸模型排名。
CodeRabbit 报告 Sol 长程编码通过率 63.7%,平均每完成任务输出 20,968 token;审查中命中 69/99 个可行动案例、precision 31.6%,并产生 231 条评论,显示召回与噪声并存。
OpenAI
整理 GPT-5.6 Sol 的官方构建指南、Agent 编排方法、代码测评与真实社区反馈,帮助你理解它适合的长任务。