GPT-5.6 Sol · workflow
把长程编码拆为预测、规划、实现、对抗评审和独立验证,逐项对照计划、测试与停止条件;这是评论者报告的个人工作流,不是 Codex 默认配置。
目标:{{GOAL}}
代码库:{{REPOSITORY}}
先记录预期行为和风险,再规划范围、不可改变的接口与停止条件;只实现当前计划并运行 {{TEST_COMMAND}};对代码和测试做对抗评审;最后逐项提交测试、人工检查和回滚证据。验证失败时只修复已记录的缺口,达到停止条件后不要扩张范围。运行前仍需替换: {{GOAL}}, {{REPOSITORY}}, {{TEST_COMMAND}}
得到一份带停止条件的分阶段代码交付记录:先写预期和风险,再规划范围,边实现边测,最后用独立评审和验证区分“模型说完成”与“产物确实符合要求”。这是社区评论中提到的个人 hack 的编辑改写。
代码 Agent 能保存计划、读取代码、运行针对性测试并查看差异。
明确目标、不可改变的接口、风险、测试命令、人工审批点和停止条件。
为每个验收信号准备独立检查,尤其是权限、数据库和生产部署相关变更。
预测:写下预期行为、未知项、关键风险和最小验收信号。
规划:将目标拆成可检查步骤,锁定范围、接口、文件边界、回滚方式和停止条件。
实现:只执行当前计划,边改边运行相关测试,不为假设的未来需求扩张范围。
评审:对代码和测试做对抗检查,寻找奖励投机、过度工程、弱化断言和遗漏的回归。
验证:用独立命令、黑盒检查或人工复核逐项对照计划与验收信号;失败时只回到缺失阶段。
循环:每轮只修复已记录的失败项;同一处反复修改或触及高风险范围时暂停并请求人工确认。
prediction、plan、实现差异、测试结果、评审发现和 verifier 结论均有记录。
测试确实对应需求,没有为了通过而删除断言、放宽范围或伪造结果。
验证结果逐项标为通过/失败/未执行,并附命令、日志或人工检查证据。
失败只触发必要的局部修复;满足停止条件后不继续扩张任务。
计划不清导致目标漂移时,暂停实现并重新确认目标、范围和验收标准。
测试失败时记录最小缺口,禁止用修改测试来掩盖实现问题。
Agent 反复改同一处、不断增加抽象或耗尽额度时,停止循环并让人判断是否回退。
独立验证无法执行时,明确写出阻塞原因和下一项可执行检查,不声称已通过。
来源没有提供完整公开配置,也没有受控基准;阶段名称需要映射到实际 Agent 的 hook、文件或命令。
这不是 Sol 或 Codex 的默认行为,也不能推出成功率、成本或生产可用性。
验证阶段不能代替高风险变更的人工审查、权限审批和生产发布流程。
把 Sol 的长程编码任务拆成预测、规划、实现、对抗评审和验收五段,可把“模型自称完成”与“按计划交付”分开检查。
适合的任务:多文件编码、代理编排、测试驱动实现和容易出现无限修复循环的长期任务。
不适合的任务:一次性问答或没有可验证产物的创意任务。
适用的模型版本:GPT‑5.6 Sol;也可迁移到其他代码代理。
适用的客户端、Agent 或 API:Codex、OpenCode 等能保存计划、运行测试和复查代码的 Agent。
推荐的推理档位和参数:评论没有给出固定档位;先用能完成任务的最低档位,循环任务单独记录成本。
以下是根据评论中公开的阶段名称重建的可复用骨架,不是作者公开的完整系统提示:
prediction_stage:
写下预期行为、关键风险、最小验收信号。
planning_stage:
将目标拆成可检查的步骤;明确范围、不可改变的接口和停止条件。
implementation_stage:
只实现当前计划,边改边运行针对性测试。
review_stage:
对实现和测试做对抗性检查,重点找奖励投机、过度工程和测试放水。
verifier_stage:
将实际产物逐项对照计划与验收信号;通过则交付,失败则只回到缺失阶段。
loop_policy:
若验证失败,给出具体缺口和下一步;达到停止条件后禁止继续扩张范围。在任务开始前保存 prediction 和 plan,避免后续目标漂移。
实现阶段只提交与当前计划相关的代码和测试。
评审阶段检查测试是否真的覆盖需求,是否为了“通过”而弱化断言。
验证阶段运行独立命令或黑盒检查,并逐项记录通过/失败。
循环时只修复失败项;如果模型反复改动同一处,暂停并让人确认范围。
评论公开提到的顺序是 prediction_stage、planning_stage、review_stage 和 verifier_stage,并建议在代码和测试落地后检查 reward hacking。
评论者明确说这是自己测试中的 hack,不是受控基准或官方 Codex 配置。
同一帖子主文对 Sol Ultra/Max 的体验存在强烈争议;评论区有用户报告高效,也有用户报告过度工程和耗尽额度。
这是一条社区工作流建议,不代表 Sol 的默认行为或 OpenAI 官方最佳实践。
阶段名称和示例需要映射到实际 Agent 的 hook、文件或命令;来源没有给出可复制的完整配置文件。
验证阶段不能替代人工审查高风险变更,尤其是数据库、权限和生产部署操作。
评论建议在实现和测试完成后,用 review_stage 检查 “signs reward hacking in tests”。
Reddit r/codex · 原文日期: 2026-07-23 · 编辑日期: 2026-09-20
阅读原始来源GPT-5.6 Sol
请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。