Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
提示词与工作流

GPT-5.6 Sol · workflow

用预测、规划、评审和验证交付代码

把长程编码拆为预测、规划、实现、对抗评审和独立验证,逐项对照计划、测试与停止条件;这是评论者报告的个人工作流,不是 Codex 默认配置。

来源已核对;未实测Codex、OpenCode 或可保存计划并运行测试的代码 Agent;阶段需映射到实际 hook 或命令

前置条件与输入

  • 代码库
  • 任务目标
  • 风险清单
  • 测试命令
  • 验收信号
  • 停止条件

完整可复制模板

分阶段代码交付编辑改写模板

Tabbit 编辑改写;非来源原文
目标:{{GOAL}}
代码库:{{REPOSITORY}}

先记录预期行为和风险,再规划范围、不可改变的接口与停止条件;只实现当前计划并运行 {{TEST_COMMAND}};对代码和测试做对抗评审;最后逐项提交测试、人工检查和回滚证据。验证失败时只修复已记录的缺口,达到停止条件后不要扩张范围。

运行前仍需替换: {{GOAL}}, {{REPOSITORY}}, {{TEST_COMMAND}}

结果

得到一份带停止条件的分阶段代码交付记录:先写预期和风险,再规划范围,边实现边测,最后用独立评审和验证区分“模型说完成”与“产物确实符合要求”。这是社区评论中提到的个人 hack 的编辑改写。

前置条件

  • 代码 Agent 能保存计划、读取代码、运行针对性测试并查看差异。

  • 明确目标、不可改变的接口、风险、测试命令、人工审批点和停止条件。

  • 为每个验收信号准备独立检查,尤其是权限、数据库和生产部署相关变更。

步骤

  1. 预测:写下预期行为、未知项、关键风险和最小验收信号。

  2. 规划:将目标拆成可检查步骤,锁定范围、接口、文件边界、回滚方式和停止条件。

  3. 实现:只执行当前计划,边改边运行相关测试,不为假设的未来需求扩张范围。

  4. 评审:对代码和测试做对抗检查,寻找奖励投机、过度工程、弱化断言和遗漏的回归。

  5. 验证:用独立命令、黑盒检查或人工复核逐项对照计划与验收信号;失败时只回到缺失阶段。

  6. 循环:每轮只修复已记录的失败项;同一处反复修改或触及高风险范围时暂停并请求人工确认。

输出验收

  • prediction、plan、实现差异、测试结果、评审发现和 verifier 结论均有记录。

  • 测试确实对应需求,没有为了通过而删除断言、放宽范围或伪造结果。

  • 验证结果逐项标为通过/失败/未执行,并附命令、日志或人工检查证据。

  • 失败只触发必要的局部修复;满足停止条件后不继续扩张任务。

失败处理

  • 计划不清导致目标漂移时,暂停实现并重新确认目标、范围和验收标准。

  • 测试失败时记录最小缺口,禁止用修改测试来掩盖实现问题。

  • Agent 反复改同一处、不断增加抽象或耗尽额度时,停止循环并让人判断是否回退。

  • 独立验证无法执行时,明确写出阻塞原因和下一项可执行检查,不声称已通过。

边界

  • 来源没有提供完整公开配置,也没有受控基准;阶段名称需要映射到实际 Agent 的 hook、文件或命令。

  • 这不是 Sol 或 Codex 的默认行为,也不能推出成功率、成本或生产可用性。

  • 验证阶段不能代替高风险变更的人工审查、权限审批和生产发布流程。

查看来源研究笔记

一句话结论

把 Sol 的长程编码任务拆成预测、规划、实现、对抗评审和验收五段,可把“模型自称完成”与“按计划交付”分开检查。

适用场景

  • 适合的任务:多文件编码、代理编排、测试驱动实现和容易出现无限修复循环的长期任务。

  • 不适合的任务:一次性问答或没有可验证产物的创意任务。

  • 适用的模型版本:GPT‑5.6 Sol;也可迁移到其他代码代理。

  • 适用的客户端、Agent 或 API:Codex、OpenCode 等能保存计划、运行测试和复查代码的 Agent。

  • 推荐的推理档位和参数:评论没有给出固定档位;先用能完成任务的最低档位,循环任务单独记录成本。

可直接使用的内容

以下是根据评论中公开的阶段名称重建的可复用骨架,不是作者公开的完整系统提示:

prediction_stage:
  写下预期行为、关键风险、最小验收信号。
planning_stage:
  将目标拆成可检查的步骤;明确范围、不可改变的接口和停止条件。
implementation_stage:
  只实现当前计划,边改边运行针对性测试。
review_stage:
  对实现和测试做对抗性检查,重点找奖励投机、过度工程和测试放水。
verifier_stage:
  将实际产物逐项对照计划与验收信号;通过则交付,失败则只回到缺失阶段。
loop_policy:
  若验证失败,给出具体缺口和下一步;达到停止条件后禁止继续扩张范围。

测试/工作流步骤

  1. 在任务开始前保存 prediction 和 plan,避免后续目标漂移。

  2. 实现阶段只提交与当前计划相关的代码和测试。

  3. 评审阶段检查测试是否真的覆盖需求,是否为了“通过”而弱化断言。

  4. 验证阶段运行独立命令或黑盒检查,并逐项记录通过/失败。

  5. 循环时只修复失败项;如果模型反复改动同一处,暂停并让人确认范围。

原始证据与数据

  • 评论公开提到的顺序是 prediction_stage、planning_stage、review_stage 和 verifier_stage,并建议在代码和测试落地后检查 reward hacking。

  • 评论者明确说这是自己测试中的 hack,不是受控基准或官方 Codex 配置。

  • 同一帖子主文对 Sol Ultra/Max 的体验存在强烈争议;评论区有用户报告高效,也有用户报告过度工程和耗尽额度。

适用边界

  • 这是一条社区工作流建议,不代表 Sol 的默认行为或 OpenAI 官方最佳实践。

  • 阶段名称和示例需要映射到实际 Agent 的 hook、文件或命令;来源没有给出可复制的完整配置文件。

  • 验证阶段不能替代人工审查高风险变更,尤其是数据库、权限和生产部署操作。

来源摘录或观察(仅做合规短引)

评论建议在实现和测试完成后,用 review_stage 检查 “signs reward hacking in tests”。

来源与日期

Reddit r/codex · 原文日期: 2026-07-23 · 编辑日期: 2026-09-20

阅读原始来源
变量检查

仍需替换: 3

{{GOAL}}{{REPOSITORY}}{{TEST_COMMAND}}

相关提示词

为 Codex 配置百万上下文与自动压缩用 Occam 规则限制 Codex 的过度工程用 Responses API 设计可复核的多代理工作流用目标与验收标准编写 Sol 任务提示

相关测评

CodeRabbit:Sol 在长任务代码代理与代码审查中的取舍METR:Sol 的长程时间跨度取决于如何处理评测作弊Reddit Cursor:同一后端计划下 Sol medium 的一次实现对比Lynkr ITSMBench:路由降低成本,但 Sol 的二值通过率仍有限

模型深度阅读

总览 · 简体中文

GPT-5.6 Sol 是什么:规格、获取方式、变化与仍需留意的风险

OpenAI 当前模型页列出 GPT-5.6 Sol 的 105 万 token 上下文、12.8 万最大输出和推理控制。本文区分 API 规格、Codex 客户端与浏览器使用边界。

GPT-5.6 Sol

在 Tabbit 中使用 GPT-5.6 Sol

请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。