先给 Ox Alpha 一份不可能来自训练集的自定义语言文档,再分阶段实现游戏和语言特性,是检验 Agent 能否读文档、持续编码和回归验证的实用工作流。
适合的任务:自定义 DSL、内部 SDK、少量文档驱动的应用和游戏原型。
不适合的任务:没有测试入口、不能回滚的生产仓库,或把“能生成代码”当成“实现正确”。
适用的模型版本:Ox Alpha;原帖没有版本快照。
适用的客户端、Agent 或 API:OpenCode CLI;原帖明确是在 OpenCode 中使用。
推荐的推理档位和参数:未公开;长任务应固定上下文、工具权限和超时。
原帖没有公开完整逐字 prompt,下面是按原帖公开步骤整理的可复用工作流,不应引用为原始 prompt:
你将使用仓库中的自定义语言文档实现一个简单的平台游戏。
阶段 1:先阅读并总结文档,列出语法、运行方式和当前不确定点;不要猜测未写明的语义。
阶段 2:实现一个可运行的平台游戏,包含 10 个关卡。先完成最小可运行版本,再逐关验证。
阶段 3:运行项目已有检查或最小回归测试,报告每个关卡是否能启动、输入是否生效、失败原因是什么。
阶段 4:新增 modulo 运算符。同步更新解析、执行、错误处理和文档,并为正数、负数、零和非法输入补测试。
阶段 5:再次运行全部回归测试,只修改与任务有关的文件,最后给出文件清单和未解决问题。把自定义语言文档放入仓库并明确“以文档为准”。
将“实现游戏”和“新增语言特性”拆成两轮,避免一次任务掩盖回归问题。
每轮都要求运行结果和失败原因,而不是只输出代码。
使用可回滚分支;自定义语言的正确性必须由运行时或测试验证。
作者称模型在给出文档后完成了 10 关平台游戏,还能新增 modulo 运算符;作者同时说明关卡设计一般,但功能可用。该结果是个人报告,不含代码仓库、commit 或测试日志。
Ox Alpha