Adit_Yah 称同一 prompt 三天后得到完全不同的代码结果,耗时从 80 分钟变为 330 分钟并生成 4,500+ 行代码;这更适合被当作服务路由、版本或采样波动的复现实验信号,而非持续学习证据。
模型:Ox Alpha;客户端、提供商、版本快照、参数和完整 prompt 未公开。
对照时间:作者称同一任务在三天前和当天运行;未公开两次的完整时间戳、commit 或模型 ID。
任务:帖子视频中为同一类代码/赛车场景任务,但没有仓库、输入文件或验收脚本。
结果表述:当天运行 330 分钟、4,500+ 行代码;此前运行 80 分钟。评论指出第一段视频可能被 1.5 倍速播放,作者澄清视频速度与赛道不同。
| 指标 | 帖子/回复可见内容 | 解释边界 |
|---|---|---|
| prompt | 作者称两次使用完全相同 prompt | 未公开 prompt,无法核对字节级一致 |
| 代码量 | 新运行 4,500+ 行 | 未公开 diff、有效代码比例和是否包含生成文件 |
| 时长 | 330 分钟 vs 80 分钟 | 未公开 wall-clock 日志和等待/人工操作区分 |
| 讨论解释 | 路由到更弱模型、服务拥堵、版本变化、过度思考等 | 均未被控制实验区分 |
保存完整 prompt、仓库 commit、模型 ID、提供商、客户端版本、temperature/effort、工具权限和时间戳。
在同一天重复至少 5 次建立采样/服务波动基线,再在多个日期重复相同组实验。
保存完整工具轨迹、输出 token、生成文件、错误、重试、总 wall-clock 和人工介入。
固定或记录视频播放速度、硬件、赛道/输入资源和验收脚本。
比较最终测试通过率、有效 diff、返工时间和成本,而不只比较代码行数或视频观感。
原帖支持“Ox Alpha 在短期预览期间可能出现明显的跨日期结果差异”这一待复现信号;它不能支持“模型持续学习”或“当天一定更强”。对需要稳定结果的用户,应把模型/提供商/时间窗口写入实验记录。
没有完整 prompt、代码、测试、模型版本或请求日志。
两次运行没有同日重复和随机化控制。
视频速度与任务场景存在争议,不能直接用视频时长比较性能。
Ox Alpha