LeMi 用同一个 Ox Alpha、同一张《星际穿越》Ranger RF-31D 参考图像和同一个 prompt 比较 DeepSeek、OMP、OpenCode 三个框架,说明 Harness 可能显著影响结果,但帖子没有公开可量化评分。
模型:同一个 Ox Alpha;帖子未给模型 ID、提供商或版本快照。
输入:同一张《星际穿越》Ranger RF-31D 参考图像 + 完全相同的单次 prompt。
对照 Harness:DeepSeek、OMP、OpenCode。
任务:从参考图像重现该对象/场景;帖子正文未公开完整任务文本。
结果载体:12 秒视频;代码、截图、控制台和验收标准未公开。
作者偏好:回复称自己最喜欢 DeepSeek Harness,但没有解释评分量表。
| 项目 | 可见信息 | 边界 |
|---|---|---|
| 模型控制 | Ox Alpha 在三个 Harness 中运行 | 未证明三个 Harness 的 system prompt、工具、上下文和参数一致 |
| 输入控制 | 同一参考图像、同一单次 prompt | prompt 正文未公开,无法复现字节级输入 |
| 输出 | 公开结果视频 | 没有源码、测试、渲染错误或人工评分 |
| 主观偏好 | 作者喜欢 DeepSeek Harness | 个人偏好,不是模型排名 |
固定同一 Ox Alpha 模型 ID、提供商、客户端版本、system prompt、temperature/effort、工具 schema 和超时。
复制同一参考图像并保存 SHA-256;保存完整 prompt 和初始上下文。
在三个 Harness 中分别清空历史会话,只替换 Harness,记录工具调用、文件 diff、首 token、总耗时和错误。
规定统一验收:语义对象、几何/布局、渲染可运行、控制台错误、资源加载、人工返工时间。
至少重复 3 次并随机化顺序,分别报告模型差异、Harness 差异和服务负载差异。
该案例最有价值的是把“模型能力”与“Harness 影响”拆开:同一模型的输出不能脱离客户端工具、上下文和 system prompt 比较。当前只能支持“值得做三 Harness 复测”,不支持 DeepSeek、OMP 或 OpenCode 的质量排名。
单次运行、无 prompt 正文、无代码和无评分脚本。
三个 Harness 的隐藏配置可能不同。
视频只能展示结果,不能证明代码可复现、无控制台错误或长期稳定。
Ox Alpha