一位 OpenCode 用户称 Ox Alpha 在其项目中清理 DeepSeek V4 Flash 的结果、用约五分之一 token 完成工作,但同一讨论也出现“逻辑/unsafe Rust/汇编更差”的反例,结论高度依赖任务类型。
入口:OpenCode;具体客户端版本、模型 ID、推理档位和任务清单未公开。
对照:Ox Alpha vs DeepSeek V4 Flash(DSV4F)。
主张任务:用户称 Ox Alpha 清理 DSV4F 产出的项目代码;项目被描述为“很复杂”,但没有仓库或 commit。
指标:作者称 Ox Alpha 更聪明且使用 5x less tokens;没有原始 token 账本。
| 观察 | 原帖/评论内容 | 证据边界 |
|---|---|---|
| 主帖结论 | Ox Alpha 在项目中清理 DSV4F 的代码 | 没有 diff、测试或任务样本 |
| token | 作者称约少 5 倍 | 没有输入/输出/cache 分项和计量方式 |
| 反例 | 有评论称 unsafe Rust/assembly 中 Ox 引入未定义行为和细微正确性 bug | 个人反例,没有独立复核 |
| 任务分化 | 另有评论认为 Ox 在 frontend 更好,DSV4F 在 Kotlin 或低级代码更好 | 非同一受控任务集 |
固定同一仓库、commit、任务描述、上下文、权限、模型版本和推理档位。
设计至少三类任务:代码清理、前端功能、unsafe Rust/assembly 或 Kotlin;随机化模型运行顺序。
保存输入 token、输出 token、cache token、工具调用、耗时、完整 diff 和重试。
用编译器、测试、sanitizer、基准测试和人工 review 判断真实改进、回归和未定义行为。
分任务类型报告首轮通过率、修复后通过率、token/成功任务和人工返工时间,不汇总成一个“更聪明”分数。
这条来源支持的最强结论是:某用户在自己的项目里观察到 Ox Alpha 的 token 使用更少、清理工作更好;同一讨论同时给出低级性能代码的负面体验。因此,Ox Alpha 可能更适合需要理解上下文、工具调用和常规代码整理的任务,但必须对安全关键和低级代码做独立验证。
没有相同任务的可公开复现输入、输出和测试。
“5x less tokens”没有计量口径,也没有把重试和人工返工纳入成本。
讨论中的正负体验来自不同项目,不能互相抵消或形成排行榜。
Ox Alpha