这条讨论支持一个窄结论:marty4286 称 V4.1 Flash 已取代 Luna Max,原本约 1 小时的运行缩短为 20–40 分钟;同类任务用 Sol high 约 15–30 分钟且更便宜。但任务、输入、客户端、参数和验收标准均未公开,不能当作受控速度或能力比较。
适合判断的任务:复杂编码 Agent 的迭代速度、预算路由,以及让 V4.1 Flash 批量实现、再由更强模型审阅的工作流。
不适合外推的任务:复杂逻辑或多层抽象推理的通用成功率、与 Astra/Opus/Fable 的能力排名、稳定成本和生产可靠性。
适用的模型版本:原帖与评论均称 DeepSeek V4.1 Flash;API ID、提供商和构建版本未注明。
测试环境或客户端:作者提到 Codex usage;具体客户端、项目和 harness 未注明。
推理档位和参数:Sol 为 high;V4.1 Flash 与 Luna Max 档位未注明。
楼主只询问是否有人在真实编码项目中比较这些模型。评论是多名用户的主观经历,没有固定任务集、相同输入、重复次数、日志或独立验收。marty4286 的“equivalent tasks”没有给出任务定义,因此时间只能作为个人工作流记录。
marty4286:Luna Max 约 1 小时的运行,V4.1 Flash 用时 20–40 分钟;Sol high 的类似任务为 15–30 分钟。
他认为 V4.1 Flash 单独使用“相当不错”,但容易跑偏,并有比 V4 更严重的坏习惯;Sol、Astra、Fable 可用指令约束它,他暂时不愿完全放手运行。
其他评论一方面称它在硬核编码上远不如 Opus 或 Sol,另一方面认为日常任务已足够接近,说明任务难度改变结论。RealestReyn 采用 V4.1 Flash 批量编码、Astra 审阅的分工,并称审阅刚发现 5 个 bug。
| 对象 | 原帖可见信息 |
|---|---|
| V4.1 Flash | 20–40 分钟;取代 Luna Max;具体任务未注明 |
| Luna Max | 同类运行约 1 小时 |
| Sol high | 类似任务 15–30 分钟;作者称更便宜 |
| 讨论规模 | 正文 1 条;可见评论 50 条 |
该帖更适合支持“V4.1 Flash 可能提高编码迭代吞吐,并适合作为低成本执行模型”的现场信号,不能证明它在复杂任务上达到 Astra、Opus 或 Fable。评论中转载或改述 DeepSeek 技术报告的“高难度任务仍有差距”只作为讨论背景,不重新收录为本篇独立基准;所有时间也不是同任务同输入的实验结果。
固定同一仓库、提示词、工具、推理档位和验收标准,分别记录墙钟时间、轮次、token/额度、费用、有效改动和审阅发现的 bug,重复多次后再比较 V4.1 Flash、Luna Max 与 Sol high。
DeepSeek V4.1 Flash