danilofs 称从周六起持续在 OpenCode 使用 DeepSeek V4.1 Flash,修复了 Muse Code、Claude Code 和 Codex 在一个月内留下的混乱;评论提醒它可能把设计选择报成 bug,仍需约束和人工验收。这是社区现场报告,不是受控测试。
适合判断的任务:已有代码库的理解、问题定位、修复候选和快速迭代体感。
不适合外推的任务:生产修复正确率,以及与 Astra 或其他模型的严格成本/质量比较。
适用的模型版本:原帖明确称 DeepSeek v4.1 Flash;API ID、构建版本和推理参数未注明。
测试环境或客户端:OpenCode;项目规模、仓库、工具配置和 harness 未注明。
推理档位和参数:未注明。
无统一方法。正文是持续使用感受,评论是补充经历,未定义任务集、基线、成功标准、重复次数或独立复核。采集时页面显示 176 个赞同、70 条评论,仅为快照。
TSltd_dev 自述:前一晚在 Astra 约十几轮花费 $140,仍未达验收标准;次日切到 DeepSeek 4.1 Flash,只输入 “familiarize yourself with the project.”,模型发现多个问题并询问先修哪一个,作者称 “Hasn't spent $1 yet.” 这是单项目经历,不能换算单任务价格或成功率。
误报反证来自评论:Dualyeti 说让 LLM 修 bug 几乎总能找到 bug,甚至 4.1 审计 4.1 也会找出问题;Yes_but_I_think 称设计决策经常被认作 bug。I_RIDE_SHORTSKOOLBUS 建议把规则和偏离写入 design.md,只有违反规则且不在偏离清单中的项才算 finding,说明部分“发现”可能源于规格缺失。
| 项目 | 原帖自述 |
|---|---|
| 使用者 | danilofs;TSltd_dev |
| 客户端 | OpenCode |
| Astra 对照 | 约十几轮,$140,未达验收标准 |
| DeepSeek 4.1 Flash 输入 | familiarize yourself with the project. |
| DeepSeek 费用状态 | 作者称尚未花费 $1 |
| 社区互动快照 | 176 赞同,70 评论 |
该帖支持 V4.1 Flash 在 OpenCode 中理解旧项目、追踪问题和提出修复的现场信号,但没有通过率或净改进。
$140、十几轮、未花费 $1 均为个人自述;Astra 配置、项目和验收标准未注明,不能公平比较成本。
先写清规则、例外和验收标准,再核对改动、测试与回归;模型说“发现问题”不等于缺陷已证实。
评论还报告幻觉、漏改和“声称已改但实际未改”,意见矛盾,均不能外推。
复现需固定 OpenCode 配置和项目约束,输入原帖短提示,记录 findings、改动、测试和账单,再逐项判定“真实缺陷 / 设计决策 / 未证实”。
DeepSeek V4.1 Flash