楼主称模型搭配 DSH 开发游戏引擎时速度很快,但完成工作远不如 Opus,并会忘记已读 Markdown 规则;这是复杂 Agent 任务中的个人风险信号,不能单独归因于模型或 DSH。
适合判断的任务:复杂代码项目中的规则遵循和任务保持。
不适合外推的任务:通用编程能力、成功率、成本,或与 Opus 的公平比较。
适用的模型版本:DeepSeek V4.1 Flash。
测试环境或客户端:DSH;提供商、具体配置和项目规模未注明。
推理档位和参数:未注明。
没有任务集、完整提示词、参数、重复次数或验收标准。楼主称已为游戏引擎开发花费 10 美元,但未给出错误清单、完成率或 OpenCode 后续结果,并怀疑 DSH 也有影响。楼主强调关键是实际完成了多少工作,而非 token 数量;这只是其判断标准,未有逐项记录或复核结果。
楼主说模型思考和生成 token 很快,但实际工作中很快忘记上下文;即使规则写在已读 Markdown 文件里,仍会做明确禁止的事。Hermes Agent 用户自述:会话开始加载的随机 Obsidian 笔记规则,在约 600k token 后仍被记住。两者任务、配置不同,后者不是反证实验。
| 项目 | 原帖可见信息 |
|---|---|
| 模型 | DeepSeek V4.1 Flash |
| 客户端 | DSH |
| 任务 | 构建游戏引擎 |
| 费用 | 楼主称已花费 $10 |
| 现象 | 速度快;规则遗忘;偏离任务并执行禁做事项 |
| 参数与样本 | 未注明;单人经历 |
该帖提示长流程开发中,速度不能替代规则保持和任务收敛;但不能判断问题来自模型、DSH、提示设计或项目复杂度,仍需受控复现和人工验收。Hermes 的 600k token 说法是他人自述。评论中的订阅 token 数量不作为事实依据。
固定 DSH、模型版本、游戏引擎任务和 Markdown 规则,记录上下文长度、违规次数、有效改动与验收结果;重复后,再把 OpenCode 或 Hermes 作为独立条件比较。
DeepSeek V4.1 Flash