nehuenpereyra 称在 DeepSeek Harness 的 PTC 模式中用最大推理运行 DeepSeek V4.1 Flash,约 6 分钟、一次任务完成了 Nura Health 落地页,并正确生成移动端版本;总量 3,422,844 token,帖子报告成本约 $0.072。这个结果是单次现场体验,评论又说明额度耗尽使界面显示为两 turns,不能当作受控实验或稳定成功率。
适合判断的任务:在 DSH PTC Agent 中生成带视觉设计、动画和响应式布局的前端落地页;观察长输出、缓存命中和单任务成本的量级。
不适合外推的任务:所有前端项目的成功率、代码质量、生产可用性、速度排名,以及与其他模型的公平成本比较。
适用的模型版本:原帖明确称 DeepSeek V4.1 Flash。官方当前 API ID 为 deepseek-flash;旧 ID 映射新版的说明不改变本帖作为历史 V4.1 Flash 体验的版本归属。
测试环境或客户端:DeepSeek Harness,官方 DeepSeek API,PTC mode;目标为 Nura Health 落地页。未注明 Harness 版本、机器、网络和工具权限。
推理档位和参数:最大推理(max reasoning);温度、top_p、最大输出、超时和其他参数未注明。
这是单次社区 field report,不是基准测试。作者没有公布任务集、重复次数、预注册成功标准、独立代码审查或对照模型。可见提示词并非一句泛化指令,而是一个较完整的设计与实现 brief:规定 Moss、Clay、Cream、Charcoal 配色,字体和噪声纹理,固定导航、Hero、功能卡、宣言、协议、会员与页脚结构,并要求 GSAP 动画、Lucide 图标、真实 Unsplash 素材、响应式实现和零占位内容。评论中作者明确说没有使用 Skills,只用了 DSH 提供的 Agent。
正文称任务“一次尝试”完成;后续评论解释截图中的 two turns 是因为额度用尽,不应解读为两次独立实验或两轮完整重跑。
作者认为视觉能力给出了“出人意料的好反馈”,尤其是移动端/自适应版本正确实现;唯一明确的不满是 token 消耗速度很快。页面技术栈为 HTML、原生 JavaScript、Tailwind CSS、GSAP 3 和 Lucide。评论态度并不一致:有人认为页面像常见的 AI slop 或 Claude 生成代码,也有人认可质量与低价格;这些评价没有统一验收标准,只能作为社区反应。
成本数字需要按输入和输出拆开看。缓存命中率的分母是输入 token:
3,291,136 ÷ (3,291,136 + 36,963) = 98.89% ≈ 99%
若错误地用总 token 作分母,缓存部分只占 3,291,136 ÷ 3,422,844 = 96.15%,不能称为 99% 的总量缓存率。按项目已记录的官方价格口径(缓存输入 $0.006/M、未缓存输入 $0.30/M、输出 $1.20/M)并套用非高峰 50% 折扣,复算为约 $0.07225,与帖子报告的 $0.072 接近;正文没有提供独立账单或逐项计价窗口,因此这只是口径复算。
| 项目 | 帖子或评论记录 |
|---|---|
| 模型 | DeepSeek 4.1 Flash |
| Agent / 模式 | DeepSeek Harness;PTC mode;无 Skills |
| 推理档位 | 最大推理(max reasoning) |
| 任务 | Nura Health 高保真、动画、响应式落地页 |
| 技术栈 | HTML、原生 JavaScript、Tailwind CSS、GSAP 3、Lucide |
| 耗时与结果 | 约 6 分钟;正文称一次尝试成功 |
| 总 token | 3,422,844 |
| 缓存输入 | 3,291,136;相对输入总量约 98.89% |
| 未缓存输入 | 36,963 |
| 输出 | 94,745 |
| 帖子报告成本 | 约 $0.072(7.2 美分) |
| 评论补充 | 界面显示 two turns,作者解释为额度用尽;非独立复跑证据 |
该帖支持一个明确但窄的信号:在设计 brief 足够具体、缓存命中很高、采用最大推理的 DSH PTC 工作流中,V4.1 Flash 可能在约 6 分钟内产出作者认可的响应式落地页。
高缓存输入占比,以及采用非高峰折扣的计价假设,可以解释这笔低费用;原帖未提供计价时段,不能确认实际享受了该折扣。输出仍有 94,745 token。换项目、换缓存前缀、换时段或换计价规则后,不能直接沿用 $0.072。
“一次尝试成功”与“two turns”可以同时成立:前者是作者对任务完成的描述,后者是额度耗尽后的界面记录。两者都不能推出成功率、重试成本或平均耗时。
页面是否真的像素级高保真、动画是否无障碍、代码是否可维护,帖子没有独立验收证据。评论对“AI slop”的分歧也说明视觉质量判断受审美影响,不能替代功能测试。
要复核该现场报告,应固定模型标识 DeepSeek V4.1 Flash、DSH PTC mode、最大推理和相同设计 brief,明确是否使用官方 API、价格时段及缓存前缀。至少重复多次,记录首 token、总耗时、缓存输入、未缓存输入、输出、实际账单、turn 数和额度中断;再用移动端断点、交互、动画清理、资源加载和代码测试定义成功。原帖没有提供这些控制条件,因此本文不声称已自行复现。
DeepSeek V4.1 Flash