官方 0731 表列出 Terminal Bench 2.1 82.7、DeepSWE 54.4 与 Toolathlon Verified 70.3;条件是 DeepSeek Harness minimal mode、max、top_p 0.95、temperature 1.0。
DeepSeek API Docs · 查看证据DeepSeek V4 Flash · 测评与证据
DeepSeek V4 Flash,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
MindStudio 在双 DGX Spark 上报告约 25–30 tokens/s;4-bit 约 168GB、3-bit 约 110GB,两个小项目仍出现实时数据错误。
MindStudio · 查看证据Reddit 作者在 OpenRouter 上用 25 个自动化任务比较 8 个 harness:Pi Agent 66.7% 通过率,OpenCode 46.7%,成功成本约 $0.028 与 $0.073。
Reddit r/DeepSeek · 查看证据完整测评与相关内容
精选证据
官方 0731 Agent 基准与复现条件
官方 0731 表列出 Terminal Bench 2.1 82.7、DeepSWE 54.4 与 Toolathlon Verified 70.3;条件是 DeepSeek Harness minimal mode、max、top_p 0.95、temperature 1.0。
- 测试/来源条件
- 0731 API;DeepSeek Harness minimal mode;max;top_p=0.95、temperature=1.0
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
双 DGX Spark 上的本地部署与 Agent 现场报告
MindStudio 在双 DGX Spark 上报告约 25–30 tokens/s;4-bit 约 168GB、3-bit 约 110GB,两个小项目仍出现实时数据错误。
- 测试/来源条件
- 来源自报的现场/实验条件;完整样本、harness 或重复次数按原文,未补造
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
25 个任务上的 8 个 Agent harness 对比
Reddit 作者在 OpenRouter 上用 25 个自动化任务比较 8 个 harness:Pi Agent 66.7% 通过率,OpenCode 46.7%,成功成本约 $0.028 与 $0.073。
- 测试/来源条件
- OpenRouter;8 个 harness;25 个自动化任务;详见原帖方法
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
DeepSeek V4 Flash 0731:基准、定价与速度(BenchLM)
BenchLM 的 0731 快照列出 1M 上下文、Agentic 51.9、Coding 48.5、Knowledge 61.1,并把多项分数回指官方报告。
待验证:本次未能重新核实原文。
- 测试/来源条件
- BenchLM/聚合模型卡的带日期快照;独立 harness 未公开
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
全部来源
全部来源
官方 0731 Agent 基准与复现条件
官方 0731 表列出 Terminal Bench 2.1 82.7、DeepSWE 54.4 与 Toolathlon Verified 70.3;条件是 DeepSeek Harness minimal mode、max、top_p 0.95、temperature 1.0。
- 测试/来源条件
- 0731 API;DeepSeek Harness minimal mode;max;top_p=0.95、temperature=1.0
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
双 DGX Spark 上的本地部署与 Agent 现场报告
MindStudio 在双 DGX Spark 上报告约 25–30 tokens/s;4-bit 约 168GB、3-bit 约 110GB,两个小项目仍出现实时数据错误。
- 测试/来源条件
- 来源自报的现场/实验条件;完整样本、harness 或重复次数按原文,未补造
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
25 个任务上的 8 个 Agent harness 对比
Reddit 作者在 OpenRouter 上用 25 个自动化任务比较 8 个 harness:Pi Agent 66.7% 通过率,OpenCode 46.7%,成功成本约 $0.028 与 $0.073。
- 测试/来源条件
- OpenRouter;8 个 harness;25 个自动化任务;详见原帖方法
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
DeepSeek V4 Flash 0731:基准、定价与速度(BenchLM)
BenchLM 的 0731 快照列出 1M 上下文、Agentic 51.9、Coding 48.5、Knowledge 61.1,并把多项分数回指官方报告。
待验证:本次未能重新核实原文。
- 测试/来源条件
- BenchLM/聚合模型卡的带日期快照;独立 harness 未公开
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
DeepSeek V4 Flash 评测(2026):规格、测试与速度
独立站按 2026-07-25 口径列出 284B/13B、1M 上下文和价格,并用“benchmark maxed”概括现实一致性问题。
待验证:本次未能重新核实原文。
- 测试/来源条件
- 公开文章/图表的二次整理;测试配置或时效需重开核验
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
302.AI 基准实验室丨打破"轻量版"标签,DeepSeek-V4-Flash 实测:低成本挑战顶级 Agent
302.AI 实验室把 Flash 定位为低价 Agent 候选,并引用官方与自身测试材料;来源需区分厂商数字和实验室观察。
- 测试/来源条件
- 来源自报的现场/实验条件;完整样本、harness 或重复次数按原文,未补造
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
感谢 OpenCode!免费的 DeepSeek V4 Flash 好得过头了(Reddit r/opencodeCLI)
OpenCode 用户称免费 Flash 连续使用约 5–6 小时耗尽额度,约 7 小时后重置。
待验证:本次未能重新核实原文。
- 测试/来源条件
- Reddit r/opencodeCLI;个人任务与客户端条件未形成统一受控样本
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
目前最便宜且好用的 DeepSeek V4 Flash 替代方案是什么?(Reddit r/hermesagent)
Hermes Agent 用户因 V4 涨价寻找更便宜替代品,重点关注质量、速度、缓存和免费额度;帖子没有统一候选实测。
待验证:本次未能重新核实原文。
- 测试/来源条件
- Reddit r/hermesagent;个人任务与客户端条件未形成统一受控样本
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
什么是 DeepSeek 斩杀线?DeepSeek-V4-Flash 第一手测评来了!
程序员小灰用价格—能力坐标解释 Flash 的“斩杀线”,属于个人解读与资料复述。
- 测试/来源条件
- 知乎专栏(zhuanlan.zhihu.com);个人任务与客户端条件未形成统一受控样本
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
用大型代码变更评测测试 DeepSeek V4 Flash(Reddit r/LocalLLaMA)
作者称 Flash 在大型代码变更评估中工具使用和上下文管理突出,但没有公开题集、分数、版本或完整轨迹。
- 测试/来源条件
- Reddit r/LocalLLaMA;个人任务与客户端条件未形成统一受控样本
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
涨价后 DeepSeek V4 Flash 输出价为 $0.112/M(Reddit r/DeepSeek)
涨价后 Reddit 帖子转述 InferX 的第三方报价:输入 $0.056/M、输出约 $0.112/M;这是供应商方案而非统一测量。
待验证:本次未能重新核实原文。
- 测试/来源条件
- Reddit r/DeepSeek;个人任务与客户端条件未形成统一受控样本
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
DeepSeek V4 逻辑测评
知乎文章主要讨论 V4 Pro/家族逻辑能力,Flash 只在家族背景中出现,不能直接当作 Flash 测评。
- 测试/来源条件
- 公开文章/图表的二次整理;测试配置或时效需重开核验
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
DeepSeek V4 模型的 Agent 能力实测
CowAgent 作者用六类真实场景观察工具调用、长上下文、长期记忆、浏览器自动化和知识组织。
- 测试/来源条件
- 来源自报的现场/实验条件;完整样本、harness 或重复次数按原文,未补造
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
DeepSeek V4 Flash 不喜欢我们了吗?(Reddit r/opencodeCLI)
用户称涨价后只改 10 行代码就消耗 28% 配额,随后一条 commit message 达到 32%;没有 token 账本。
待验证:本次未能重新核实原文。
- 测试/来源条件
- Reddit r/opencodeCLI;个人任务与客户端条件未形成统一受控样本
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
DeepSeek V4 Flash 第三方聚合平台数据(Command Code / flaq.ai / OpenRouter / benchlm 补充)
Command Code、flaq、OpenRouter 和 BenchLM 聚合模型 ID、价格和能力字段,采集窗口可能不同。
待验证:本次未能重新核实原文。
- 测试/来源条件
- BenchLM/聚合模型卡的带日期快照;独立 harness 未公开
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
DeepSeek V4 Flash 是个怪物:便宜、好用而且很快(Reddit r/opencodeCLI)
OpenCode 用户主观认为 Flash 便宜、快且可替代部分 Claude/GPT 工作流,同时称 Pro 更慢更贵。
- 测试/来源条件
- Reddit r/opencodeCLI;个人任务与客户端条件未形成统一受控样本
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
DeepSeek V4 Flash 在这张图上画出了一条残酷的“斩杀线”(Reddit r/LocalLLM)
Reddit 将 Artificial Analysis 历史图表解释为 Flash 0731 约 50 的指数、每个加权任务约 $0.03 的“斩杀线”。
- 测试/来源条件
- 公开文章/图表的二次整理;测试配置或时效需重开核验
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
DeepSeek V4-Flash 正式版来了!AI 开发者实测:价格"很香" Agent 能力直追顶级模型
东方财富转述开发者案例:Hermes + Flash 约 40 秒完成任务,GPT + Codex 约 1 分 47 秒;另一任务约 51 万 tokens、0.53 元。
- 测试/来源条件
- Hermes/Pi Agent 开发者案例;任务与计时非受控重复
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
DeepSeek V4-Flash/Pro 实测报告:从购买到实战,性价比天花板级国产大模型体验
CSDN 作者记录充值、API 配置、代码生成与排错,实际把 V4-Flash 和 V4-Pro 放在同一篇个人工作流中。
- 测试/来源条件
- CSDN DeepSeek 技术社区(deepseek.csdn.net);个人任务与客户端条件未形成统一受控样本
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
DeepSeek-V4-Flash 使用体验:强大模型如何真正帮你完成工作?
博客园文章强调 V4-Flash 的推理、编码和 Agent 提升,并转述 DeepSWE 7.3→54.4;没有公开复测协议。
- 测试/来源条件
- 博客园(cnblogs.com);个人任务与客户端条件未形成统一受控样本
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Lightning AI 的价格性能与架构观察
Lightning AI 文章给出 2026-04-24 口径:Flash 约 60+ tokens/s、SWE-bench Verified 79.0%,并将 V4 的 1M 上下文与工具间持久推理作为架构背景。
- 测试/来源条件
- Lightning AI 内部使用;Pro/Flash 与 2026-04-24 价格口径分开
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
X 用户实测:0424 与 0731 版本对比、涨价后的成本体感(Wyq / ch1lam)
X 用户偏好 0424,认为 0731 涨价后非编码任务的成本体验变差;这是版本分开的个人意见。
待验证:本次未能重新核实原文。
- 测试/来源条件
- X(Twitter);个人任务与客户端条件未形成统一受控样本
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
X 用户实测:一个提示修复 hypervisor 调度、本地 GPU 逆向 Chrome 扩展(jtregunna / 0xRaghuboi)
X 帖子报告一次提示修复 hypervisor 客户机调度,另一条报告本地 GPU 逆向 Chrome 扩展;都没有 diff、测试或完整输入。
待验证:本次未能重新核实原文。
- 测试/来源条件
- X(Twitter);个人任务与客户端条件未形成统一受控样本
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新
X(Twitter)实测反馈汇总:涨价前后的真实用户声音
这条 X 汇总复用了 0424/0731 的涨价反馈,没有新增独立任务、样本或计费数据。
待验证:本次未能重新核实原文。
- 测试/来源条件
- X(Twitter);个人任务与客户端条件未形成统一受控样本
- 模型版本
- DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
- 采集边界
- 既有来源笔记采集于 2026-08-17/18;动态事实待刷新