DeepSeek V4 Flash

DeepSeek V4 Flash · 测评与证据

DeepSeek V4 Flash,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

官方 0731 表列出 Terminal Bench 2.1 82.7、DeepSWE 54.4 与 Toolathlon Verified 70.3;条件是 DeepSeek Harness minimal mode、max、top_p 0.95、temperature 1.0。

DeepSeek API Docs · 查看证据

MindStudio 在双 DGX Spark 上报告约 25–30 tokens/s;4-bit 约 168GB、3-bit 约 110GB,两个小项目仍出现实时数据错误。

MindStudio · 查看证据

Reddit 作者在 OpenRouter 上用 25 个自动化任务比较 8 个 harness:Pi Agent 66.7% 通过率,OpenCode 46.7%,成功成本约 $0.028 与 $0.073。

Reddit r/DeepSeek · 查看证据

完整测评与相关内容

模型深度阅读

定价 · 简体中文

DeepSeek V4 Flash 价格:2026 年实际要花多少钱

DeepSeek V4 Flash 在 V4.1 迁移后更换了计费口径。本文解释缓存命中、峰谷时段和可复算的任务成本。

精选证据

官方厂商自报

官方 0731 Agent 基准与复现条件

官方 0731 表列出 Terminal Bench 2.1 82.7、DeepSWE 54.4 与 Toolathlon Verified 70.3;条件是 DeepSeek Harness minimal mode、max、top_p 0.95、temperature 1.0。

来源DeepSeek API Docs
原文日期2026-07-31
采集2026-08-18
测试/来源条件
0731 API;DeepSeek Harness minimal mode;max;top_p=0.95、temperature=1.0
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程推理
媒体 / 基准方独立测量

双 DGX Spark 上的本地部署与 Agent 现场报告

MindStudio 在双 DGX Spark 上报告约 25–30 tokens/s;4-bit 约 168GB、3-bit 约 110GB,两个小项目仍出现实时数据错误。

来源MindStudio
原文日期2026-08-01
采集2026-08-18
测试/来源条件
来源自报的现场/实验条件;完整样本、harness 或重复次数按原文,未补造
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程速度与延迟
社区独立测量

25 个任务上的 8 个 Agent harness 对比

Reddit 作者在 OpenRouter 上用 25 个自动化任务比较 8 个 harness:Pi Agent 66.7% 通过率,OpenCode 46.7%,成功成本约 $0.028 与 $0.073。

来源Reddit r/DeepSeek
原文日期未知
采集2026-08-17
测试/来源条件
OpenRouter;8 个 harness;25 个自动化任务;详见原帖方法
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程
媒体 / 基准方平台遥测

DeepSeek V4 Flash 0731:基准、定价与速度(BenchLM)

BenchLM 的 0731 快照列出 1M 上下文、Agentic 51.9、Coding 48.5、Knowledge 61.1,并把多项分数回指官方报告。

来源BenchLM.ai(模型基准与定价追踪站)
原文日期2026-07-31
采集2026-08-17

待验证:本次未能重新核实原文。

测试/来源条件
BenchLM/聚合模型卡的带日期快照;独立 harness 未公开
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
成本推理速度与延迟

全部来源

全部来源

24 / 24
官方厂商自报

官方 0731 Agent 基准与复现条件

官方 0731 表列出 Terminal Bench 2.1 82.7、DeepSWE 54.4 与 Toolathlon Verified 70.3;条件是 DeepSeek Harness minimal mode、max、top_p 0.95、temperature 1.0。

来源DeepSeek API Docs
原文日期2026-07-31
采集2026-08-18
测试/来源条件
0731 API;DeepSeek Harness minimal mode;max;top_p=0.95、temperature=1.0
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程推理
媒体 / 基准方独立测量

双 DGX Spark 上的本地部署与 Agent 现场报告

MindStudio 在双 DGX Spark 上报告约 25–30 tokens/s;4-bit 约 168GB、3-bit 约 110GB,两个小项目仍出现实时数据错误。

来源MindStudio
原文日期2026-08-01
采集2026-08-18
测试/来源条件
来源自报的现场/实验条件;完整样本、harness 或重复次数按原文,未补造
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程速度与延迟
社区独立测量

25 个任务上的 8 个 Agent harness 对比

Reddit 作者在 OpenRouter 上用 25 个自动化任务比较 8 个 harness:Pi Agent 66.7% 通过率,OpenCode 46.7%,成功成本约 $0.028 与 $0.073。

来源Reddit r/DeepSeek
原文日期未知
采集2026-08-17
测试/来源条件
OpenRouter;8 个 harness;25 个自动化任务;详见原帖方法
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程
媒体 / 基准方平台遥测

DeepSeek V4 Flash 0731:基准、定价与速度(BenchLM)

BenchLM 的 0731 快照列出 1M 上下文、Agentic 51.9、Coding 48.5、Knowledge 61.1,并把多项分数回指官方报告。

来源BenchLM.ai(模型基准与定价追踪站)
原文日期2026-07-31
采集2026-08-17

待验证:本次未能重新核实原文。

测试/来源条件
BenchLM/聚合模型卡的带日期快照;独立 harness 未公开
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
成本推理速度与延迟
官方编辑分析

DeepSeek V4 Flash 评测(2026):规格、测试与速度

独立站按 2026-07-25 口径列出 284B/13B、1M 上下文和价格,并用“benchmark maxed”概括现实一致性问题。

来源deepseek.ai(独立网站,与 DeepSeek 官方无关)
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

测试/来源条件
公开文章/图表的二次整理;测试配置或时效需重开核验
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
能力
社区独立测量

302.AI 基准实验室丨打破"轻量版"标签,DeepSeek-V4-Flash 实测:低成本挑战顶级 Agent

302.AI 实验室把 Flash 定位为低价 Agent 候选,并引用官方与自身测试材料;来源需区分厂商数字和实验室观察。

来源知乎专栏(zhuanlan.zhihu.com)
原文日期未知
采集2026-08-17
测试/来源条件
来源自报的现场/实验条件;完整样本、harness 或重复次数按原文,未补造
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
速度与延迟
社区个人体验

感谢 OpenCode!免费的 DeepSeek V4 Flash 好得过头了(Reddit r/opencodeCLI)

OpenCode 用户称免费 Flash 连续使用约 5–6 小时耗尽额度,约 7 小时后重置。

来源Reddit r/opencodeCLI
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

测试/来源条件
Reddit r/opencodeCLI;个人任务与客户端条件未形成统一受控样本
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程
社区个人体验

目前最便宜且好用的 DeepSeek V4 Flash 替代方案是什么?(Reddit r/hermesagent)

Hermes Agent 用户因 V4 涨价寻找更便宜替代品,重点关注质量、速度、缓存和免费额度;帖子没有统一候选实测。

来源Reddit r/hermesagent
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

测试/来源条件
Reddit r/hermesagent;个人任务与客户端条件未形成统一受控样本
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程
社区个人体验

什么是 DeepSeek 斩杀线?DeepSeek-V4-Flash 第一手测评来了!

程序员小灰用价格—能力坐标解释 Flash 的“斩杀线”,属于个人解读与资料复述。

来源知乎专栏(zhuanlan.zhihu.com)
原文日期2026-08-06
采集2026-08-17
测试/来源条件
知乎专栏(zhuanlan.zhihu.com);个人任务与客户端条件未形成统一受控样本
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
成本推理
社区个人体验

用大型代码变更评测测试 DeepSeek V4 Flash(Reddit r/LocalLLaMA)

作者称 Flash 在大型代码变更评估中工具使用和上下文管理突出,但没有公开题集、分数、版本或完整轨迹。

来源Reddit r/LocalLLaMA
原文日期未知
采集2026-08-17
测试/来源条件
Reddit r/LocalLLaMA;个人任务与客户端条件未形成统一受控样本
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程推理
社区个人体验

涨价后 DeepSeek V4 Flash 输出价为 $0.112/M(Reddit r/DeepSeek)

涨价后 Reddit 帖子转述 InferX 的第三方报价:输入 $0.056/M、输出约 $0.112/M;这是供应商方案而非统一测量。

来源Reddit r/DeepSeek
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

测试/来源条件
Reddit r/DeepSeek;个人任务与客户端条件未形成统一受控样本
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
成本
社区编辑分析

DeepSeek V4 逻辑测评

知乎文章主要讨论 V4 Pro/家族逻辑能力,Flash 只在家族背景中出现,不能直接当作 Flash 测评。

来源知乎专栏(zhuanlan.zhihu.com)
原文日期未知
采集2026-08-17
测试/来源条件
公开文章/图表的二次整理;测试配置或时效需重开核验
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
推理
社区独立测量

DeepSeek V4 模型的 Agent 能力实测

CowAgent 作者用六类真实场景观察工具调用、长上下文、长期记忆、浏览器自动化和知识组织。

来源博客园(cnblogs.com)
原文日期未知
采集2026-08-17
测试/来源条件
来源自报的现场/实验条件;完整样本、harness 或重复次数按原文,未补造
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程速度与延迟
社区个人体验

DeepSeek V4 Flash 不喜欢我们了吗?(Reddit r/opencodeCLI)

用户称涨价后只改 10 行代码就消耗 28% 配额,随后一条 commit message 达到 32%;没有 token 账本。

来源Reddit r/opencodeCLI
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

测试/来源条件
Reddit r/opencodeCLI;个人任务与客户端条件未形成统一受控样本
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程成本
媒体 / 基准方平台遥测

DeepSeek V4 Flash 第三方聚合平台数据(Command Code / flaq.ai / OpenRouter / benchlm 补充)

Command Code、flaq、OpenRouter 和 BenchLM 聚合模型 ID、价格和能力字段,采集窗口可能不同。

来源commandcode.ai
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

测试/来源条件
BenchLM/聚合模型卡的带日期快照;独立 harness 未公开
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
成本
社区个人体验

DeepSeek V4 Flash 是个怪物:便宜、好用而且很快(Reddit r/opencodeCLI)

OpenCode 用户主观认为 Flash 便宜、快且可替代部分 Claude/GPT 工作流,同时称 Pro 更慢更贵。

来源Reddit r/opencodeCLI
原文日期未知
采集2026-08-17
测试/来源条件
Reddit r/opencodeCLI;个人任务与客户端条件未形成统一受控样本
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程
社区编辑分析

DeepSeek V4 Flash 在这张图上画出了一条残酷的“斩杀线”(Reddit r/LocalLLM)

Reddit 将 Artificial Analysis 历史图表解释为 Flash 0731 约 50 的指数、每个加权任务约 $0.03 的“斩杀线”。

来源Reddit r/LocalLLM
原文日期未知
采集2026-08-17
测试/来源条件
公开文章/图表的二次整理;测试配置或时效需重开核验
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
成本
媒体 / 基准方客户案例

DeepSeek V4-Flash 正式版来了!AI 开发者实测:价格"很香" Agent 能力直追顶级模型

东方财富转述开发者案例:Hermes + Flash 约 40 秒完成任务,GPT + Codex 约 1 分 47 秒;另一任务约 51 万 tokens、0.53 元。

来源东方财富网(finance.eastmoney.com),来源:每日经济新闻
原文日期2026-08-02
采集2026-08-17
测试/来源条件
Hermes/Pi Agent 开发者案例;任务与计时非受控重复
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
成本速度与延迟
社区个人体验

DeepSeek V4-Flash/Pro 实测报告:从购买到实战,性价比天花板级国产大模型体验

CSDN 作者记录充值、API 配置、代码生成与排错,实际把 V4-Flash 和 V4-Pro 放在同一篇个人工作流中。

来源CSDN DeepSeek 技术社区(deepseek.csdn.net)
原文日期2026-05-06
采集2026-08-17
测试/来源条件
CSDN DeepSeek 技术社区(deepseek.csdn.net);个人任务与客户端条件未形成统一受控样本
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程速度与延迟
社区个人体验

DeepSeek-V4-Flash 使用体验:强大模型如何真正帮你完成工作?

博客园文章强调 V4-Flash 的推理、编码和 Agent 提升,并转述 DeepSWE 7.3→54.4;没有公开复测协议。

来源博客园(cnblogs.com)
原文日期2026-08-04
采集2026-08-17
测试/来源条件
博客园(cnblogs.com);个人任务与客户端条件未形成统一受控样本
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程速度与延迟
媒体 / 基准方客户案例

Lightning AI 的价格性能与架构观察

Lightning AI 文章给出 2026-04-24 口径:Flash 约 60+ tokens/s、SWE-bench Verified 79.0%,并将 V4 的 1M 上下文与工具间持久推理作为架构背景。

来源Lightning AI 博客
原文日期2026-04-27
采集2026-08-17
测试/来源条件
Lightning AI 内部使用;Pro/Flash 与 2026-04-24 价格口径分开
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
成本
社区个人体验

X 用户实测:0424 与 0731 版本对比、涨价后的成本体感(Wyq / ch1lam)

X 用户偏好 0424,认为 0731 涨价后非编码任务的成本体验变差;这是版本分开的个人意见。

来源X(Twitter)
原文日期2026-08-17
采集2026-08-17

待验证:本次未能重新核实原文。

测试/来源条件
X(Twitter);个人任务与客户端条件未形成统一受控样本
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
成本
社区个人体验

X 用户实测:一个提示修复 hypervisor 调度、本地 GPU 逆向 Chrome 扩展(jtregunna / 0xRaghuboi)

X 帖子报告一次提示修复 hypervisor 客户机调度,另一条报告本地 GPU 逆向 Chrome 扩展;都没有 diff、测试或完整输入。

来源X(Twitter)
原文日期2026-08-17
采集2026-08-17

待验证:本次未能重新核实原文。

测试/来源条件
X(Twitter);个人任务与客户端条件未形成统一受控样本
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
Agent编程
社区个人体验

X(Twitter)实测反馈汇总:涨价前后的真实用户声音

这条 X 汇总复用了 0424/0731 的涨价反馈,没有新增独立任务、样本或计费数据。

来源X(Twitter)
原文日期未知
采集2026-08-17

待验证:本次未能重新核实原文。

测试/来源条件
X(Twitter);个人任务与客户端条件未形成统一受控样本
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新
速度与延迟

DeepSeek V4 Flash

在 Tabbit 中比较 DeepSeek V4 Flash

客户端中的模型、功能和权限以当前账户为准。