DeepSeek V4 Flash · 媒体来源 · 客户案例
Lightning AI 文章给出 2026-04-24 口径:Flash 约 60+ tokens/s、SWE-bench Verified 79.0%,并将 V4 的 1M 上下文与工具间持久推理作为架构背景。
DeepSeek 发布两款开源模型 V4-Pro 和 V4-Flash,已在全球生产环境运行(包括 Lightning AI 内部)。Lightning AI 优化工程师的初评:"编码是我主要用途——它很好。"
DeepSeek-V4-Pro:1.6T 总参数、49B 激活,面向深度推理与 agentic 编码
DeepSeek-V4-Flash:284B 总参数、13B 激活,面向速度与高吞吐流水线
两者均标准支持 1M token 上下文窗口
| 维度 | V3.2 | V4 |
|---|---|---|
| 上下文窗口 | 128K | 1M(标准) |
| KV 缓存 | baseline | V3.2 的 10%(CSA + HCA 混合压缩稀疏注意力架构) |
| 推理 FLOPs | baseline | V3.2 的 27%(1M tokens 下) |
| 工具调用间推理 | stateless,每次重新开始 | persistent,保留完整思维链,20 步流水线不丢上下文 |
| SWE-bench Verified | ~69% | Pro 80.6% / Flash 79.0% |
| DeepSeek V4-Pro | DeepSeek V4-Flash | DeepSeek V3.2 | Claude Opus 4.6 | |
|---|---|---|---|---|
| 上下文 | 1M | 1M | 128K | 1M |
| 输入价格/1M | $1.74(cache miss)/ $0.145(hit) | $0.14(miss)/ $0.028(hit) | $0.28 / $0.028 | $5.00 / $0.50 |
| 输出价格/1M | $3.48 | $0.28 | $0.42 | $25.00 |
| 开源 | ✅ MIT | ✅ MIT | ✅ MIT | ❌ |
| 速度(约) | ~33 tokens/s | 60+ tokens/s | ~35 tokens/s | 中等 |
| SWE-bench Verified | 80.6% | 79.0% | ~69% | 80.8% |
| LiveCodeBench | 93.5% | 91.6% | — | 88.8% |
| Codeforces | 3206 | 3052 | — | 未报告 |
| Terminal Bench 2.0 | 67.9% | 56.9% | — | 65.4% |
| GPQA Diamond | 90.1% | 88.1% | — | 91.3% |
V4-Pro 在 SWE-bench Verified 上 80.6%,距离 Claude Opus 4.6 仅 0.2 个点,而输出价格是后者的约 1/7($3.48 vs $25)
V4 的混合压缩注意力(CSA/HCA)把 1M 上下文的经济可行性做出来了
持久化的跨工具调用推理是 V4 在 Agent 场景的关键升级
定价与基准分数来源:DeepSeek V4 技术报告(Max reasoning 模式)与 Anthropic 定价页
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Lightning AI 博客 · Frances Fedoriska · 原文发布日期 2026-04-27 · 本站编辑日期 2026-09-20
打开原始来源DeepSeek V4 Flash
下载 Tabbit 客户端后检查模型可用性