DeepSeek 发布两款开源模型 V4-Pro 和 V4-Flash,已在全球生产环境运行(包括 Lightning AI 内部)。Lightning AI 优化工程师的初评:"编码是我主要用途——它很好。"
DeepSeek-V4-Pro:1.6T 总参数、49B 激活,面向深度推理与 agentic 编码
DeepSeek-V4-Flash:284B 总参数、13B 激活,面向速度与高吞吐流水线
两者均标准支持 1M token 上下文窗口
| 维度 | V3.2 | V4 |
|---|---|---|
| 上下文窗口 | 128K | 1M(标准) |
| KV 缓存 | baseline | V3.2 的 10%(CSA + HCA 混合压缩稀疏注意力架构) |
| 推理 FLOPs | baseline | V3.2 的 27%(1M tokens 下) |
| 工具调用间推理 | stateless,每次重新开始 | persistent,保留完整思维链,20 步流水线不丢上下文 |
| SWE-bench Verified | ~69% | Pro 80.6% / Flash 79.0% |
| DeepSeek V4-Pro | DeepSeek V4-Flash | DeepSeek V3.2 | Claude Opus 4.6 | |
|---|---|---|---|---|
| 上下文 | 1M | 1M | 128K | 1M |
| 输入价格/1M | $1.74(cache miss)/ $0.145(hit) | $0.14(miss)/ $0.028(hit) | $0.28 / $0.028 | $5.00 / $0.50 |
| 输出价格/1M | $3.48 | $0.28 | $0.42 | $25.00 |
| 开源 | ✅ MIT | ✅ MIT | ✅ MIT | ❌ |
| 速度(约) | ~33 tokens/s | 60+ tokens/s | ~35 tokens/s | 中等 |
| SWE-bench Verified | 80.6% | 79.0% | ~69% | 80.8% |
| LiveCodeBench | 93.5% | 91.6% | — | 88.8% |
| Codeforces | 3206 | 3052 | — | 未报告 |
| Terminal Bench 2.0 | 67.9% | 56.9% | — | 65.4% |
| GPQA Diamond | 90.1% | 88.1% | — | 91.3% |
V4-Pro 在 SWE-bench Verified 上 80.6%,距离 Claude Opus 4.6 仅 0.2 个点,而输出价格是后者的约 1/7($3.48 vs $25)
V4 的混合压缩注意力(CSA/HCA)把 1M 上下文的经济可行性做出来了
持久化的跨工具调用推理是 V4 在 Agent 场景的关键升级
定价与基准分数来源:DeepSeek V4 技术报告(Max reasoning 模式)与 Anthropic 定价页
DeepSeek V4 Flash