API model id:deepseek-v4-flash(0731 更新版)
发布:2026 年 7 月 31 日;类型:Proprietary / Reasoning
上下文窗口:1M;输入模态:text;输出模态:text
状态:active;Prompt caching 公布价 $0.003 / 百万缓存输入 tokens
| 类别 | 权重 | 分数 | 排名 |
|---|---|---|---|
| Agentic | 22% | 51.9 | 未排名 |
| Coding | 20% | 48.5 | 未排名 |
| Reasoning | 17% | 待定 | 未排名 |
| Knowledge | 12% | 61.1 | #42 of 57(27 百分位) |
| Math | 5% | 81.4 | 未排名 |
| Multilingual | 7% | 未测 | - |
| Multimodal | 12% | 未测 | - |
| Inst. Following | 5% | 未测 | - |
Coding
SWE-bench Verified:79%(最佳 96%,Claude Opus 5)
SWE-bench Pro:52.6%
LiveCodeBench Pass@1-COT:91.6%(仅落后 V4 Pro 0813 的 93.5% 1.9)
Codeforces:3052.0
SWE Multilingual:73.3%
Terminal-Bench 2.0:56.9%;Terminal-Bench 2.1:82.7%
NL2Repo:54.2%;deepSwe:54.4%;DSBench-FullStack:68.7%;DSBench-Hard:59.6%
Agentic
Terminal-Bench 2.0:56.9%;Terminal-Bench 2.1:82.7%
BrowseComp:73.2%
HLE w/ tools:45.1%
MCP Atlas:69%;Toolathlon:47.8%;Toolathlon-Verified:70.3%
CyberGym:76.7%
Agents' Last Exam:25.2%
AutomationBench:25.1%
Reasoning
MRCR 1M:78.7%;CorpusQA 1M:60.5%
Knowledge
HLE(Humanity's Last Exam):34.8%
与最强的基准记录相比仍有明显差距(如 SWE-bench Verified 落后 Claude Opus 5 达 17 个点),但在价格远低的前提下,代码与 Agent 场景的成绩处于可用水准
0731 更新版比早期版本有显著提升(deepSwe 7.3 → 54.4 同源数据)
BenchLM 备注:缺失字段保持"未公开"而非隐藏,分数仅在可展示的公开证据下显示
DeepSeek V4 Flash