DeepSeek V4 Flash · 媒体来源 · 平台遥测
BenchLM 的 0731 快照列出 1M 上下文、Agentic 51.9、Coding 48.5、Knowledge 61.1,并把多项分数回指官方报告。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
API model id:deepseek-v4-flash(0731 更新版)
发布:2026 年 7 月 31 日;类型:Proprietary / Reasoning
上下文窗口:1M;输入模态:text;输出模态:text
状态:active;Prompt caching 公布价 $0.003 / 百万缓存输入 tokens
| 类别 | 权重 | 分数 | 排名 |
|---|---|---|---|
| Agentic | 22% | 51.9 | 未排名 |
| Coding | 20% | 48.5 | 未排名 |
| Reasoning | 17% | 待定 | 未排名 |
| Knowledge | 12% | 61.1 | #42 of 57(27 百分位) |
| Math | 5% | 81.4 | 未排名 |
| Multilingual | 7% | 未测 | - |
| Multimodal | 12% | 未测 | - |
| Inst. Following | 5% | 未测 | - |
Coding
SWE-bench Verified:79%(最佳 96%,Claude Opus 5)
SWE-bench Pro:52.6%
LiveCodeBench Pass@1-COT:91.6%(仅落后 V4 Pro 0813 的 93.5% 1.9)
Codeforces:3052.0
SWE Multilingual:73.3%
Terminal-Bench 2.0:56.9%;Terminal-Bench 2.1:82.7%
NL2Repo:54.2%;deepSwe:54.4%;DSBench-FullStack:68.7%;DSBench-Hard:59.6%
Agentic
Terminal-Bench 2.0:56.9%;Terminal-Bench 2.1:82.7%
BrowseComp:73.2%
HLE w/ tools:45.1%
MCP Atlas:69%;Toolathlon:47.8%;Toolathlon-Verified:70.3%
CyberGym:76.7%
Agents' Last Exam:25.2%
AutomationBench:25.1%
Reasoning
MRCR 1M:78.7%;CorpusQA 1M:60.5%
Knowledge
HLE(Humanity's Last Exam):34.8%
与最强的基准记录相比仍有明显差距(如 SWE-bench Verified 落后 Claude Opus 5 达 17 个点),但在价格远低的前提下,代码与 Agent 场景的成绩处于可用水准
0731 更新版比早期版本有显著提升(deepSwe 7.3 → 54.4 同源数据)
BenchLM 备注:缺失字段保持"未公开"而非隐藏,分数仅在可展示的公开证据下显示
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
BenchLM.ai(模型基准与定价追踪站) · 作者未公开 · 原文发布日期 2026-07-31 · 本站编辑日期 2026-09-20
打开原始来源DeepSeek V4 Flash
下载 Tabbit 客户端后检查模型可用性