官方模型卡显示,DeepSeek-V4.1-Flash 是 552B backbone、每 token 激活 8B(prefill)/16B(decode)的多模态 MoE;在指定最大推理力度和 Agent harness 下,Terminal-Bench 2.1 为 90.6、DeepSWE v1.1 为 74.2,均高于表中的 DeepSeek-V4-Flash,但这些数字证明的是“模型 + harness + 参数”的组合表现,不能外推为所有客户端或普通对话任务的统一能力。
适合判断的任务:代码 Agent、终端操作、仓库修改、工具调用、自动化,以及在固定评测条件下比较其与模型卡列出对照模型的表现;多模态能力可先用 MMMU-Pro、CVBench、DocVQA 和 RefCOCO-avg 做筛选。
不适合外推的任务:把官方 Agent 分数外推到任意 Agent 框架、聊天产品、生产系统、长上下文真实业务或安全关键场景;不同 harness 的结果不能直接视为同一模型的固定分数。
适用的模型版本:Hugging Face 上的 deepseek-ai/DeepSeek-V4.1-Flash 开源权重;API、产品端或后续修订版本需单独核对。
测试环境或客户端:模型卡所列 Hugging Face 权重和本地推理方式;代码 Agent 结果使用 DeepSeek Harness Minimal mode,DeepSWE v1.1 另按官方要求使用 mini-SWE harness,SEC-Bench Pro 使用 Claude Code harness,视觉 Agent 使用 Claude Code harness。
推理档位和参数:Instruct 表全部使用本地模型评测的 reasoning_effort=100;temperature=1.0、top_p=0.95。这不是托管 API 的参数写法,API 使用 low/high/max 等字符串档位。模型卡推荐 top_p=0.95 或 1.0、上下文窗口 1M tokens、max_tokens ≥ 256K。
官方把结果分为 Base Model、Instruct Model,以及不同 Agent scaffold 的对照。
Base Model 的所有模型都在官方内部框架、相同评测设置下评估;模型卡规定分数相差不超过 0.3 时视为等效。表中的 shot 数随基准变化,不能把不同基准的分数当作同一尺度。
Instruct Model 支持 1–100 的连续推理力度。模型卡明确说明下表全部使用最大力度 reasoning_effort=100,采样为 temperature=1.0、top_p=0.95。模型卡先把代码 Agent 基准概括为 DeepSeek Harness Minimal mode 与 1M-token 上下文,再明确列出例外:DeepSWE v1.1 为遵循官方设置使用 mini-SWE,SEC-Bench Pro 使用 Claude Code。复现时应按具体基准的例外说明选择 harness。Chartography、BabyVision、ZeroBench 使用 Claude Code harness 和 512K-token 上下文;Agent's Last Exam 与 AutomationBench 使用各自官方 scaffold。模型卡称所有 Agent 评测均使用 temperature=1.0、top_p=0.95。
在 scaffold 对照中,DeepSWE v1.1 每题取 N=8 个样本,Terminal-Bench 2.1 每题取 N=3 个样本;使用 Linux 容器,max_steps=500,上下文上限 1M,采样仍为 temperature=1.0、top_p=0.95。Terminal-Bench 2.1 的该组评测不允许网络访问。
模型卡的 Agent 对照表中,DeepSeek-V4.1-Flash 相对同表的 DeepSeek-V4-Flash,在 Terminal-Bench 2.1(90.6 vs 82.7)、Terminal-Bench 3.0(30.0 vs 7.6)、Terminal-Bench 4.0(31.2 vs 7.0)、DeepSWE v1.1(74.2 vs 54.4)、CyberGym(88.1 vs 76.7)和 AutomationBench(54.8 vs 37.7)上更高。HLE 的 36.8 与带 † 的 37.8 属于不同口径,不能直接比较;同为 text-only subset 的分数为 39.1† 与 37.8†。
模型卡还给出了同一模型跨 scaffold 的结果:DeepSWE v1.1 从 Claude Code 的 69.8 到 mini-SWE 的 74.2,Terminal-Bench 2.1 从 Codex 的 84.1 到 DSH Minimal 的 90.6。这个跨度足以说明 Agent scaffold 会改变可观测成绩。
以下数字按官方模型卡抄录;— 表示模型卡未给出该列结果,† 是模型卡的脚注标记。
| Benchmark(指标) | Shots | DeepSeek-V4-Flash-Base | DeepSeek-V4-Pro-Base | DeepSeek-V4.1-Flash-Base |
|---|---|---|---|---|
| Architecture | — | MoE | MoE | MoE |
| # Backbone Params | — | 284B | 1.6T | 552B |
| # Activated Params | — | 13B | 49B | 8B / 16B |
| AGIEval(EM) | 3–5-shot | 83.9 | 84.4 | 83.4 |
| MMLU-Pro(EM) | 5-shot | 68.3 | 73.5 | 74.1 |
| C-Eval(EM) | 5-shot | 92.1 | 93.1 | 92.1 |
| MultiLoKo(LLM-Judge) | 5-shot | 42.6 | 50.9 | 45.5 |
| SimpleQA-Verified(EM) | 25-shot | 30.1 | 55.2 | 42.3 |
| SuperGPQA(EM) | 5-shot | 46.5 | 53.9 | 53.1 |
| BBH(EM) | 3-shot | 86.9 | 87.5 | 86.1 |
| BBEH(EM) | 1-shot | 25.4 | 29.8 | 27.2 |
| DROP(F1) | 1-shot | 88.6 | 88.7 | 87.9 |
| HellaSwag(EM) | 0-shot | 85.7 | 88.0 | 87.2 |
| BigCodeBench(Pass@1) | 3-shot | 56.8 | 59.2 | 60.6 |
| HumanEval(Pass@1) | 0-shot | 69.5 | 76.8 | 79.4 |
| GSM8K(EM) | 8-shot | 90.8 | 92.6 | 93.0 |
| MATH(EM) | 4-shot | 57.4 | 64.5 | 61.1 |
| MGSM(EM) | 8-shot | 85.7 | 84.4 | 80.2 |
| LongBench-V2(EM) | 1-shot | 44.7 | 51.5 | 45.2 |
| MMMU-Pro(EM) | 4-shot | — | — | 56.5 |
| CVBench(EM) | 4-shot | — | — | 77.9 |
| DocVQA(LLM-Judge) | 4-shot | — | — | 95.6 |
| RefCOCO-avg(Acc@0.5) | 0-shot | — | — | 86.0 |
| Benchmark(指标) | Opus-5.0 | GPT-5.6 Sol | K3 | GLM-5.3 | DS-V4-Pro | DS-V4-Flash | DS-V4.1-Flash |
|---|---|---|---|---|---|---|---|
| GPQA Diamond(Pass@1) | 93.4 | 94.1 | 92.9 | 88.1 | 92.4 | 89.9 | 90.9 |
| HLE(Pass@1) | 56.3 | 44.5 | 43.5 | 42.0† | 42.7† | 37.8† | 36.8(39.1†) |
| Codeforces(Rating) | — | — | — | — | 3348 | 3289 | 3471 |
| MathArena Apex(Pass@1) | — | — | 65.6 | — | 65.3 | 58.6 | 65.6 |
| Terminal-Bench 2.1(Pass@1) | 89.1 | 88.8 | 88.3 | 88.2 | 87.9 | 82.7 | 90.6 |
| Terminal-Bench 3.0(Pass@1) | 43.3 | 34.4 | 17.7 | 28.3 | 11.8 | 7.6 | 30.0 |
| Terminal-Bench 4.0(Pass@1) | 51.8 | 39.9 | 12.6 | 37.9 | 12.4 | 7.0 | 31.2 |
| DeepSWE v1.1(Resolved) | 74.0 | 73.0 | 67.5 | 66.9 | 62.7 | 54.4 | 74.2 |
| ProgramBench(Almost@1) | 37.0 | 23.0 | 17.5 | 19.0 | 15.5 | — | 20.3 |
| NL2Repo-Bench(Score) | 75.3 | 56.8 | 58.0 | 58.0 | 61.5 | 54.2 | 64.0 |
| CyberGym(Pass@1) | — | 84.5 | 80.0 | 84.5 | 83.3 | 76.7 | 88.1 |
| SEC-Bench Pro(Pass@1) | — | 74.3 | — | — | 56.4 | 30.9 | 62.8 |
| ExploitGym(Pass@1) | 22.1 | 33.7 | — | 15.0 | 5.4 | 1.8 | 15.3 |
| HLE w/ tools(Pass@1) | 63.6 | — | 59.8 | 62.5 | 60.0 | 51.5 | 63.9 |
| AutomationBench(Pass@1) | 50.3 | 45.8 | 46.7 | 48.8 | 43.2 | 37.7 | 54.8 |
| Agent's Last Exam(Pass@1) | 28.6 | 26.7 | 27.6 | 28.5 | 25.7 | 25.2 | 31.8 |
| Chartography w/ tools(Pass@1) | 84.0 | 79.9 | 68.1 | — | — | — | 78.9 |
| BabyVision w/ tools(Pass@1) | 94.1 | 88.9 | 85.7 | — | — | — | 89.6 |
| ZeroBench-main w/ tools(Pass@5) | 52.0 | 53.0 | 41.0 | — | — | — | 49.0 |
† 官方脚注:HLE 的 text-only subset。
| Benchmark(指标) | Claude Code | Codex | OpenCode | Pi | mini-SWE | DSH Minimal | DSH Standard | DSH PTC |
|---|---|---|---|---|---|---|---|---|
| DeepSWE v1.1(Resolved) | 69.8 | 65.6 | 65.5 | 66.2 | 74.2 | 72.6 | 70.5 | 67.6 |
| Terminal-Bench 2.1(Pass@1) | 88.0 | 84.1 | 85.0 | 86.1 | 90.3 | 90.6 | 85.8 | 85.8 |
官方结果的强信号在 Agent 任务分桶内。 在模型卡列出的固定设置下,V4.1-Flash 的 Terminal-Bench、DeepSWE、CyberGym 和 AutomationBench 成绩高于 V4-Flash,且 Codeforces rating 为 3471;这支持把它列为代码 Agent 和终端任务的候选模型。
基准不是统一能力分数。 Base 表使用不同 shot 数和不同指标;Instruct 表混合了 Pass@1、Pass@5、Resolved、Rating、Score 和 LLM-Judge,不能横向排序后得出单一“综合能力”。
Harness 会改变结果。 同一模型在 DeepSWE v1.1 的 scaffold 结果为 65.5–74.2,在 Terminal-Bench 2.1 为 84.1–90.6。复测必须固定 Agent scaffold、工具协议、步数、上下文、网络和采样参数。
最大推理力度限制了外推。 官方 Instruct 结果全部为 reasoning_effort=100,不代表低力度或默认设置的表现;模型卡没有给出各基准随推理力度变化的曲线。
长上下文支持不等于长任务效果。 模型卡给出 1M-token context window 和 45.2 的 LongBench-V2 Base 结果,但没有提供业务数据、长会话失败样本或完整方差,不能据此保证任意 1M-token 工作流。
官方表不提供独立复核所需的全部信息。 页面没有在表格中公开每个基准的完整输入、输出、重复实验、置信区间和所有 harness 实现;其中部分对照列是外部模型名称,评测来源和运行细节不能仅凭表格完全还原。
效率与能力需要分开验证。 模型卡说明 552B 总 backbone、8B/16B 激活和 1M 上下文,但没有在这张结果表中给出统一硬件、量化、并发、吞吐和延迟数据,不能用参数规模直接推导生产成本。
固定 Hugging Face 模型仓库的 commit、权重精度、tokenizer、推理引擎和 prompt encoding;模型卡说明该版本没有 Jinja chat template,仓库提供 encoding/encoding.py 参考实现。
Instruct 复现先使用模型卡参数:reasoning_effort=100、temperature=1.0、top_p=0.95、1M 上下文;同时记录 max_tokens,不要把不同上下文上限的结果混在一起。
代码 Agent 按模型卡指定 harness 分开运行:DeepSeek Harness Minimal mode、mini-SWE、Claude Code 和各基准官方 scaffold;Terminal-Bench 2.1 复现时关闭网络,记录 Linux 容器、N、max_steps=500 和工具调用日志。
每个任务保存原始输入、模型输出、patch、测试结果、失败原因、工具调用数和 token 用量;对于 Pass@1、Pass@5、Resolved、Rating 等指标分别计算,不自行合并成总分。
先复现公开的 DeepSWE v1.1 与 Terminal-Bench 2.1,再在目标生产 Agent 中重复同一任务集;报告官方结果与自有 harness 结果的差异,并标明采集日期和模型 commit。
DeepSeek V4.1 Flash