Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
官方DeepSeek V4.1 Flash

DeepSeek-V4.1-Flash 官方模型卡基准:Agent 优势与 Harness 边界

原始来源

Hugging Face(DeepSeek 官方模型卡)

作者DeepSeek-AI

Tabbit 整理2026-09-16

查看原文

一句话结论

官方模型卡显示,DeepSeek-V4.1-Flash 是 552B backbone、每 token 激活 8B(prefill)/16B(decode)的多模态 MoE;在指定最大推理力度和 Agent harness 下,Terminal-Bench 2.1 为 90.6、DeepSWE v1.1 为 74.2,均高于表中的 DeepSeek-V4-Flash,但这些数字证明的是“模型 + harness + 参数”的组合表现,不能外推为所有客户端或普通对话任务的统一能力。

适用场景

  • 适合判断的任务:代码 Agent、终端操作、仓库修改、工具调用、自动化,以及在固定评测条件下比较其与模型卡列出对照模型的表现;多模态能力可先用 MMMU-Pro、CVBench、DocVQA 和 RefCOCO-avg 做筛选。

  • 不适合外推的任务:把官方 Agent 分数外推到任意 Agent 框架、聊天产品、生产系统、长上下文真实业务或安全关键场景;不同 harness 的结果不能直接视为同一模型的固定分数。

  • 适用的模型版本:Hugging Face 上的 deepseek-ai/DeepSeek-V4.1-Flash 开源权重;API、产品端或后续修订版本需单独核对。

  • 测试环境或客户端:模型卡所列 Hugging Face 权重和本地推理方式;代码 Agent 结果使用 DeepSeek Harness Minimal mode,DeepSWE v1.1 另按官方要求使用 mini-SWE harness,SEC-Bench Pro 使用 Claude Code harness,视觉 Agent 使用 Claude Code harness。

  • 推理档位和参数:Instruct 表全部使用本地模型评测的 reasoning_effort=100;temperature=1.0、top_p=0.95。这不是托管 API 的参数写法,API 使用 low/high/max 等字符串档位。模型卡推荐 top_p=0.95 或 1.0、上下文窗口 1M tokens、max_tokens ≥ 256K。

测评方法

官方把结果分为 Base Model、Instruct Model,以及不同 Agent scaffold 的对照。

Base Model 的所有模型都在官方内部框架、相同评测设置下评估;模型卡规定分数相差不超过 0.3 时视为等效。表中的 shot 数随基准变化,不能把不同基准的分数当作同一尺度。

Instruct Model 支持 1–100 的连续推理力度。模型卡明确说明下表全部使用最大力度 reasoning_effort=100,采样为 temperature=1.0、top_p=0.95。模型卡先把代码 Agent 基准概括为 DeepSeek Harness Minimal mode 与 1M-token 上下文,再明确列出例外:DeepSWE v1.1 为遵循官方设置使用 mini-SWE,SEC-Bench Pro 使用 Claude Code。复现时应按具体基准的例外说明选择 harness。Chartography、BabyVision、ZeroBench 使用 Claude Code harness 和 512K-token 上下文;Agent's Last Exam 与 AutomationBench 使用各自官方 scaffold。模型卡称所有 Agent 评测均使用 temperature=1.0、top_p=0.95。

在 scaffold 对照中,DeepSWE v1.1 每题取 N=8 个样本,Terminal-Bench 2.1 每题取 N=3 个样本;使用 Linux 容器,max_steps=500,上下文上限 1M,采样仍为 temperature=1.0、top_p=0.95。Terminal-Bench 2.1 的该组评测不允许网络访问。

关键结果

模型卡的 Agent 对照表中,DeepSeek-V4.1-Flash 相对同表的 DeepSeek-V4-Flash,在 Terminal-Bench 2.1(90.6 vs 82.7)、Terminal-Bench 3.0(30.0 vs 7.6)、Terminal-Bench 4.0(31.2 vs 7.0)、DeepSWE v1.1(74.2 vs 54.4)、CyberGym(88.1 vs 76.7)和 AutomationBench(54.8 vs 37.7)上更高。HLE 的 36.8 与带 † 的 37.8 属于不同口径,不能直接比较;同为 text-only subset 的分数为 39.1† 与 37.8†。

模型卡还给出了同一模型跨 scaffold 的结果:DeepSWE v1.1 从 Claude Code 的 69.8 到 mini-SWE 的 74.2,Terminal-Bench 2.1 从 Codex 的 84.1 到 DSH Minimal 的 90.6。这个跨度足以说明 Agent scaffold 会改变可观测成绩。

原始数据

以下数字按官方模型卡抄录;— 表示模型卡未给出该列结果,† 是模型卡的脚注标记。

Base Model

Benchmark(指标)ShotsDeepSeek-V4-Flash-BaseDeepSeek-V4-Pro-BaseDeepSeek-V4.1-Flash-Base
Architecture—MoEMoEMoE
# Backbone Params—284B1.6T552B
# Activated Params—13B49B8B / 16B
AGIEval(EM)3–5-shot83.984.483.4
MMLU-Pro(EM)5-shot68.373.574.1
C-Eval(EM)5-shot92.193.192.1
MultiLoKo(LLM-Judge)5-shot42.650.945.5
SimpleQA-Verified(EM)25-shot30.155.242.3
SuperGPQA(EM)5-shot46.553.953.1
BBH(EM)3-shot86.987.586.1
BBEH(EM)1-shot25.429.827.2
DROP(F1)1-shot88.688.787.9
HellaSwag(EM)0-shot85.788.087.2
BigCodeBench(Pass@1)3-shot56.859.260.6
HumanEval(Pass@1)0-shot69.576.879.4
GSM8K(EM)8-shot90.892.693.0
MATH(EM)4-shot57.464.561.1
MGSM(EM)8-shot85.784.480.2
LongBench-V2(EM)1-shot44.751.545.2
MMMU-Pro(EM)4-shot——56.5
CVBench(EM)4-shot——77.9
DocVQA(LLM-Judge)4-shot——95.6
RefCOCO-avg(Acc@0.5)0-shot——86.0

Instruct Model:frontier 对照(最大推理力度)

Benchmark(指标)Opus-5.0GPT-5.6 SolK3GLM-5.3DS-V4-ProDS-V4-FlashDS-V4.1-Flash
GPQA Diamond(Pass@1)93.494.192.988.192.489.990.9
HLE(Pass@1)56.344.543.542.0†42.7†37.8†36.8(39.1†)
Codeforces(Rating)————334832893471
MathArena Apex(Pass@1)——65.6—65.358.665.6
Terminal-Bench 2.1(Pass@1)89.188.888.388.287.982.790.6
Terminal-Bench 3.0(Pass@1)43.334.417.728.311.87.630.0
Terminal-Bench 4.0(Pass@1)51.839.912.637.912.47.031.2
DeepSWE v1.1(Resolved)74.073.067.566.962.754.474.2
ProgramBench(Almost@1)37.023.017.519.015.5—20.3
NL2Repo-Bench(Score)75.356.858.058.061.554.264.0
CyberGym(Pass@1)—84.580.084.583.376.788.1
SEC-Bench Pro(Pass@1)—74.3——56.430.962.8
ExploitGym(Pass@1)22.133.7—15.05.41.815.3
HLE w/ tools(Pass@1)63.6—59.862.560.051.563.9
AutomationBench(Pass@1)50.345.846.748.843.237.754.8
Agent's Last Exam(Pass@1)28.626.727.628.525.725.231.8
Chartography w/ tools(Pass@1)84.079.968.1———78.9
BabyVision w/ tools(Pass@1)94.188.985.7———89.6
ZeroBench-main w/ tools(Pass@5)52.053.041.0———49.0

† 官方脚注:HLE 的 text-only subset。

跨 Agent scaffold

Benchmark(指标)Claude CodeCodexOpenCodePimini-SWEDSH MinimalDSH StandardDSH PTC
DeepSWE v1.1(Resolved)69.865.665.566.274.272.670.567.6
Terminal-Bench 2.1(Pass@1)88.084.185.086.190.390.685.885.8

结论与边界

  1. 官方结果的强信号在 Agent 任务分桶内。 在模型卡列出的固定设置下,V4.1-Flash 的 Terminal-Bench、DeepSWE、CyberGym 和 AutomationBench 成绩高于 V4-Flash,且 Codeforces rating 为 3471;这支持把它列为代码 Agent 和终端任务的候选模型。

  2. 基准不是统一能力分数。 Base 表使用不同 shot 数和不同指标;Instruct 表混合了 Pass@1、Pass@5、Resolved、Rating、Score 和 LLM-Judge,不能横向排序后得出单一“综合能力”。

  3. Harness 会改变结果。 同一模型在 DeepSWE v1.1 的 scaffold 结果为 65.5–74.2,在 Terminal-Bench 2.1 为 84.1–90.6。复测必须固定 Agent scaffold、工具协议、步数、上下文、网络和采样参数。

  4. 最大推理力度限制了外推。 官方 Instruct 结果全部为 reasoning_effort=100,不代表低力度或默认设置的表现;模型卡没有给出各基准随推理力度变化的曲线。

  5. 长上下文支持不等于长任务效果。 模型卡给出 1M-token context window 和 45.2 的 LongBench-V2 Base 结果,但没有提供业务数据、长会话失败样本或完整方差,不能据此保证任意 1M-token 工作流。

  6. 官方表不提供独立复核所需的全部信息。 页面没有在表格中公开每个基准的完整输入、输出、重复实验、置信区间和所有 harness 实现;其中部分对照列是外部模型名称,评测来源和运行细节不能仅凭表格完全还原。

  7. 效率与能力需要分开验证。 模型卡说明 552B 总 backbone、8B/16B 激活和 1M 上下文,但没有在这张结果表中给出统一硬件、量化、并发、吞吐和延迟数据,不能用参数规模直接推导生产成本。

复现说明

  1. 固定 Hugging Face 模型仓库的 commit、权重精度、tokenizer、推理引擎和 prompt encoding;模型卡说明该版本没有 Jinja chat template,仓库提供 encoding/encoding.py 参考实现。

  2. Instruct 复现先使用模型卡参数:reasoning_effort=100、temperature=1.0、top_p=0.95、1M 上下文;同时记录 max_tokens,不要把不同上下文上限的结果混在一起。

  3. 代码 Agent 按模型卡指定 harness 分开运行:DeepSeek Harness Minimal mode、mini-SWE、Claude Code 和各基准官方 scaffold;Terminal-Bench 2.1 复现时关闭网络,记录 Linux 容器、N、max_steps=500 和工具调用日志。

  4. 每个任务保存原始输入、模型输出、patch、测试结果、失败原因、工具调用数和 token 用量;对于 Pass@1、Pass@5、Resolved、Rating 等指标分别计算,不自行合并成总分。

  5. 先复现公开的 DeepSWE v1.1 与 Terminal-Bench 2.1,再在目标生产 Agent 中重复同一任务集;报告官方结果与自有 harness 结果的差异,并标明采集日期和模型 commit。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

DeepSeek V4.1 Flash

在 Tabbit 中使用并对比模型

DeepSeek V4.1 Flash

相关测评

社区X2026-09-15

DeepSeek-V4.1-Flash(Max)在 Agent Arena 的任务成本与净改进

社区X(Artificial Analysis)2026-09-11

Artificial Analysis:DeepSeek V4.1 Flash 的智能、成本与幻觉边界

媒体AI IQ

AI IQ 榜单中的 DeepSeek V4.1 Flash:综合分与基准覆盖率

社区Reddit,r/DeepSeek2026-09-15

DeepSeek V4.1 Flash 在 OpenCode 中修复旧代码:社区体验与误报边界

DeepSeek V4.1 Flash

相关提示词

官方DeepSeek API Docs

DeepSeek-V4.1-Flash:API 模型别名与首次调用

官方DeepSeek API Docs

DeepSeek V4.1 Flash 思考模式与推理参数配置

官方DeepSeek API Docs

DeepSeek V4.1 Flash:图像输入与视觉配置

官方DeepSeek API Docs

DeepSeek V4.1 Flash:JSON 问答抽取提示词