Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

DeepSeek V4 Flash · 媒体来源 · 平台遥测

DeepSeek V4 Flash 0731:基准、定价与速度(BenchLM)

BenchLM 的 0731 快照列出 1M 上下文、Agentic 51.9、Coding 48.5、Knowledge 61.1,并把多项分数回指官方报告。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源平台遥测编辑日期 2026-09-20

测试条件速查

测试/来源条件
BenchLM/聚合模型卡的带日期快照;独立 harness 未公开
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新

关键数据与适用场景

模型信息

  • API model id:deepseek-v4-flash(0731 更新版)

  • 发布:2026 年 7 月 31 日;类型:Proprietary / Reasoning

  • 上下文窗口:1M;输入模态:text;输出模态:text

  • 状态:active;Prompt caching 公布价 $0.003 / 百万缓存输入 tokens

分类得分与排名

类别权重分数排名
Agentic22%51.9未排名
Coding20%48.5未排名
Reasoning17%待定未排名
Knowledge12%61.1#42 of 57(27 百分位)
Math5%81.4未排名
Multilingual7%未测-
Multimodal12%未测-
Inst. Following5%未测-

关键基准成绩(官方技术报告 / 0731 更新)

Coding

  • SWE-bench Verified:79%(最佳 96%,Claude Opus 5)

  • SWE-bench Pro:52.6%

  • LiveCodeBench Pass@1-COT:91.6%(仅落后 V4 Pro 0813 的 93.5% 1.9)

  • Codeforces:3052.0

  • SWE Multilingual:73.3%

  • Terminal-Bench 2.0:56.9%;Terminal-Bench 2.1:82.7%

  • NL2Repo:54.2%;deepSwe:54.4%;DSBench-FullStack:68.7%;DSBench-Hard:59.6%

Agentic

  • Terminal-Bench 2.0:56.9%;Terminal-Bench 2.1:82.7%

  • BrowseComp:73.2%

  • HLE w/ tools:45.1%

  • MCP Atlas:69%;Toolathlon:47.8%;Toolathlon-Verified:70.3%

  • CyberGym:76.7%

  • Agents' Last Exam:25.2%

  • AutomationBench:25.1%

Reasoning

  • MRCR 1M:78.7%;CorpusQA 1M:60.5%

Knowledge

  • HLE(Humanity's Last Exam):34.8%

要点解读

  • 与最强的基准记录相比仍有明显差距(如 SWE-bench Verified 落后 Claude Opus 5 达 17 个点),但在价格远低的前提下,代码与 Agent 场景的成绩处于可用水准

  • 0731 更新版比早期版本有显著提升(deepSwe 7.3 → 54.4 同源数据)

  • BenchLM 备注:缺失字段保持"未公开"而非隐藏,分数仅在可展示的公开证据下显示

能支持的判断

  • 支持按 2026-08-17 快照追溯模型 ID、分类分数和缺失字段。

不能支持的判断

  • 不支持把聚合账本当作独立测量,也不支持把快照价格或排名写成当前事实。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

BenchLM.ai(模型基准与定价追踪站) · 作者未公开 · 原文发布日期 2026-07-31 · 本站编辑日期 2026-09-20

打开原始来源

DeepSeek V4 Flash

在 Tabbit 中比较 DeepSeek V4 Flash

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

定价 · 简体中文

DeepSeek V4 Flash 价格:2026 年实际要花多少钱

DeepSeek V4 Flash 在 V4.1 迁移后更换了计费口径。本文解释缓存命中、峰谷时段和可复算的任务成本。

相关评测

DeepSeek V4-Flash 正式版来了!AI 开发者实测:价格"很香" Agent 能力直追顶级模型东方财富转述开发者案例:Hermes + Flash 约 40 秒完成任务,GPT + Codex 约 1 分 47 秒;另一任务约 51 万 tokens、0.53 元。什么是 DeepSeek 斩杀线?DeepSeek-V4-Flash 第一手测评来了!程序员小灰用价格—能力坐标解释 Flash 的“斩杀线”,属于个人解读与资料复述。双 DGX Spark 上的本地部署与 Agent 现场报告MindStudio 在双 DGX Spark 上报告约 25–30 tokens/s;4-bit 约 168GB、3-bit 约 110GB,两个小项目仍出现实时数据错误。官方 0731 Agent 基准与复现条件官方 0731 表列出 Terminal Bench 2.1 82.7、DeepSWE 54.4 与 Toolathlon Verified 70.3;条件是 DeepSeek Harness minimal mode、max、top_p 0.95、temperature 1.0。配置思考档位并正确续接工具调用把 low/high/max、工具结果和 reasoning_content 的回传顺序整理成可复查的接入步骤。用官方配置把 DeepSeek 接入 Codex先备份本地配置,再用官方脚本或最小 provider 字段接入 Responses API,并用可回滚任务验证。用 DSH 分层委派并汇总专论来源公开了完整起始提示词:一级研究、二级反驳与编辑、最终综合,目标是单一有引用的 Markdown 产物。用 CRISPE 框架组织 DeepSeek 任务把角色、请求、背景、约束、风格和多方案尝试写成明确的任务合同。