Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体DeepSeek V4 Flash

DeepSeek V4 Flash 0731 Benchmarks, Pricing & Speed(BenchLM)

原始来源

BenchLM.ai(模型基准与定价追踪站)

原文日期2026-07-31

Tabbit 整理2026-08-19

查看原文

模型信息

  • API model id:deepseek-v4-flash(0731 更新版)

  • 发布:2026 年 7 月 31 日;类型:Proprietary / Reasoning

  • 上下文窗口:1M;输入模态:text;输出模态:text

  • 状态:active;Prompt caching 公布价 $0.003 / 百万缓存输入 tokens

分类得分与排名

类别权重分数排名
Agentic22%51.9未排名
Coding20%48.5未排名
Reasoning17%待定未排名
Knowledge12%61.1#42 of 57(27 百分位)
Math5%81.4未排名
Multilingual7%未测-
Multimodal12%未测-
Inst. Following5%未测-

关键基准成绩(官方技术报告 / 0731 更新)

Coding

  • SWE-bench Verified:79%(最佳 96%,Claude Opus 5)

  • SWE-bench Pro:52.6%

  • LiveCodeBench Pass@1-COT:91.6%(仅落后 V4 Pro 0813 的 93.5% 1.9)

  • Codeforces:3052.0

  • SWE Multilingual:73.3%

  • Terminal-Bench 2.0:56.9%;Terminal-Bench 2.1:82.7%

  • NL2Repo:54.2%;deepSwe:54.4%;DSBench-FullStack:68.7%;DSBench-Hard:59.6%

Agentic

  • Terminal-Bench 2.0:56.9%;Terminal-Bench 2.1:82.7%

  • BrowseComp:73.2%

  • HLE w/ tools:45.1%

  • MCP Atlas:69%;Toolathlon:47.8%;Toolathlon-Verified:70.3%

  • CyberGym:76.7%

  • Agents' Last Exam:25.2%

  • AutomationBench:25.1%

Reasoning

  • MRCR 1M:78.7%;CorpusQA 1M:60.5%

Knowledge

  • HLE(Humanity's Last Exam):34.8%

要点解读

  • 与最强的基准记录相比仍有明显差距(如 SWE-bench Verified 落后 Claude Opus 5 达 17 个点),但在价格远低的前提下,代码与 Agent 场景的成绩处于可用水准

  • 0731 更新版比早期版本有显著提升(deepSwe 7.3 → 54.4 同源数据)

  • BenchLM 备注:缺失字段保持"未公开"而非隐藏,分数仅在可展示的公开证据下显示

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

DeepSeek V4 Flash

在 Tabbit 中使用并对比模型

DeepSeek V4 Flash

相关测评

官方DeepSeek API Docs2026-07-31

DeepSeek-V4-Flash:0731 更新基准与 Harness 条件

官方deepseek.ai(独立网站,与 DeepSeek 官方无关)

DeepSeek V4 Flash Review (2026) — Specs, Tests & Speed

媒体MindStudio2026-08-01

DeepSeek-V4-Flash:本地部署量化与 Agent 实测

媒体Lightning AI 博客2026-04-27

DeepSeek V4 Alters Everything We Knew About Price-Performance Math(Lightning AI)

DeepSeek V4 Flash

相关提示词

官方DeepSeek API Docs2026-07-31

DeepSeek-V4-Flash:0731 思考档位与工具调用配置

官方DeepSeek API Docs2026-07-31

DeepSeek-V4-Flash:Codex Responses API 接入工作流

媒体腾讯云开发者社区(cloud.tencent.com)2026-06-05

别让 AI 把你气哭:2026年 DeepSeek-V4 提示词终极指南

社区GitHub 仓库 victorchen96/deepseekv4rolepalyinstruct(官方英文版 README)

DeepSeek V4 - 20260424 Version Roleplay — Thinking Mode Switching Guide (English version)