Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
官方DeepSeek V4 Flash

DeepSeek-V4-Flash:0731 更新基准与 Harness 条件

原始来源

DeepSeek API Docs

作者DeepSeek 官方

原文日期2026-07-31

Tabbit 整理2026-08-19

查看原文

一句话结论

官方 0731 更新显示 V4-Flash 的 Agent 基准明显高于 V4-Pro-Preview,但结果依赖 DeepSeek Harness minimal mode 与 max effort,比较时必须把 harness 和参数一起复现。

适用场景

  • 适合的任务:代码 Agent、终端操作、工具调用、自动化和全栈开发能力的官方版本定位。

  • 不适合的任务:把单一官方 harness 下的分数直接外推到聊天、视觉、多模态或另一套 Agent 框架。

  • 适用的模型版本:公开 beta deepseek-v4-flash 的 0731 API 更新;更新页称模型架构和规模保持不变,仅重新 post-train。

  • 适用的客户端、Agent 或 API:DeepSeek API;官方 DeepSeek Harness minimal mode。

  • 推荐的推理档位和参数:复现官方 Code Agent 条件时使用 max、top_p=0.95、temperature=1.0;普通应用应重新做自己的参数评估。

测试环境、输入/配置

  • 模型:DeepSeek-V4-Flash 0731 API。

  • Harness:DeepSeek Harness minimal mode(官方说明当时即将发布)。

  • 推理档位:max。

  • 采样配置:top_p=0.95、temperature=1.0。

  • 任务集合:Terminal Bench 2.1、NL2Repo、CyberGym、DeepSWE、Toolathlon Verified、Agents' Last Exam、Automation Bench Public,以及内部 DSBench-FullStack、DSBench-Hard。

  • 原始输入:各基准的完整任务输入与 harness 实现未在更新页公开,无法仅凭此页重建单题测试。

结果数据

基准V4-Flash 0731
Terminal Bench 2.182.7
NL2Repo54.2
CyberGym76.7
DeepSWE54.4
Toolathlon Verified70.3
Agents' Last Exam25.2
Automation Bench (Public)25.1
DSBench-FullStack(内部)68.7
DSBench-Hard(内部)59.6

结论

该更新支持把 V4-Flash 作为低成本代码 Agent 候选,尤其适合终端、仓库修改和工具编排;但它证明的是“V4-Flash + 官方 harness + 指定参数”的组合表现,而不是裸模型在所有客户端中的统一能力。

局限

  • 官方更新页未给出每道题的输入、输出、失败样本、重复次数、置信区间或完整 harness 代码,因此不能称为独立可复现测评。

  • DSBench-FullStack 与 DSBench-Hard 是内部集合,外部无法直接复跑。

  • 更新页称比较对象是 V4-Pro-Preview,但未在同一段落给出完整对照表;不要自行补写缺失的对照分数。

  • 0731 API 仅升级 V4-Flash,V4-Pro API 与 APP/Web 模型当时未变化;产品端结果不能直接当作 API 结果。

复现步骤

  1. 在 DeepSeek API 中固定模型版本与可用的 0731 endpoint。

  2. 记录 API 响应协议、工具描述、超时、重试、上下文裁剪和工作区快照。

  3. 让自己的 Agent 尽可能复刻官方的 minimal harness,并固定 max、top_p=0.95、temperature=1.0。

  4. 先用公开的 Terminal Bench 2.1、NL2Repo 等任务做多次重复,保存每个任务的 patch、测试结果、工具调用数和 token 用量。

  5. 将结果与官方表格并列,同时另跑目标生产 harness;不要只比较一个总分。

原始证据与数据

更新页原文给出的公开数字为 82.7 / 54.2 / 76.7 / 54.4 / 70.3 / 25.2 / 25.1,并把两个 DSBench 数字标成内部测试;同页明确写出 DeepSeek Harness minimal mode、max effort、topp=0.95、temperature=1.0。

来源摘录或观察(仅做合规短引)

官方把这次更新称为 “significantly enhanced agent capabilities”,同时注明 Flash 0731 “keeps the same model architecture and size ... and was only re-post-trained”。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

DeepSeek V4 Flash

在 Tabbit 中使用并对比模型

DeepSeek V4 Flash

相关测评

官方deepseek.ai(独立网站,与 DeepSeek 官方无关)

DeepSeek V4 Flash Review (2026) — Specs, Tests & Speed

媒体MindStudio2026-08-01

DeepSeek-V4-Flash:本地部署量化与 Agent 实测

媒体Lightning AI 博客2026-04-27

DeepSeek V4 Alters Everything We Knew About Price-Performance Math(Lightning AI)

媒体BenchLM.ai(模型基准与定价追踪站)2026-07-31

DeepSeek V4 Flash 0731 Benchmarks, Pricing & Speed(BenchLM)

DeepSeek V4 Flash

相关提示词

官方DeepSeek API Docs2026-07-31

DeepSeek-V4-Flash:0731 思考档位与工具调用配置

官方DeepSeek API Docs2026-07-31

DeepSeek-V4-Flash:Codex Responses API 接入工作流

媒体腾讯云开发者社区(cloud.tencent.com)2026-06-05

别让 AI 把你气哭:2026年 DeepSeek-V4 提示词终极指南

社区GitHub 仓库 victorchen96/deepseekv4rolepalyinstruct(官方英文版 README)

DeepSeek V4 - 20260424 Version Roleplay — Thinking Mode Switching Guide (English version)