DeepSeek-V4-Flash 的 Agent 任务应显式选择 low/high/max 思考档位,并在工具多轮中原样回传 reasoning_content,否则可能得到 400 错误或损失连续推理状态。
适合的任务:代码 Agent、需要函数调用的检索/执行循环、需要在成本和延迟之间调节的长任务。
不适合的任务:需要图像或音频输入的工作流;官方更新与实测资料均将 V4-Flash 描述为文本模型。
适用的模型版本:deepseek-v4-flash,尤其是 2026-07-31 的 0731 API 更新。
适用的客户端、Agent 或 API:DeepSeek OpenAI-compatible Chat Completions;工具调用循环。
推荐的推理档位和参数:简单任务 low;日常 Agent high;复杂任务 max。思考模式下不要依赖 temperature、top_p、presence_penalty 或 frequency_penalty,官方说明这些参数无效。
下面是依据官方参数表改写为 V4-Flash 的最小配置模板;字段名和状态映射保持官方定义,模型名已从文档示例中的 Pro 改为本目录模型:
from openai import OpenAI
client = OpenAI(
api_key="<DeepSeek API Key>",
base_url="https://api.deepseek.com",
)
response = client.chat.completions.create(
model="deepseek-v4-flash",
messages=[
{"role": "user", "content": "先检查输入,再调用必要工具,最后给出可验证的结论。"}
],
reasoning_effort="high", # low / high / max
extra_body={"thinking": {"type": "enabled"}},
)
print(response.choices[0].message.content)官方 Responses API 的对应思路是 reasoning.effort="none" | "low" | "high" | "max";其中 none 关闭思考。OpenAI 格式的 thinking 开关需要放在 extra_body 中。
用 model="deepseek-v4-flash" 发起请求,并根据任务复杂度选择 reasoning_effort。
需要工具时,在后续请求中保留上一轮完整的 assistant 消息,而不是只保留 content。
读取 tool_calls,执行本地工具,把每个结果以 role="tool" 和对应 tool_call_id 追加回 messages。
继续请求,直到没有新的 tool_calls;最后只把 content 作为用户答案。
对重要任务单独校验外部数据;模型档位只控制推理投入,不替代工具结果验证。
官方更新页说明 V4-Flash 0731 是公开 beta,模型架构和规模与 V4-Flash-Preview 相同,仅重新进行 post-training;官方 Agent 结果包括 Terminal Bench 2.1 82.7、DeepSWE 54.4、Toolathlon Verified 70.3、Automation Bench Public 25.1。
同一更新页给出官方 harness 条件:DeepSeek Harness minimal mode、max effort、top_p=0.95、temperature=1.0;这是官方测试条件,不应直接当作任意客户端默认值。
思考模式文档明确:V4-Flash 与 V4-Pro 的 requested effort 映射为 low→low、medium→high、high→high、xhigh→high、max→max;思考默认开启且默认实际档位为 high。
工具调用时,若没有回传完整 reasoning_content,官方文档警告 API 会返回 400;无工具的普通多轮中,前一轮 reasoning_content 可不拼回。
medium 和 xhigh 并不会在 V4-Flash 上产生同名的独立实际档位,都会映射到 high;需要最大投入时使用 max。
思考模式不支持用采样参数微调随机性;文档说这些参数即使被接受也没有效果。
文档示例包含可见的 reasoning_content,这里仅把它作为 API 状态字段处理,不应把模型内部推理当作可靠事实或直接展示给终端用户。
0731 的基准使用官方 harness;不同 Agent 编排、工具描述和上下文压缩策略可能改变结果。
官方更新页的关键原文是 “DeepSeek-V4-Flash-0731 keeps the same model architecture and size ... and was only re-post-trained”;思考模式页还要求工具请求后 “reasoning_content must be fully passed back”。
DeepSeek V4 Flash