DeepSeek 的 GA 公告明确把 V4-Pro 定位为生产 Agent 模型:支持可调 reasoning effort、Responses API 与 Codex,但公告没有公开可复核分数,不能把“major upgrades”当作胜率。
适合的任务:日常编码 Agent、复杂工具调用、Codex 集成和需要按成本调节推理深度的 API 工作流。
不适合的任务:只凭发布公告选择模型或把 Pro 的宣传定位当作独立测评结果。
适用的模型版本:DeepSeek-V4-Pro GA;公告说明模型名保持不变,API 仍按文档配置。
适用的客户端、Agent 或 API:DeepSeek app/web 的 Expert Mode、DeepSeek API、Responses API、Codex。
推荐的推理档位和参数:官方建议 low 用于简单任务、high 用于日常 Agent、max 用于复杂任务;应在自有 eval 中核实。
模型/版本:DeepSeek-V4-Pro GA(公告日期 2026-08-13)。
工具与运行环境:API、app/web Expert Mode、Codex/Responses API;公告未提供统一 benchmark harness。
输入/评测方式:官方发布说明和配置能力公告,不是题目级测评。
公告公开的配置差异是 reasoning effort:low、high、max;同时宣布原生 Responses API 支持和 Codex 一键配置。未公开 prompt、温度、运行次数、评分器或每项基准输入。
| 官方公开信息 | 可核实内容 |
|---|---|
| Agent 定位 | 官方称有“major Agent upgrades with strong production gains” |
| Reasoning effort | low/simple,high/daily Agent,max/complex |
| API | V4-Pro 可通过 API 使用;模型名保持不变 |
| Responses/Codex | 原生 Responses API 支持,面向 Codex 优化并提供一键设置 |
| 产品入口 | app/web 的 Expert Mode |
| 价格机制 | 2026-08-16 16:00 UTC 起更新 V4 lineup 价格并引入 peak/off-peak;off-peak 比 peak 低 50% |
公告的可操作信息不是一个分数,而是一个成本/质量工作流:用 low/high/max 适配任务,优先 Responses API 和 Codex harness,并将 peak/off-peak 调度纳入预算。质量结论需要结合 MindStudio 的任务数据和自身复现。
局限:公告没有公开题目级 benchmark、harness、模型快照、token 或延迟数据;“生产收益”是厂商表述。
复现步骤:固定 GA API endpoint 和请求日期;按简单 Agent/复杂 Agent 三类任务分别运行 low/high/max;记录成功率、工具错误、延迟、输入/输出/推理 token、峰谷价格,并与 V4-Flash 做同一任务对照。
价格边界:峰谷价格与生效时间属于时变信息,部署前重新查官方价格页,不从公告中的“50%”推断具体金额。
公告原文提供 V4-Pro GA、reasoning effort、Responses/Codex、Expert Mode 和峰谷价格说明;本文没有补写公告未展示的分数或参数。
low/high/max 是官方推荐场景,不等于各档位的固定 token 上限或质量保证。
“模型名保持不变”只说明 API 名称兼容,不代表 preview 与 GA 行为完全相同;复现必须记录日期和返回模型信息。
高风险工具操作仍需外部权限、日志和人工复核。
公告把 V4-Pro 形容为 “Major Agent upgrades with strong production gains”,但没有给出分数;本文将该句保留为厂商定位而非测评结论。
DeepSeek V4 Pro