DeepSeek 的 GA 公告明确把 V4-Pro 定位为生产 Agent 模型:支持可调 reasoning effort、Responses API 与 Codex,但公告没有公开可复核分数,不能把“major upgrades”当作胜率。
DeepSeek API Docs · 查看证据DeepSeek V4 Pro · 测评与证据
DeepSeek V4 Pro,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
MindStudio 的公开八题实测给 V4-Pro-0813 61/80(76.25%),显示前端、规划、数学和长程 Agent 是强项,但 SVG、游戏打磨和简单任务的过度思考仍是边界。
MindStudio · 查看证据同一平台、同一被测模型的对照显示:V4-Pro 在“自主规划执行”(基础 98.0 / 进阶 92.6)上接近满分,而在“模糊需求澄清”人设用例上只得 68.5——结构化工具规划是强项,需要主动追问多义需求的人设对话是短板。
XSCT Bench(xsctbench.com,场景化模型选型评测) · 查看证据完整测评与相关内容
精选证据
DeepSeek-V4-Pro 官方发布:Reasoning 与 Agent 能力升级
DeepSeek 的 GA 公告明确把 V4-Pro 定位为生产 Agent 模型:支持可调 reasoning effort、Responses API 与 Codex,但公告没有公开可复核分数,不能把“major upgrades”当作胜率。
待验证:本次未能重新核实原文。
- 条件
- 版本 V4-Pro-0813;GA 公告 2026-08-13,价格 2026-08-16 生效;内容是产品集成说明,无统一 benchmark、样本或 harness。
DeepSeek-V4-Pro-0813 MindStudio 八题编码与 Agent 实测对照
MindStudio 的公开八题实测给 V4-Pro-0813 61/80(76.25%),显示前端、规划、数学和长程 Agent 是强项,但 SVG、游戏打磨和简单任务的过度思考仍是边界。
待验证:本次未能重新核实原文。
- 条件
- 版本 V4-Pro-0813;MindStudio 八题 hands-on;日期 2026-08-13;样本 8 题,完整 prompt、重复与盲评流程未公开。
XSCT Bench 两用例对照:V4-Pro 规划执行强、人设澄清弱
同一平台、同一被测模型的对照显示:V4-Pro 在“自主规划执行”(基础 98.0 / 进阶 92.6)上接近满分,而在“模糊需求澄清”人设用例上只得 68.5——结构化工具规划是强项,需要主动追问多义需求的人设对话是短板。
待验证:本次未能重新核实原文。
- 条件
- 版本 V4 Pro;XSCT Bench 同平台两用例;采集 2026-08-21 时平台覆盖 112 模型/1,517 用例;prompt、重复和完整 harness 未公开。
Artificial Analysis:DeepSeek V4 Pro 0813(max effort)智能指数、成本与定位
Artificial Analysis 的 2026-08-21 页面快照记录 V4-Pro 0813 max effort 指数 53、速度 80.3 tok/s、输出 $3.96/1M、1M context 与 1.6T/49B;本轮 2026-09-20 重开页面显示指数已为 36,不能混作同一时点。
待验证:本次未能重新核实原文。
- 条件
- 版本/档位 V4-Pro-0813、Reasoning Max Effort;旧页面采集 2026-08-21,本轮 2026-09-20 重开指数从 53 变为 36;速度、价格与规格沿用对应页面,题集、重复和硬件未全部公开。
全部来源
全部来源
DeepSeek-V4-Pro 官方发布:Reasoning 与 Agent 能力升级
DeepSeek 的 GA 公告明确把 V4-Pro 定位为生产 Agent 模型:支持可调 reasoning effort、Responses API 与 Codex,但公告没有公开可复核分数,不能把“major upgrades”当作胜率。
待验证:本次未能重新核实原文。
- 条件
- 版本 V4-Pro-0813;GA 公告 2026-08-13,价格 2026-08-16 生效;内容是产品集成说明,无统一 benchmark、样本或 harness。
DeepSeek-V4-Pro-0813 MindStudio 八题编码与 Agent 实测对照
MindStudio 的公开八题实测给 V4-Pro-0813 61/80(76.25%),显示前端、规划、数学和长程 Agent 是强项,但 SVG、游戏打磨和简单任务的过度思考仍是边界。
待验证:本次未能重新核实原文。
- 条件
- 版本 V4-Pro-0813;MindStudio 八题 hands-on;日期 2026-08-13;样本 8 题,完整 prompt、重复与盲评流程未公开。
XSCT Bench 两用例对照:V4-Pro 规划执行强、人设澄清弱
同一平台、同一被测模型的对照显示:V4-Pro 在“自主规划执行”(基础 98.0 / 进阶 92.6)上接近满分,而在“模糊需求澄清”人设用例上只得 68.5——结构化工具规划是强项,需要主动追问多义需求的人设对话是短板。
待验证:本次未能重新核实原文。
- 条件
- 版本 V4 Pro;XSCT Bench 同平台两用例;采集 2026-08-21 时平台覆盖 112 模型/1,517 用例;prompt、重复和完整 harness 未公开。
Artificial Analysis:DeepSeek V4 Pro 0813(max effort)智能指数、成本与定位
Artificial Analysis 的 2026-08-21 页面快照记录 V4-Pro 0813 max effort 指数 53、速度 80.3 tok/s、输出 $3.96/1M、1M context 与 1.6T/49B;本轮 2026-09-20 重开页面显示指数已为 36,不能混作同一时点。
待验证:本次未能重新核实原文。
- 条件
- 版本/档位 V4-Pro-0813、Reasoning Max Effort;旧页面采集 2026-08-21,本轮 2026-09-20 重开指数从 53 变为 36;速度、价格与规格沿用对应页面,题集、重复和硬件未全部公开。
Reuters DeepSeek-V4-Pro-0813 价格与独立指数对照
Reuters 引用 Artificial Analysis 的独立价格/指数数据:V4-Pro-0813 的 reasoning Intelligence Index 为 53、V4 Flash 为 40,但 Pro 的输入/输出价格约为 Flash 的 9/14 倍,选型必须把质量与成本一起算。
待验证:本次未能重新核实原文。
- 模型/版本
- 模型为 DeepSeek-V4-Pro;来源标题:Reuters DeepSeek-V4-Pro-0813 价格与独立指数对照。精确快照按原始来源。
- 任务/harness
- Reuters 这条报道明确把 V4-Pro-0813 的 Intelligence Index 53、V4 Flash 40 与约 9/14 倍输入/输出价格放在同一选型问题中。 完整任务集、provider、参数和评审流程未完全公开。
- 样本/日期
- 来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
DeepSeek-V4-Pro Reddit 长上下文与提示精确度现场报告
社区现场认为 V4-Pro 在大量上下文、杂乱编码提示和低成本个人项目中很实用,但大型架构任务更依赖精确规格、文档、测试和不可逆变更保护,不能只靠一次提示。
待验证:本次未能重新核实原文。
- 模型/版本
- 模型为 DeepSeek-V4-Pro;来源标题:DeepSeek-V4-Pro Reddit 长上下文与提示精确度现场报告。精确快照按原始来源。
- 任务/harness
- 该 Reddit 现场报告具体讨论 V4-Pro 在长上下文、杂乱编码提示和个人项目中的实用性,并指出大型架构任务需要规格、测试和不可逆变更保护。 完整任务集、provider、参数和评审流程未完全公开。
- 样本/日期
- 来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
ChatBench:DeepSeek V4 Pro (high) 任务分榜与规格聚合
ChatBench 聚合页显示 V4 Pro (high) 的代码分榜最好(Coding #22 · 76.9),Agent 类中游(Agent tasks #38 · 60.9),Browser/Computer use 明显靠后(#57/#58)——同一模型在不同任务类型的排名差异是选型的关键依据。
待验证:本次未能重新核实原文。
- 模型/版本
- 模型为 DeepSeek-V4-Pro;来源标题:ChatBench:DeepSeek V4 Pro (high) 任务分榜与规格聚合。精确快照按原始来源。
- 任务/harness
- ChatBench 将 V4 Pro high 的 Coding 排名列为 #22/76.9、Agent tasks #38/60.9,而 Browser/Computer use 位于 #57/#58,显示任务类型差异。 完整任务集、provider、参数和评审流程未完全公开。
- 样本/日期
- 来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
Reddit 现场报告:V4-Pro 价格上调后的成本反应与选型转移
社区对 2026-08-16 生效的新定价(引入峰/非峰计费、cache hit 最高涨 1,114%)的普遍反应是“模型好但不再便宜”,已有用户把主负载迁移到 Luna/Claude/Codex 等,并用 V4-Pro 只做规划/审查类高价值任务。
待验证:本次未能重新核实原文。
- 模型/版本
- 模型为 DeepSeek-V4-Pro;来源标题:Reddit 现场报告:V4-Pro 价格上调后的成本反应与选型转移。精确快照按原始来源。
- 任务/harness
- 该社区报告围绕 2026-08-16 调价、峰/非峰计费和 cache hit 最高上涨 1,114%,并记录用户把主负载迁往 Luna、Claude 或 Codex。 完整任务集、provider、参数和评审流程未完全公开。
- 样本/日期
- 来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。