DeepSeek V4 Pro · 媒体来源 · 编辑分析
Artificial Analysis 的 2026-08-21 页面快照记录 V4-Pro 0813 max effort 指数 53、速度 80.3 tok/s、输出 $3.96/1M、1M context 与 1.6T/49B;本轮 2026-09-20 重开页面显示指数已为 36,不能混作同一时点。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
AA 对 DeepSeek V4 Pro 0813(Reasoning, Max Effort)的测量:Intelligence Index 53、位列其 107 模型池第 3;速度 80.3 tok/s、输出 $3.96/1M(峰值)、上下文 1M、总参 1.6T/激活 49B——智能顶尖但偏贵、偏啰嗦(单次指数评测生成 130M tokens)。
适合的任务:把 V4-Pro 放在同一指数尺度上与其它前沿模型比较(智能/速度/成本/啰嗦度四维);为“Pro 适合什么任务”提供第三方证据(高智能 + 长上下文 + 文本-only)。
不适合的任务:把 Intelligence Index 当成某一代码库成功率;把 2026-04-24 旧版与 0813 新版数据混用;用峰值价格替代全部成本计算(非峰值与 cache 折扣差异大)。
适用的模型版本:DeepSeek V4 Pro 0813(页面以 max effort 推理配置测量;官方另有非推理变体存在但本页未测)。
适用的客户端、Agent 或 API:AA 统一 API Provider Benchmark harness;模型输出为文本,官方 API 支持 Responses/Anthropic 格式。
推荐的推理档位和参数:本页为 max effort 档;AA 提示低档位(如 high/low)的智能、token 与成本会不同,需按档位分别查询。
指标:Artificial Analysis Intelligence Index(综合智能),单位任务成本、输出速度、Verbosity(指数评测期间生成 token 总量)。
测量结果(页面原文):Intelligence Index 53,排名 3/107(同类中位数 27);Speed 80.3 tok/s,排名 22/107(中位数 67);Cost 输入 $1.32/1M、输出 $3.96/1M(峰值价,cache 折扣 97%),每 Intelligence Index 任务成本 $0.25,排名 24/107(输入中位数 $0.30、输出中位数 $1.20);Verbosity 130M tokens(中位数 100M,偏啰嗦);整次指数评测总成本 $604.51。
技术规格:上下文 1M(约 1500 页 A4);总参数 1600B、激活参数 49B;输入/输出均文本;MIT 许可;权重在 Hugging Face。
对照基准:同类(open weights, Large >150B 或 reasoning 类)模型池 107 个;“Highlights”对比图列出 Claude Opus 5 (max)、Claude Fable 5、GPT-5.6 Sol (max)、Grok 4.6 (high)、Kimi K3 (max)、GLM-5.3 (max)、Muse Spark 1.2 (xhigh) 等。
页面定位语句(原文):“DeepSeek V4 Pro 0813 (Reasoning, Max Effort) is amongst the leading models in intelligence, but somewhat expensive when comparing to other open weight models of similar size. It's also faster than average, however somewhat verbose.”
同一指数 53 与 Reuters 2026-08-13 报道一致(见测评/03),说明 AA 数据可交叉核对;ChatBench 2026-08-12 快照显示的旧版(Released 2026-04-24、AA Index 43.75)与本页 0813 不同,注意区分版本。
成本口径:页面价格为峰值档($1.32/$3.96),与官方定价页 2026-08-16 生效的峰值价一致;非峰值减半($0.66/$1.98),cache hit 输入 $0.022/$0.044。
AA 是第三方指数:样本、权重与 harness 由 AA 控制,未完全公开(Reuters 报道同样指出);指数是综合分,不是任务成功率。
“max effort”是页面的固定配置:max 档的 token 消耗与成本显著高于官方默认 high;生产选型应按实际档位重查数据。
Verbosity 130M 说明 max 档输出冗长:长对话与批量任务需把 token 成本计入,必要时用 low/high 档对比。
页面价格为采集时点数据:DeepSeek 2026-08-16 起实行峰/非峰计费,后续调价需重新核对。
页面原文:“In total, it cost $604.51 to evaluate DeepSeek V4 Pro 0813 (Reasoning, Max Effort) on the Intelligence Index.”
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Artificial Analysis(independent model intelligence platform) · Artificial Analysis 团队(独立第三方) · 原文发布日期 Unknown · 本站编辑日期 2026-09-20
打开原始来源DeepSeek V4 Pro
下载 Tabbit 客户端后检查模型可用性