ChatBench 聚合页显示 V4 Pro (high) 的代码分榜最好(Coding #22 · 76.9),Agent 类中游(Agent tasks #38 · 60.9),Browser/Computer use 明显靠后(#57/#58)——同一模型在不同任务类型的排名差异是选型的关键依据。
适合的任务:快速浏览 V4-Pro 在 coding/agent/browser/instruction-following 等任务分榜上的相对位置;与 AA 原始页交叉核对价格、速度与规格;判断“Pro 适合代码与常规文本任务、不适合浏览器/计算机自动化类任务”。
不适合的任务:把任务分榜分数当绝对成功率;把 2026-08-12 快照当最新数据;把 ChatBench 当作独立实测(它尚无自有评分)。
适用的模型版本:DeepSeek V4 Pro (high)——页面关联的 AA 快照为 2026-04-24 发布版本(非 0813 GA,见边界)。
适用的客户端、Agent 或 API:AA 榜单对应 API 服务;价格列示为旧价格(见下)。
推荐的推理档位和参数:本页对应 AA 的 high 档(页面标题 “(high)”);与 06 号文档的 max 档数据(Index 53)相比,档位不同、数值不可直接混用。
数据来源:Artificial Analysis LLM Leaderboard 公开榜单(页面明示),检索于 2026-08-12 16:00 GMT+8;ChatBench 自有评测 0 项、第三方评分 12 项。
规格:DeepSeek 家族;1.6T 参数;1M 上下文;2026-04-24 发布;开源权重;工具支持;未列视觉/音频/视频。
价格与速度(快照值):输入 $0.43/1M、输出 $0.87/1M、混合 $0.18/1M(2026-08-16 调价前旧价);速度 68.4 tok/s;首延迟 1.75s;总响应 38.17s。
分榜排名与得分:Coding #22 · 76.9;Agent tasks #38 · 60.9;Blog writing #39 · 74.0;Trivia knowledge #39 · 72.8;Retrieval #38 · 69.0;Instruction following #38 · 67.6;Browser use #57 · 61.8;Computer use #58 · 58.9;Speed #29 · 49.2;Open source #6 · 68.6。
待办评测(PENDING):Airwolf 角色/台词召回、工具错误后重试微任务、基于上下文的引用抽取——这些项目 ChatBench 尚未出分。
页面注明 “DeepSeek V4 Pro (high) is tracked from the live Artificial Analysis public leaderboard with ChatBench-normalized intelligence, coding, agentic, price, latency, speed, and context metadata”。
“EVAL EVIDENCE”区明确标注唯一 PASS 项为 “Artificial Analysis public leaderboard ingestion”,并提示数据带 raw-value provenance;其余 3 项为 PENDING,未计入结论。
分榜数值与 06 号文档的 AA 页面口径不同(该页为 max effort、0813;本页为 high、旧快照),二者差异来自版本与档位,不是同一份数据的两处抄写。
快照日期 2026-08-12 早于 V4-Pro-0813 GA(08-13)与调价(08-16):分榜对应的是 4 月预览版或旧快照,价格是旧价($0.43/$0.87);选型请以 AA 实时页与官方定价页为准。
分榜排名来自 AA 归一化数据,样本与权重由 AA 控制,未完全公开;ChatBench 自身没有自有评测,无法独立复现这些分数。
“high”档仅代表 AA 对该配置的命名;与官方 high 的语义可能不同,接入时以官方 API 参数为准。
Browser/Computer use 排名靠后是方向性证据(文本-only 模型在此类任务上的常见表现),但具体数值受 AA harness 影响。
页面原文(EVAL EVIDENCE):PASS 项为 “Artificial Analysis public leaderboard ingestion — Imports public intelligence, price, speed, latency, and response-time metrics with raw-value provenance.”
DeepSeek V4 Pro