Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

DeepSeek V4 Pro · 媒体来源 · 编辑分析

ChatBench:DeepSeek V4 Pro (high) 任务分榜与规格聚合

ChatBench 聚合页显示 V4 Pro (high) 的代码分榜最好(Coding #22 · 76.9),Agent 类中游(Agent tasks #38 · 60.9),Browser/Computer use 明显靠后(#57/#58)——同一模型在不同任务类型的排名差异是选型的关键依据。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源编辑分析编辑日期 2026-09-20

测试条件速查

模型/版本
模型为 DeepSeek-V4-Pro;来源标题:ChatBench:DeepSeek V4 Pro (high) 任务分榜与规格聚合。精确快照按原始来源。
任务/harness
ChatBench 将 V4 Pro high 的 Coding 排名列为 #22/76.9、Agent tasks #38/60.9,而 Browser/Computer use 位于 #57/#58,显示任务类型差异。 完整任务集、provider、参数和评审流程未完全公开。
样本/日期
来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。

关键数据与适用场景

一句话结论

ChatBench 聚合页显示 V4 Pro (high) 的代码分榜最好(Coding #22 · 76.9),Agent 类中游(Agent tasks #38 · 60.9),Browser/Computer use 明显靠后(#57/#58)——同一模型在不同任务类型的排名差异是选型的关键依据。

适用场景

  • 适合的任务:快速浏览 V4-Pro 在 coding/agent/browser/instruction-following 等任务分榜上的相对位置;与 AA 原始页交叉核对价格、速度与规格;判断“Pro 适合代码与常规文本任务、不适合浏览器/计算机自动化类任务”。

  • 不适合的任务:把任务分榜分数当绝对成功率;把 2026-08-12 快照当最新数据;把 ChatBench 当作独立实测(它尚无自有评分)。

  • 适用的模型版本:DeepSeek V4 Pro (high)——页面关联的 AA 快照为 2026-04-24 发布版本(非 0813 GA,见边界)。

  • 适用的客户端、Agent 或 API:AA 榜单对应 API 服务;价格列示为旧价格(见下)。

  • 推荐的推理档位和参数:本页对应 AA 的 high 档(页面标题 “(high)”);与 06 号文档的 max 档数据(Index 53)相比,档位不同、数值不可直接混用。

测试环境

  • 数据来源:Artificial Analysis LLM Leaderboard 公开榜单(页面明示),检索于 2026-08-12 16:00 GMT+8;ChatBench 自有评测 0 项、第三方评分 12 项。

  • 规格:DeepSeek 家族;1.6T 参数;1M 上下文;2026-04-24 发布;开源权重;工具支持;未列视觉/音频/视频。

  • 价格与速度(快照值):输入 $0.43/1M、输出 $0.87/1M、混合 $0.18/1M(2026-08-16 调价前旧价);速度 68.4 tok/s;首延迟 1.75s;总响应 38.17s。

  • 分榜排名与得分:Coding #22 · 76.9;Agent tasks #38 · 60.9;Blog writing #39 · 74.0;Trivia knowledge #39 · 72.8;Retrieval #38 · 69.0;Instruction following #38 · 67.6;Browser use #57 · 61.8;Computer use #58 · 58.9;Speed #29 · 49.2;Open source #6 · 68.6。

  • 待办评测(PENDING):Airwolf 角色/台词召回、工具错误后重试微任务、基于上下文的引用抽取——这些项目 ChatBench 尚未出分。

原始证据与数据

  • 页面注明 “DeepSeek V4 Pro (high) is tracked from the live Artificial Analysis public leaderboard with ChatBench-normalized intelligence, coding, agentic, price, latency, speed, and context metadata”。

  • “EVAL EVIDENCE”区明确标注唯一 PASS 项为 “Artificial Analysis public leaderboard ingestion”,并提示数据带 raw-value provenance;其余 3 项为 PENDING,未计入结论。

  • 分榜数值与 06 号文档的 AA 页面口径不同(该页为 max effort、0813;本页为 high、旧快照),二者差异来自版本与档位,不是同一份数据的两处抄写。

适用边界

  • 快照日期 2026-08-12 早于 V4-Pro-0813 GA(08-13)与调价(08-16):分榜对应的是 4 月预览版或旧快照,价格是旧价($0.43/$0.87);选型请以 AA 实时页与官方定价页为准。

  • 分榜排名来自 AA 归一化数据,样本与权重由 AA 控制,未完全公开;ChatBench 自身没有自有评测,无法独立复现这些分数。

  • “high”档仅代表 AA 对该配置的命名;与官方 high 的语义可能不同,接入时以官方 API 参数为准。

  • Browser/Computer use 排名靠后是方向性证据(文本-only 模型在此类任务上的常见表现),但具体数值受 AA harness 影响。

来源摘录或观察(仅做合规短引)

页面原文(EVAL EVIDENCE):PASS 项为 “Artificial Analysis public leaderboard ingestion — Imports public intelligence, price, speed, latency, and response-time metrics with raw-value provenance.”

能支持的判断

  • ChatBench 将 V4 Pro high 的 Coding 排名列为 #22/76.9、Agent tasks #38/60.9,而 Browser/Computer use 位于 #57/#58,显示任务类型差异。

不能支持的判断

  • 不支持将该来源的结果外推为普遍能力、生产成功率或当前排名;ChatBench 将 V4 Pro high 的 Coding 排名列为 #22/76.9、Agent tasks #38/60.9,而 Browser/Computer use 位于 #57/#58,显示任务类型差异的完整 harness、样本和复测条件未完全公开。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

ChatBench(benchmarks.chatbench.org) · ChatBench 项目(独立第三方聚合平台) · 原文发布日期 Unknown · 本站编辑日期 2026-09-20

打开原始来源

DeepSeek V4 Pro

在 Tabbit 中比较 DeepSeek V4 Pro

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

DeepSeek V4 Pro:有哪些变化、如何计费,适合谁使用

用可回溯来源拆解 DeepSeek V4 Pro 0813 的 Agent 升级、API 限制、价格边界、独立测评与安全试用方法。

相关评测

DeepSeek-V4-Pro-0813 MindStudio 八题编码与 Agent 实测对照MindStudio 的公开八题实测给 V4-Pro-0813 61/80(76.25%),显示前端、规划、数学和长程 Agent 是强项,但 SVG、游戏打磨和简单任务的过度思考仍是边界。XSCT Bench 两用例对照:V4-Pro 规划执行强、人设澄清弱同一平台、同一被测模型的对照显示:V4-Pro 在“自主规划执行”(基础 98.0 / 进阶 92.6)上接近满分,而在“模糊需求澄清”人设用例上只得 68.5——结构化工具规划是强项,需要主动追问多义需求的人设对话是短板。Artificial Analysis:DeepSeek V4 Pro 0813(max effort)智能指数、成本与定位Artificial Analysis 的 2026-08-21 页面快照记录 V4-Pro 0813 max effort 指数 53、速度 80.3 tok/s、输出 $3.96/1M、1M context 与 1.6T/49B;本轮 2026-09-20 重开页面显示指数已为 36,不能混作同一时点。DeepSeek-V4-Pro 官方发布:Reasoning 与 Agent 能力升级DeepSeek 的 GA 公告明确把 V4-Pro 定位为生产 Agent 模型:支持可调 reasoning effort、Responses API 与 Codex,但公告没有公开可复核分数,不能把“major upgrades”当作胜率。DeepSeek-V4-Pro 思考档位与工具调用工作流V4-Pro 默认开启 thinking、默认 effort 为 high;简单任务用 low,日常 Agent 用 high,复杂任务用 max,并在工具调用的每一轮完整回传 `reasoning_content`。DeepSeek-V4-Pro 在 Codex 中的 Responses 配置工作流DeepSeek-V4-Pro 可通过原生 Responses API 接入 Codex CLI、ChatGPT 桌面应用和 VS Code 扩展;一次配置共享,但应先备份并验证 `config.toml`/`models.json`。XSCT Bench「自主规划执行」用例:deepseek-v4-pro 的 Agent 工具调用提示词与生成结果平台公开了完整的系统提示词、用户提示词、模型实际生成产物和双难度得分(基础 98.0 / 进阶 92.6):一份可直接复制的“先 `<plan>` 规划、JSON 调工具、`<observation>` 复盘、`<summary>` 收尾”的 Agent 执行提示词。DeepSeek-V4-Pro 在 Claude Code 中的 1M 上下文环境变量配置工作流通过 8 个环境变量即可把 Claude Code(及 Claude Desktop 开发者模式)指向 DeepSeek,用 `deepseek-v4-pro[1m]` 解锁 1M 上下文,并用 `deepseek-v4-flash` 承担子代理,主模型 effort 设 `max`、自动压缩窗口 786432。