Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

DeepSeek V4 Pro · 官方来源 · 厂商自报

DeepSeek-V4-Pro 官方发布:Reasoning 与 Agent 能力升级

DeepSeek 的 GA 公告明确把 V4-Pro 定位为生产 Agent 模型:支持可调 reasoning effort、Responses API 与 Codex,但公告没有公开可复核分数,不能把“major upgrades”当作胜率。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

官方来源厂商自报编辑日期 2026-09-20

测试条件速查

条件
版本 V4-Pro-0813;GA 公告 2026-08-13,价格 2026-08-16 生效;内容是产品集成说明,无统一 benchmark、样本或 harness。

关键数据与适用场景

一句话结论

DeepSeek 的 GA 公告明确把 V4-Pro 定位为生产 Agent 模型:支持可调 reasoning effort、Responses API 与 Codex,但公告没有公开可复核分数,不能把“major upgrades”当作胜率。

适用场景

  • 适合的任务:日常编码 Agent、复杂工具调用、Codex 集成和需要按成本调节推理深度的 API 工作流。

  • 不适合的任务:只凭发布公告选择模型或把 Pro 的宣传定位当作独立测评结果。

  • 适用的模型版本:DeepSeek-V4-Pro GA;公告说明模型名保持不变,API 仍按文档配置。

  • 适用的客户端、Agent 或 API:DeepSeek app/web 的 Expert Mode、DeepSeek API、Responses API、Codex。

  • 推荐的推理档位和参数:官方建议 low 用于简单任务、high 用于日常 Agent、max 用于复杂任务;应在自有 eval 中核实。

测试环境

  • 模型/版本:DeepSeek-V4-Pro GA(公告日期 2026-08-13)。

  • 工具与运行环境:API、app/web Expert Mode、Codex/Responses API;公告未提供统一 benchmark harness。

  • 输入/评测方式:官方发布说明和配置能力公告,不是题目级测评。

输入/配置

公告公开的配置差异是 reasoning effort:low、high、max;同时宣布原生 Responses API 支持和 Codex 一键配置。未公开 prompt、温度、运行次数、评分器或每项基准输入。

结果数据

官方公开信息可核实内容
Agent 定位官方称有“major Agent upgrades with strong production gains”
Reasoning effortlow/simple,high/daily Agent,max/complex
APIV4-Pro 可通过 API 使用;模型名保持不变
Responses/Codex原生 Responses API 支持,面向 Codex 优化并提供一键设置
产品入口app/web 的 Expert Mode
价格机制2026-08-16 16:00 UTC 起更新 V4 lineup 价格并引入 peak/off-peak;off-peak 比 peak 低 50%

结论

公告的可操作信息不是一个分数,而是一个成本/质量工作流:用 low/high/max 适配任务,优先 Responses API 和 Codex harness,并将 peak/off-peak 调度纳入预算。质量结论需要结合 MindStudio 的任务数据和自身复现。

局限与复现步骤

  • 局限:公告没有公开题目级 benchmark、harness、模型快照、token 或延迟数据;“生产收益”是厂商表述。

  • 复现步骤:固定 GA API endpoint 和请求日期;按简单 Agent/复杂 Agent 三类任务分别运行 low/high/max;记录成功率、工具错误、延迟、输入/输出/推理 token、峰谷价格,并与 V4-Flash 做同一任务对照。

  • 价格边界:峰谷价格与生效时间属于时变信息,部署前重新查官方价格页,不从公告中的“50%”推断具体金额。

原始证据与数据

公告原文提供 V4-Pro GA、reasoning effort、Responses/Codex、Expert Mode 和峰谷价格说明;本文没有补写公告未展示的分数或参数。

适用边界

  • low/high/max 是官方推荐场景,不等于各档位的固定 token 上限或质量保证。

  • “模型名保持不变”只说明 API 名称兼容,不代表 preview 与 GA 行为完全相同;复现必须记录日期和返回模型信息。

  • 高风险工具操作仍需外部权限、日志和人工复核。

来源摘录或观察(仅做合规短引)

公告把 V4-Pro 形容为 “Major Agent upgrades with strong production gains”,但没有给出分数;本文将该句保留为厂商定位而非测评结论。

能支持的判断

  • 支持引用 effort、Responses API、Codex 与生产 Agent 的官方定位。

不能支持的判断

  • 不支持把公告措辞当成独立胜率、延迟或可靠性测量。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

DeepSeek API Docs · DeepSeek · 原文发布日期 2026-08-13 · 本站编辑日期 2026-09-20

打开原始来源

DeepSeek V4 Pro

在 Tabbit 中比较 DeepSeek V4 Pro

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

DeepSeek V4 Pro:有哪些变化、如何计费,适合谁使用

用可回溯来源拆解 DeepSeek V4 Pro 0813 的 Agent 升级、API 限制、价格边界、独立测评与安全试用方法。

相关评测

DeepSeek-V4-Pro-0813 MindStudio 八题编码与 Agent 实测对照MindStudio 的公开八题实测给 V4-Pro-0813 61/80(76.25%),显示前端、规划、数学和长程 Agent 是强项,但 SVG、游戏打磨和简单任务的过度思考仍是边界。XSCT Bench 两用例对照:V4-Pro 规划执行强、人设澄清弱同一平台、同一被测模型的对照显示:V4-Pro 在“自主规划执行”(基础 98.0 / 进阶 92.6)上接近满分,而在“模糊需求澄清”人设用例上只得 68.5——结构化工具规划是强项,需要主动追问多义需求的人设对话是短板。Artificial Analysis:DeepSeek V4 Pro 0813(max effort)智能指数、成本与定位Artificial Analysis 的 2026-08-21 页面快照记录 V4-Pro 0813 max effort 指数 53、速度 80.3 tok/s、输出 $3.96/1M、1M context 与 1.6T/49B;本轮 2026-09-20 重开页面显示指数已为 36,不能混作同一时点。Reuters DeepSeek-V4-Pro-0813 价格与独立指数对照Reuters 引用 Artificial Analysis 的独立价格/指数数据:V4-Pro-0813 的 reasoning Intelligence Index 为 53、V4 Flash 为 40,但 Pro 的输入/输出价格约为 Flash 的 9/14 倍,选型必须把质量与成本一起算。DeepSeek-V4-Pro 思考档位与工具调用工作流V4-Pro 默认开启 thinking、默认 effort 为 high;简单任务用 low,日常 Agent 用 high,复杂任务用 max,并在工具调用的每一轮完整回传 `reasoning_content`。DeepSeek-V4-Pro 在 Codex 中的 Responses 配置工作流DeepSeek-V4-Pro 可通过原生 Responses API 接入 Codex CLI、ChatGPT 桌面应用和 VS Code 扩展;一次配置共享,但应先备份并验证 `config.toml`/`models.json`。DeepSeek-V4-Pro 在 Claude Code 中的 1M 上下文环境变量配置工作流通过 8 个环境变量即可把 Claude Code(及 Claude Desktop 开发者模式)指向 DeepSeek,用 `deepseek-v4-pro[1m]` 解锁 1M 上下文,并用 `deepseek-v4-flash` 承担子代理,主模型 effort 设 `max`、自动压缩窗口 786432。DeepSeek Harness v0.1:官方插件化 Agent 框架的启动与配置DeepSeek 官方开源的 Agent 框架:`一切皆插件`(模型、工具、技能、会话、沙箱、文件系统、循环、编排、UI 均可替换),一条 `npx @deepseek-ai/dsh web` 即可本地启动 Web UI,当前为开发者预览版、会破坏性变更。