Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体DeepSeek V4 Pro

Artificial Analysis:DeepSeek V4 Pro 0813(max effort)智能指数、成本与定位

原始来源

Artificial Analysis(independent model intelligence platform)

作者Artificial Analysis 团队(独立第三方)

Tabbit 整理2026-08-21

查看原文

一句话结论

AA 对 DeepSeek V4 Pro 0813(Reasoning, Max Effort)的测量:Intelligence Index 53、位列其 107 模型池第 3;速度 80.3 tok/s、输出 $3.96/1M(峰值)、上下文 1M、总参 1.6T/激活 49B——智能顶尖但偏贵、偏啰嗦(单次指数评测生成 130M tokens)。

适用场景

  • 适合的任务:把 V4-Pro 放在同一指数尺度上与其它前沿模型比较(智能/速度/成本/啰嗦度四维);为“Pro 适合什么任务”提供第三方证据(高智能 + 长上下文 + 文本-only)。

  • 不适合的任务:把 Intelligence Index 当成某一代码库成功率;把 2026-04-24 旧版与 0813 新版数据混用;用峰值价格替代全部成本计算(非峰值与 cache 折扣差异大)。

  • 适用的模型版本:DeepSeek V4 Pro 0813(页面以 max effort 推理配置测量;官方另有非推理变体存在但本页未测)。

  • 适用的客户端、Agent 或 API:AA 统一 API Provider Benchmark harness;模型输出为文本,官方 API 支持 Responses/Anthropic 格式。

  • 推荐的推理档位和参数:本页为 max effort 档;AA 提示低档位(如 high/low)的智能、token 与成本会不同,需按档位分别查询。

测试环境

  • 指标:Artificial Analysis Intelligence Index(综合智能),单位任务成本、输出速度、Verbosity(指数评测期间生成 token 总量)。

  • 测量结果(页面原文):Intelligence Index 53,排名 3/107(同类中位数 27);Speed 80.3 tok/s,排名 22/107(中位数 67);Cost 输入 $1.32/1M、输出 $3.96/1M(峰值价,cache 折扣 97%),每 Intelligence Index 任务成本 $0.25,排名 24/107(输入中位数 $0.30、输出中位数 $1.20);Verbosity 130M tokens(中位数 100M,偏啰嗦);整次指数评测总成本 $604.51。

  • 技术规格:上下文 1M(约 1500 页 A4);总参数 1600B、激活参数 49B;输入/输出均文本;MIT 许可;权重在 Hugging Face。

  • 对照基准:同类(open weights, Large >150B 或 reasoning 类)模型池 107 个;“Highlights”对比图列出 Claude Opus 5 (max)、Claude Fable 5、GPT-5.6 Sol (max)、Grok 4.6 (high)、Kimi K3 (max)、GLM-5.3 (max)、Muse Spark 1.2 (xhigh) 等。

原始证据与数据

  • 页面定位语句(原文):“DeepSeek V4 Pro 0813 (Reasoning, Max Effort) is amongst the leading models in intelligence, but somewhat expensive when comparing to other open weight models of similar size. It's also faster than average, however somewhat verbose.”

  • 同一指数 53 与 Reuters 2026-08-13 报道一致(见测评/03),说明 AA 数据可交叉核对;ChatBench 2026-08-12 快照显示的旧版(Released 2026-04-24、AA Index 43.75)与本页 0813 不同,注意区分版本。

  • 成本口径:页面价格为峰值档($1.32/$3.96),与官方定价页 2026-08-16 生效的峰值价一致;非峰值减半($0.66/$1.98),cache hit 输入 $0.022/$0.044。

适用边界

  • AA 是第三方指数:样本、权重与 harness 由 AA 控制,未完全公开(Reuters 报道同样指出);指数是综合分,不是任务成功率。

  • “max effort”是页面的固定配置:max 档的 token 消耗与成本显著高于官方默认 high;生产选型应按实际档位重查数据。

  • Verbosity 130M 说明 max 档输出冗长:长对话与批量任务需把 token 成本计入,必要时用 low/high 档对比。

  • 页面价格为采集时点数据:DeepSeek 2026-08-16 起实行峰/非峰计费,后续调价需重新核对。

来源摘录或观察(仅做合规短引)

页面原文:“In total, it cost $604.51 to evaluate DeepSeek V4 Pro 0813 (Reasoning, Max Effort) on the Intelligence Index.”

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

DeepSeek V4 Pro

在 Tabbit 中使用并对比模型

DeepSeek V4 Pro

相关测评

官方DeepSeek API Docs2026-08-13

DeepSeek-V4-Pro 官方发布:Reasoning 与 Agent 能力升级

媒体MindStudio2026-08-13

DeepSeek-V4-Pro-0813 MindStudio 八题编码与 Agent 实测对照

媒体Reuters2026-08-13

Reuters DeepSeek-V4-Pro-0813 价格与独立指数对照

媒体XSCT Bench(xsctbench.com,场景化模型选型评测)

XSCT Bench 两用例对照:V4-Pro 规划执行强、人设澄清弱

DeepSeek V4 Pro

相关提示词

官方DeepSeek API Docs

DeepSeek-V4-Pro 思考档位与工具调用工作流

官方DeepSeek API Docs

DeepSeek-V4-Pro 在 Codex 中的 Responses 配置工作流

官方DeepSeek API Docs(Agent Integrations / Claude Code)2026-08-13

DeepSeek-V4-Pro 在 Claude Code 中的 1M 上下文环境变量配置工作流

官方GitHub(官方仓库 deepseek-ai/deepseek-harness)与官方 X 账号 @deepseekai2026-08-13

DeepSeek Harness v0.1:官方插件化 Agent 框架的启动与配置