Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

DeepSeek V4 Pro · 媒体来源 · 编辑分析

DeepSeek-V4-Pro-0813 MindStudio 八题编码与 Agent 实测对照

MindStudio 的公开八题实测给 V4-Pro-0813 61/80(76.25%),显示前端、规划、数学和长程 Agent 是强项,但 SVG、游戏打磨和简单任务的过度思考仍是边界。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源编辑分析编辑日期 2026-09-20

测试条件速查

条件
版本 V4-Pro-0813;MindStudio 八题 hands-on;日期 2026-08-13;样本 8 题,完整 prompt、重复与盲评流程未公开。

关键数据与适用场景

一句话结论

MindStudio 的公开八题实测给 V4-Pro-0813 61/80(76.25%),显示前端、规划、数学和长程 Agent 是强项,但 SVG、游戏打磨和简单任务的过度思考仍是边界。

适用场景

  • 适合的任务:前端生成、复杂规划、长程数据/微调/本地 UI 任务、需要先澄清歧义的 Agent 工作。

  • 不适合的任务:单行小修复或希望模型始终短答、不过度改造代码的场景;文章观察到 Pro 会过度思考和过度工程化。

  • 适用的模型版本:DeepSeek-V4-Pro-0813 GA;文章明确与 April preview 对照。

  • 适用的客户端、Agent 或 API:文章未公开统一客户端;结果来自作者的 coding/reasoning benchmark 与 hands-on 使用。

  • 推荐的推理档位和参数:未公开;实际接入可用官方 low/high/max 复测,不能由文章分数反推出 effort。

测试环境

  • 模型/版本:V4-Pro-0813;对照 V4 preview、V4 Flash、Kimi K3、Opus 5、Fable 5、Muse Spark 1.2、GLM 5.2 等(文章采用其当时命名)。

  • 输入/题型:八题,覆盖多电梯逻辑、3D 交互、折叠桌动画、SVG 熊猫、弓箭游戏、排列数学、长程自主数据生成/微调/本地 Web UI、3D 双时区手表。

  • 评测方式:每题 0–10 分,文章公开题目类型、逐题分数和总分;没有公开完整 prompt、模型调用参数或重复次数。

输入/配置

未公开温度、thinking effort、最大输出、工具列表、系统提示、随机种子和运行次数。文章另称 community specs 为 1M context,但未获 DeepSeek 官方确认,不能作为本测评配置。

结果数据

题目得分(/10)观察
多电梯逻辑模拟6核心逻辑基本工作,但边界情况有缺口
3D contact lens case 交互8与顶级模型相当
折叠桌动画9与 Fable 5、Kimi K3、GLM 5.2、Sonnet 5 并列最高一档
SVG 熊猫5明显弱项,低于 Muse Spark 1.2 的 10
弓箭游戏6可运行但不够打磨
排列数学10得出 2460,与多模型最高分一致
长程 Agent10自主完成数据生成、模型微调和本地 Web UI,无人工介入
3D 双时区手表7该测试当时最高,超过 V4 Flash 6 和此前 Fable 5 的 4
合计61/80(76.25%)文章称 preview 为 24.8%

官方/汇总榜分数(文章所述):Terminal Bench 2.1 87.9;Cyberjim 83.3;Automation Bench 31.8;HLE 无工具 42.7、有工具 60。文章没有给这些项目完整 harness,本文将其与八题实测分开记录。

结论

八题结果支持把 V4-Pro-0813 放入复杂前端和长程 Agent 候选;它在 SVG 精细产物、边界处理和简单任务效率上不能只看总分。Pro 与 Flash 的选择应按“规划/复杂任务 vs 日常执行/速度”做 A/B,而非固定 Pro 全包。

局限与复现步骤

  • 局限:文章没有逐题原始 prompt、工具轨迹、模型配置、重复次数或盲评者;“independent”只能理解为作者非官方文章中的实测,不是可完全复现的公开数据集。

  • 复现步骤:复刻八类任务并公开完整输入;固定模型 snapshot、effort、工具、上下文和时间上限;每题至少 3 次;按同一 0–10 rubric 盲评功能、视觉、边界处理和人工修改量;与 V4-Flash、Claude、Kimi 等在同一 harness 运行。

  • 成本记录:同时记录官方峰谷价格下的 token 成本,避免把质量优势与低价优势混成一个分数。

原始证据与数据

MindStudio 文章逐题给出 6/8/9/5/6/10/10/7,合计 61/80,并报告 preview 24.8%;正文还记录过度思考、过度工程化、前端生成/规划/澄清问题等现场观察。本文没有把社区传言的 1M context 当成已确认规格。

适用边界

  • 样本只有八题,任务选择和评分主观性会显著影响总分。

  • 文章中的 HLE、Terminal、Cyberjim 等数字与八题实测不是同一实验,不能合并成总排名。

  • 对“无人工介入”的长程任务仍要查看运行日志;文章没有公开完整 trace。

来源摘录或观察(仅做合规短引)

文章对现场行为的概括是 “overthinks simple problems” 和 “overengineering”;这两个观察比总分更适合作为生产验收用例。

能支持的判断

  • 支持把 61/80 与具体强弱任务一起阅读,而不是只看总分。

不能支持的判断

  • 不支持将八题结果外推为所有代码库、视觉任务或生产 Agent 的成功率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

MindStudio · Luis Chavez-Mattos · 原文发布日期 2026-08-13 · 本站编辑日期 2026-09-20

打开原始来源

DeepSeek V4 Pro

在 Tabbit 中比较 DeepSeek V4 Pro

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

DeepSeek V4 Pro:有哪些变化、如何计费,适合谁使用

用可回溯来源拆解 DeepSeek V4 Pro 0813 的 Agent 升级、API 限制、价格边界、独立测评与安全试用方法。

相关评测

XSCT Bench 两用例对照:V4-Pro 规划执行强、人设澄清弱同一平台、同一被测模型的对照显示:V4-Pro 在“自主规划执行”(基础 98.0 / 进阶 92.6)上接近满分,而在“模糊需求澄清”人设用例上只得 68.5——结构化工具规划是强项,需要主动追问多义需求的人设对话是短板。Artificial Analysis:DeepSeek V4 Pro 0813(max effort)智能指数、成本与定位Artificial Analysis 的 2026-08-21 页面快照记录 V4-Pro 0813 max effort 指数 53、速度 80.3 tok/s、输出 $3.96/1M、1M context 与 1.6T/49B;本轮 2026-09-20 重开页面显示指数已为 36,不能混作同一时点。DeepSeek-V4-Pro 官方发布:Reasoning 与 Agent 能力升级DeepSeek 的 GA 公告明确把 V4-Pro 定位为生产 Agent 模型:支持可调 reasoning effort、Responses API 与 Codex,但公告没有公开可复核分数,不能把“major upgrades”当作胜率。Reuters DeepSeek-V4-Pro-0813 价格与独立指数对照Reuters 引用 Artificial Analysis 的独立价格/指数数据:V4-Pro-0813 的 reasoning Intelligence Index 为 53、V4 Flash 为 40,但 Pro 的输入/输出价格约为 Flash 的 9/14 倍,选型必须把质量与成本一起算。DeepSeek-V4-Pro 思考档位与工具调用工作流V4-Pro 默认开启 thinking、默认 effort 为 high;简单任务用 low,日常 Agent 用 high,复杂任务用 max,并在工具调用的每一轮完整回传 `reasoning_content`。DeepSeek-V4-Pro 在 Codex 中的 Responses 配置工作流DeepSeek-V4-Pro 可通过原生 Responses API 接入 Codex CLI、ChatGPT 桌面应用和 VS Code 扩展;一次配置共享,但应先备份并验证 `config.toml`/`models.json`。XSCT Bench「自主规划执行」用例:deepseek-v4-pro 的 Agent 工具调用提示词与生成结果平台公开了完整的系统提示词、用户提示词、模型实际生成产物和双难度得分(基础 98.0 / 进阶 92.6):一份可直接复制的“先 `<plan>` 规划、JSON 调工具、`<observation>` 复盘、`<summary>` 收尾”的 Agent 执行提示词。DeepSeek-V4-Pro 在 Claude Code 中的 1M 上下文环境变量配置工作流通过 8 个环境变量即可把 Claude Code(及 Claude Desktop 开发者模式)指向 DeepSeek,用 `deepseek-v4-pro[1m]` 解锁 1M 上下文,并用 `deepseek-v4-flash` 承担子代理,主模型 effort 设 `max`、自动压缩窗口 786432。