MindStudio 的公开八题实测给 V4-Pro-0813 61/80(76.25%),显示前端、规划、数学和长程 Agent 是强项,但 SVG、游戏打磨和简单任务的过度思考仍是边界。
适合的任务:前端生成、复杂规划、长程数据/微调/本地 UI 任务、需要先澄清歧义的 Agent 工作。
不适合的任务:单行小修复或希望模型始终短答、不过度改造代码的场景;文章观察到 Pro 会过度思考和过度工程化。
适用的模型版本:DeepSeek-V4-Pro-0813 GA;文章明确与 April preview 对照。
适用的客户端、Agent 或 API:文章未公开统一客户端;结果来自作者的 coding/reasoning benchmark 与 hands-on 使用。
推荐的推理档位和参数:未公开;实际接入可用官方 low/high/max 复测,不能由文章分数反推出 effort。
模型/版本:V4-Pro-0813;对照 V4 preview、V4 Flash、Kimi K3、Opus 5、Fable 5、Muse Spark 1.2、GLM 5.2 等(文章采用其当时命名)。
输入/题型:八题,覆盖多电梯逻辑、3D 交互、折叠桌动画、SVG 熊猫、弓箭游戏、排列数学、长程自主数据生成/微调/本地 Web UI、3D 双时区手表。
评测方式:每题 0–10 分,文章公开题目类型、逐题分数和总分;没有公开完整 prompt、模型调用参数或重复次数。
未公开温度、thinking effort、最大输出、工具列表、系统提示、随机种子和运行次数。文章另称 community specs 为 1M context,但未获 DeepSeek 官方确认,不能作为本测评配置。
| 题目 | 得分(/10) | 观察 |
|---|---|---|
| 多电梯逻辑模拟 | 6 | 核心逻辑基本工作,但边界情况有缺口 |
| 3D contact lens case 交互 | 8 | 与顶级模型相当 |
| 折叠桌动画 | 9 | 与 Fable 5、Kimi K3、GLM 5.2、Sonnet 5 并列最高一档 |
| SVG 熊猫 | 5 | 明显弱项,低于 Muse Spark 1.2 的 10 |
| 弓箭游戏 | 6 | 可运行但不够打磨 |
| 排列数学 | 10 | 得出 2460,与多模型最高分一致 |
| 长程 Agent | 10 | 自主完成数据生成、模型微调和本地 Web UI,无人工介入 |
| 3D 双时区手表 | 7 | 该测试当时最高,超过 V4 Flash 6 和此前 Fable 5 的 4 |
| 合计 | 61/80(76.25%) | 文章称 preview 为 24.8% |
官方/汇总榜分数(文章所述):Terminal Bench 2.1 87.9;Cyberjim 83.3;Automation Bench 31.8;HLE 无工具 42.7、有工具 60。文章没有给这些项目完整 harness,本文将其与八题实测分开记录。
八题结果支持把 V4-Pro-0813 放入复杂前端和长程 Agent 候选;它在 SVG 精细产物、边界处理和简单任务效率上不能只看总分。Pro 与 Flash 的选择应按“规划/复杂任务 vs 日常执行/速度”做 A/B,而非固定 Pro 全包。
局限:文章没有逐题原始 prompt、工具轨迹、模型配置、重复次数或盲评者;“independent”只能理解为作者非官方文章中的实测,不是可完全复现的公开数据集。
复现步骤:复刻八类任务并公开完整输入;固定模型 snapshot、effort、工具、上下文和时间上限;每题至少 3 次;按同一 0–10 rubric 盲评功能、视觉、边界处理和人工修改量;与 V4-Flash、Claude、Kimi 等在同一 harness 运行。
成本记录:同时记录官方峰谷价格下的 token 成本,避免把质量优势与低价优势混成一个分数。
MindStudio 文章逐题给出 6/8/9/5/6/10/10/7,合计 61/80,并报告 preview 24.8%;正文还记录过度思考、过度工程化、前端生成/规划/澄清问题等现场观察。本文没有把社区传言的 1M context 当成已确认规格。
样本只有八题,任务选择和评分主观性会显著影响总分。
文章中的 HLE、Terminal、Cyberjim 等数字与八题实测不是同一实验,不能合并成总排名。
对“无人工介入”的长程任务仍要查看运行日志;文章没有公开完整 trace。
文章对现场行为的概括是 “overthinks simple problems” 和 “overengineering”;这两个观察比总分更适合作为生产验收用例。
DeepSeek V4 Pro