DeepSeek V4 Flash · 社区来源 · 独立测量
302.AI 实验室把 Flash 定位为低价 Agent 候选,并引用官方与自身测试材料;来源需区分厂商数字和实验室观察。
DeepSeek-V4-Flash 正式版上线!后训练让 Agent 与编程能力飙升,综合能力超过 V4 Pro。百万 Token 输入仅 1 元的"地板价"彻底刷新 Agent 门槛。
Agent 能力全面飙升:针对 Agent 场景大量后训练优化,复杂任务拆解、工具调用、代码执行明显提升;官方成绩单全面碾压 4 月发布的 V4-Pro-Preview,Agent Last Exam 上 25.2 vs 25.7,逼近 Opus 4.8 水平
原生支持 Responses API,适配 Codex 工作流:不用改 base_url 即可接入 Codex CLI、VS Code 插件或 ChatGPT 桌面端,官方提供 macOS/Linux 和 Windows 一键配置脚本
价格屠夫:百万 tokens 输入(缓存未命中)1 元、输出 2 元、缓存命中输入 0.02 元,每一项都比 GPT-5.6 Luna 更低
Pro 版正在路上:本次升级只针对 Flash API,App 和 Web 端暂时不变
在 Artificial Analysis 榜单中排名 21 位
使用 302.AI 收录的题库独立测试:逻辑与数学(10 题)、人类直觉(7 题)、编程模拟(12 题)
所有模型在 302.AI Studio 客户端使用统一提示词,取第一次生成结果
评分:满分 10 分,按对应扣分标准取平均;等级 S/A/B/C
案例 1:复杂逻辑推理(找符合自描述条件的 10 位数)
DeepSeek-V4-Flash 推理正确,唯一解 6210001000
Claude Opus 4.8 基本逻辑自洽但推理结果未贴合题意
案例 2:程序化 SVG 图形生成(袋鼠沙漠跳跃、F1 赛车动态图)
V4-Flash 在图形构成复杂度上略优于 Opus 4.8,动态实现质量比较单薄
Benchmark 成绩不等于实际场景体验,Agent 任务涉及规划、执行、纠错等环节
本评测侧重逻辑、数学、编程、多模态、人类直觉等问题的测试,非专业前沿领域权威测试,旨在观察模型进化趋势、提供选型参考
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
知乎专栏(zhuanlan.zhihu.com) · 作者未公开 · 原文发布日期 Unknown · 本站编辑日期 2026-09-20
打开原始来源DeepSeek V4 Flash
下载 Tabbit 客户端后检查模型可用性