DeepSeek-V4-Flash 正式版上线!后训练让 Agent 与编程能力飙升,综合能力超过 V4 Pro。百万 Token 输入仅 1 元的"地板价"彻底刷新 Agent 门槛。
Agent 能力全面飙升:针对 Agent 场景大量后训练优化,复杂任务拆解、工具调用、代码执行明显提升;官方成绩单全面碾压 4 月发布的 V4-Pro-Preview,Agent Last Exam 上 25.2 vs 25.7,逼近 Opus 4.8 水平
原生支持 Responses API,适配 Codex 工作流:不用改 base_url 即可接入 Codex CLI、VS Code 插件或 ChatGPT 桌面端,官方提供 macOS/Linux 和 Windows 一键配置脚本
价格屠夫:百万 tokens 输入(缓存未命中)1 元、输出 2 元、缓存命中输入 0.02 元,每一项都比 GPT-5.6 Luna 更低
Pro 版正在路上:本次升级只针对 Flash API,App 和 Web 端暂时不变
在 Artificial Analysis 榜单中排名 21 位
使用 302.AI 收录的题库独立测试:逻辑与数学(10 题)、人类直觉(7 题)、编程模拟(12 题)
所有模型在 302.AI Studio 客户端使用统一提示词,取第一次生成结果
评分:满分 10 分,按对应扣分标准取平均;等级 S/A/B/C
案例 1:复杂逻辑推理(找符合自描述条件的 10 位数)
DeepSeek-V4-Flash 推理正确,唯一解 6210001000
Claude Opus 4.8 基本逻辑自洽但推理结果未贴合题意
案例 2:程序化 SVG 图形生成(袋鼠沙漠跳跃、F1 赛车动态图)
V4-Flash 在图形构成复杂度上略优于 Opus 4.8,动态实现质量比较单薄
Benchmark 成绩不等于实际场景体验,Agent 任务涉及规划、执行、纠错等环节
本评测侧重逻辑、数学、编程、多模态、人类直觉等问题的测试,非专业前沿领域权威测试,旨在观察模型进化趋势、提供选型参考
DeepSeek V4 Flash