7 月 31 日,DeepSeek 官宣 DeepSeek-V4-Flash 正式版 API 开启公测,大幅升级代理能力,正式版基准测试得分远超 V4-Pro 预览版。Agent 智能体终极测试中,V4-Flash 正式版得分 25.2 分,接近 Opus-4.8 的 25.7 分,远高于 V4-Pro 预览版 15.8 分。
张泽(深度使用 codex 和 hermes 的 AI 开发者):
将 V4-Flash 接入 Hermes:相同任务和提示词下,V4-Flash 正式版 + Hermes 约 40 秒完成,GPT-5.6 Sol + Codex 用了 1 分 47 秒
承认 Codex 输出内容质量确实更高,但 V4-Flash 正式版交付达到可用水平,"在及格线之上"
选择和调用 skill 的准确度总体不错,能根据工具返回结果调整后续步骤,组合已能顺畅满足个人需求
孙涛(8 月 1 日反馈):
"在国内模型里,它比 GLM 5.2 会好一些,但是比 GPT 5.6 其实还差一些"
主力工具是 Codex 和 Pi Agent;把 V4-Flash 接入 Pi Agent 使用体验挺好
因非多模态,主要用途在偏推理、代码和长文档
GPT-5.6 Sol:输入 $5 / 百万 tokens、缓存输入 $0.5、输出 $30
V4-Flash 正式版:输入 1 元、缓存输入 0.02 元、输出 2 元(人民币)
成本差距在数十倍到上百倍
张泽实测:V4-Flash 接入 Hermes 执行本地文件阅读 + 全网信息检索汇总任务,用量约 51 万 tokens,消耗 0.53 元
DeepSeek 在 6 月底邮件中预告 API 定价首次引入峰谷定价机制:
V4-Pro:百万 tokens 输入(缓存命中)从 4 月预览版 1 元,降至正式版平时 0.025 元、高峰 0.05 元
V4-Flash 正式版:百万 tokens 输入(缓存未命中)和输出在高峰时段反而比 4 月预览版翻倍,分别是 2 元和 4 元
峰谷定价机制具体执行时间尚未正式通知
7 月 28 日 OpenRouter 数据显示中国 AI 大模型周调用量领跑全球:小米 MiMo-V2.5、DeepSeek V4-Flash、腾讯 HY3、智谱 GLM-5.2、DeepSeek V4-Pro(DeepSeek 两款进前五)
截至 7 月 26 日近 28 天:中国模型市场份额约 63.5%,美国模型 35.5%
DeepSeek Harness 即将公布:DeepSeek 上半年加大 Harness 布局(6 月 21 日崔添翼发文表示 Harness 组仍缺人),中信证券认为 Harness 核心价值是解决长程任务痛点、连接模型与泛办公场景,AI 竞争正由模型转向任务交付
DeepSeek V4 Flash