作者用一些大型代码变更评估测试了 deepseek v4 flash:
"用一些大型代码变更评估测试了 Deepseek v4 flash。它在使用准确性上彻底碾压!"
亮点:
上下文管理、工具使用准确性和思考轨迹看起来都非常出色
是作者测试过的少数开源权重模型之一,在多工具调用或复杂原生工具定义下不会混乱
多次运行中至少调用了 100 次工具调用,零错误,即使一次编辑多个文件也没有出错
缺点:
token 生成速度慢,思考时间较长(规划和执行阶段思考了足足几分钟)
展望:
读到 DeepSeek 将在 2026 下半年带来更多算力,期待(LFG)
工具调用可靠性极高(100+ 次调用零错误),是少有的多工具调用不混乱的开源模型
主要短板:生成速度慢、思考时间长
DeepSeek V4 Flash