DeepSeek V4 Flash · 社区来源 · 个人体验
作者称 Flash 在大型代码变更评估中工具使用和上下文管理突出,但没有公开题集、分数、版本或完整轨迹。
作者用一些大型代码变更评估测试了 deepseek v4 flash:
"用一些大型代码变更评估测试了 Deepseek v4 flash。它在使用准确性上彻底碾压!"
亮点:
上下文管理、工具使用准确性和思考轨迹看起来都非常出色
是作者测试过的少数开源权重模型之一,在多工具调用或复杂原生工具定义下不会混乱
多次运行中至少调用了 100 次工具调用,零错误,即使一次编辑多个文件也没有出错
缺点:
token 生成速度慢,思考时间较长(规划和执行阶段思考了足足几分钟)
展望:
读到 DeepSeek 将在 2026 下半年带来更多算力,期待(LFG)
工具调用可靠性极高(100+ 次调用零错误),是少有的多工具调用不混乱的开源模型
主要短板:生成速度慢、思考时间长
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Reddit r/LocalLLaMA · u/Comfortable-Rock-498 · 原文发布日期 Unknown · 本站编辑日期 2026-09-20
打开原始来源DeepSeek V4 Flash
下载 Tabbit 客户端后检查模型可用性