CowAgent 作为开源中立的 Agent 框架,关注模型在 Agent 链路中的真实表现(工具调用、长上下文、长期记忆、浏览器自动化、知识组织),用 6 个真实场景全面测试 DeepSeek V4 模型,本次评测主要关注 deepseek-v4-flash。
价格约为 Pro 的 1/10、Claude Sonnet/Opus 的几十分之一、MiniMax M2.7 的三分之一,响应速度更快。
模型:deepseek-v4-flash;深度思考开启,reasoning_effort 默认 high(可设 max)
单任务最大步数 50;历史对话保留 20 轮;上下文 token 上限 100 万
工具:13 个内置工具(bash / edit / read / write / web_search / web_fetch / browser 等)
技能:30+ Skills(frontend-engineer / image-generation / video-gen / pptx-creator 等)
| 场景 | 关注点 | 耗时 | 工具调用 | 结果 |
|---|---|---|---|---|
| s1 任务规划与技能调度 | 多工具/Skill 协同、长链路规划 | 229.5s | 35 次 | 成功,链路一次跑通无冗余 |
| s2 复杂交互式编程 | 单文件零依赖前端 | 381.7s | 28 次 | 成功,主动分块写入 + 浏览器截图回看 |
| s3 长期记忆 | 跨 session 记忆检索 + 推理 | 142.4s | 2 次 | 成功,14 条记忆精准检索 |
| s4 浏览器自动化(小红书) | 真实站点多步操作、登录态处理 | 124.4s | 8 次 | 成功,扫码节点处理是亮点 |
| s5 知识库自动构建 | 联网调研 + 知识图谱组织 | 210.6s | 26 次 | 成功,13 篇文档互相 link |
| s6 超长上下文处理 | 56 万词《战争与和平》全文消化 | 156.3s | 50 次 | 成功,先落盘再搜索定位 |
任务规划:35 次工具调用克制精准,拆解 → 调研 → 沉淀 → PPT → 知识库一次跑通
复杂编程:主动分块写入避免 token 截断;主动调用浏览器截图回看(模型自加的稳定性兜底)。遗憾:要求"零外部依赖"仍引用了 echarts CDN
长期记忆:全新 session 只用 2 次工具调用取出全部品牌细节(视觉色、供应商、租金、薪资一字不差),并给出结构化建议
浏览器自动化:遇登录页主动截图二维码暂停等用户;发布前停在按钮前等确认,Agent 安全感细节到位
知识库:切成概念页/Server 页/客户端页并互相 link,每篇结尾带"相关阅读",真正做出图谱
超长上下文:没有把 3.36MB 全文塞进 context,而是先落盘、用 grep 定位行号、分段读取——"该装什么进上下文、什么时候走工具"才是 Agent 需要的长上下文能力
零失败、零死循环:6 个场景全部一次跑通,这是从 V3 到 V4 最显著的升级
响应快:所有场景 2~6 分钟完成,步骤流式输出,体感延迟低
Flash 稳定性已足以做 Agent 默认模型,长期记忆和长上下文表现超出预期
短板:复杂约束执行偶尔打折扣(如"零外部依赖"仍引 CDN),复杂场景下 Pro 大概率更稳
DeepSeek V4 Flash