Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体DeepSeek V4 Flash

DeepSeek-V4-Flash:本地部署量化与 Agent 实测

原始来源

MindStudio

作者Luis Chavez-Mattos

原文日期2026-08-01

Tabbit 整理2026-08-19

查看原文

一句话结论

V4-Flash 的本地运行可行性取决于多 GPU/量化与上下文余量,Open Code 的两个小型 Agent 项目表现连贯但仍出现真实数据错误,部署决策不能只看 benchmark 或 token 价格。

适用场景

  • 适合的任务:已有双 DGX Spark 或相近显存资源的团队,用于代码 Agent、数据驻留、可控延迟和长期 API 成本评估。

  • 不适合的任务:单张普通 GPU 的即装即用部署、原生视觉/音频输入、无需人工校验的事实型应用。

  • 适用的模型版本:文章讨论 DeepSeek-V4-Flash 0731/同架构本地权重;具体量化文件版本未在文章中给出。

  • 适用的客户端、Agent 或 API:本地 Open Code harness;文章同时讨论 DeepSeek API。

  • 推荐的推理档位和参数:文章没有公开完整 API 参数或 Agent system prompt;不要把约 25–30 tok/s 当作所有硬件配置的默认值。

测试环境、输入/配置

  • 本地硬件:双 NVIDIA DGX Spark 集群;文章还讨论单一 128 GB 系统配合 Dwarf Star 的 SSD offload、KV cache 操作和混合精度方案。

  • 量化估算:4-bit 约需 168 GB VRAM;3-bit 约需 110 GB,均未计入可用上下文额外内存。

  • 推理引擎/Agent:Open Code;Dwarf Star 作为降低显存压力的另一种引擎策略。

  • 任务:构建 Pokémon encyclopedia 网站;构建调用实时 API 的 space station tracker。

  • 完整输入与配置:文章未公开完整 prompt、工具 schema、重复次数、量化文件哈希或代码仓库,不能视作严格可复现 benchmark。

结果数据

  • 文章概述 DeepSweep 约从 7% 提升到 54%,并强调提升主要来自 post-training;该数字沿用官方/文章讨论,非作者重新跑出的独立分数。

  • 双 DGX Spark 的 Open Code 实测约 25–30 tokens/s。

  • Pokémon 项目约消耗 19,000 tokens;作者观察到模型保持可见 todo 列表,输出比早期 DeepSeek 更结构化、少冗余。

  • 两个 Agent 项目均未出现“重大错误”;space station tracker 的界面较完整,但位置数据只显示 North America,存在事实/数据正确性问题。

  • 文中给出的 API 参考价约为每百万输入 token 0.02 美元、每百万输出 token 0.30 美元;价格会随时间和峰谷时段变化,采购前应以官方价目表复核。

结论

本地部署的主要瓶颈是显存和上下文余量,而不是模型能否启动;双 DGX Spark 能达到可交互速度。对于生产 Agent,文章最有价值的信号是“计划与 todo 维持良好”与“真实数据仍会错”同时存在,因此应保留数据校验、来源核对和人工验收。

局限

  • 这是单作者现场报告,不是盲测或多模型控制实验;没有完整 prompt、工具记录、失败率、重复次数和量化文件版本。

  • 文章明确提醒 DeepSeek 的 Agent 分数使用自家优化 harness,harness 差异可能显著改变 benchmark;其本地 Open Code 结果也不能直接等同于裸模型能力。

  • 4-bit/3-bit 显存数字是模型加载估算,不等于包含长上下文、KV cache、并发和系统开销后的最低配置。

  • 文章的 API 价格是采集时的近似值,不能替代 0731/当前官方价格。

复现步骤

  1. 固定 V4-Flash 具体权重、量化格式、推理引擎版本和显存布局,并记录是否启用 SSD offload/KV cache 优化。

  2. 用同一 Open Code harness 执行 Pokémon encyclopedia 和 space station tracker,保存 system prompt、工具 schema、commit、token、速度与错误日志。

  3. 至少重复多次,并加入数据来源校验测试,特别检查实时 API 的地理覆盖和时间戳。

  4. 在单 GPU、双 DGX Spark 与 API 三种环境下分别记录吞吐、首 token 延迟、峰值显存、成本和任务成功标准。

  5. 与不带 DeepSeek 专用 harness 的基线并跑,隔离模型改进与编排改进。

原始证据与数据

文章给出的关键部署数据是 4-bit 168 GB、3-bit 110 GB、双 DGX Spark 约 25–30 tok/s;案例数据是 Pokémon 约 19K tokens,space station tracker 出现 North America-only 的位置数据错误。作者同时提醒 agent benchmark 的 harness 影响不能忽略。

来源摘录或观察(仅做合规短引)

文章把实际结果概括为 “Both tasks ran without major errors”,但紧接着记录 tracker 的位置数据不准确;这正是“代码生成成功”与“产品事实正确”之间的边界。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

DeepSeek V4 Flash

在 Tabbit 中使用并对比模型

DeepSeek V4 Flash

相关测评

官方DeepSeek API Docs2026-07-31

DeepSeek-V4-Flash:0731 更新基准与 Harness 条件

官方deepseek.ai(独立网站,与 DeepSeek 官方无关)

DeepSeek V4 Flash Review (2026) — Specs, Tests & Speed

媒体Lightning AI 博客2026-04-27

DeepSeek V4 Alters Everything We Knew About Price-Performance Math(Lightning AI)

媒体BenchLM.ai(模型基准与定价追踪站)2026-07-31

DeepSeek V4 Flash 0731 Benchmarks, Pricing & Speed(BenchLM)

DeepSeek V4 Flash

相关提示词

官方DeepSeek API Docs2026-07-31

DeepSeek-V4-Flash:0731 思考档位与工具调用配置

官方DeepSeek API Docs2026-07-31

DeepSeek-V4-Flash:Codex Responses API 接入工作流

媒体腾讯云开发者社区(cloud.tencent.com)2026-06-05

别让 AI 把你气哭:2026年 DeepSeek-V4 提示词终极指南

社区GitHub 仓库 victorchen96/deepseekv4rolepalyinstruct(官方英文版 README)

DeepSeek V4 - 20260424 Version Roleplay — Thinking Mode Switching Guide (English version)