Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

DeepSeek V4 Flash · 媒体来源 · 独立测量

双 DGX Spark 上的本地部署与 Agent 现场报告

MindStudio 在双 DGX Spark 上报告约 25–30 tokens/s;4-bit 约 168GB、3-bit 约 110GB,两个小项目仍出现实时数据错误。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

测试/来源条件
来源自报的现场/实验条件;完整样本、harness 或重复次数按原文,未补造
模型版本
DeepSeek V4 Flash;不与 V4 Pro、0424、0731 或其他推理档位混并,除非来源明确如此
采集边界
既有来源笔记采集于 2026-08-17/18;动态事实待刷新

关键数据与适用场景

一句话结论

V4-Flash 的本地运行可行性取决于多 GPU/量化与上下文余量,Open Code 的两个小型 Agent 项目表现连贯但仍出现真实数据错误,部署决策不能只看 benchmark 或 token 价格。

适用场景

  • 适合的任务:已有双 DGX Spark 或相近显存资源的团队,用于代码 Agent、数据驻留、可控延迟和长期 API 成本评估。

  • 不适合的任务:单张普通 GPU 的即装即用部署、原生视觉/音频输入、无需人工校验的事实型应用。

  • 适用的模型版本:文章讨论 DeepSeek-V4-Flash 0731/同架构本地权重;具体量化文件版本未在文章中给出。

  • 适用的客户端、Agent 或 API:本地 Open Code harness;文章同时讨论 DeepSeek API。

  • 推荐的推理档位和参数:文章没有公开完整 API 参数或 Agent system prompt;不要把约 25–30 tok/s 当作所有硬件配置的默认值。

测试环境、输入/配置

  • 本地硬件:双 NVIDIA DGX Spark 集群;文章还讨论单一 128 GB 系统配合 Dwarf Star 的 SSD offload、KV cache 操作和混合精度方案。

  • 量化估算:4-bit 约需 168 GB VRAM;3-bit 约需 110 GB,均未计入可用上下文额外内存。

  • 推理引擎/Agent:Open Code;Dwarf Star 作为降低显存压力的另一种引擎策略。

  • 任务:构建 Pokémon encyclopedia 网站;构建调用实时 API 的 space station tracker。

  • 完整输入与配置:文章未公开完整 prompt、工具 schema、重复次数、量化文件哈希或代码仓库,不能视作严格可复现 benchmark。

结果数据

  • 文章概述 DeepSweep 约从 7% 提升到 54%,并强调提升主要来自 post-training;该数字沿用官方/文章讨论,非作者重新跑出的独立分数。

  • 双 DGX Spark 的 Open Code 实测约 25–30 tokens/s。

  • Pokémon 项目约消耗 19,000 tokens;作者观察到模型保持可见 todo 列表,输出比早期 DeepSeek 更结构化、少冗余。

  • 两个 Agent 项目均未出现“重大错误”;space station tracker 的界面较完整,但位置数据只显示 North America,存在事实/数据正确性问题。

  • 文中给出的 API 参考价约为每百万输入 token 0.02 美元、每百万输出 token 0.30 美元;价格会随时间和峰谷时段变化,采购前应以官方价目表复核。

结论

本地部署的主要瓶颈是显存和上下文余量,而不是模型能否启动;双 DGX Spark 能达到可交互速度。对于生产 Agent,文章最有价值的信号是“计划与 todo 维持良好”与“真实数据仍会错”同时存在,因此应保留数据校验、来源核对和人工验收。

局限

  • 这是单作者现场报告,不是盲测或多模型控制实验;没有完整 prompt、工具记录、失败率、重复次数和量化文件版本。

  • 文章明确提醒 DeepSeek 的 Agent 分数使用自家优化 harness,harness 差异可能显著改变 benchmark;其本地 Open Code 结果也不能直接等同于裸模型能力。

  • 4-bit/3-bit 显存数字是模型加载估算,不等于包含长上下文、KV cache、并发和系统开销后的最低配置。

  • 文章的 API 价格是采集时的近似值,不能替代 0731/当前官方价格。

复现步骤

  1. 固定 V4-Flash 具体权重、量化格式、推理引擎版本和显存布局,并记录是否启用 SSD offload/KV cache 优化。

  2. 用同一 Open Code harness 执行 Pokémon encyclopedia 和 space station tracker,保存 system prompt、工具 schema、commit、token、速度与错误日志。

  3. 至少重复多次,并加入数据来源校验测试,特别检查实时 API 的地理覆盖和时间戳。

  4. 在单 GPU、双 DGX Spark 与 API 三种环境下分别记录吞吐、首 token 延迟、峰值显存、成本和任务成功标准。

  5. 与不带 DeepSeek 专用 harness 的基线并跑,隔离模型改进与编排改进。

原始证据与数据

文章给出的关键部署数据是 4-bit 168 GB、3-bit 110 GB、双 DGX Spark 约 25–30 tok/s;案例数据是 Pokémon 约 19K tokens,space station tracker 出现 North America-only 的位置数据错误。作者同时提醒 agent benchmark 的 harness 影响不能忽略。

来源摘录或观察(仅做合规短引)

文章把实际结果概括为 “Both tasks ran without major errors”,但紧接着记录 tracker 的位置数据不准确;这正是“代码生成成功”与“产品事实正确”之间的边界。

能支持的判断

  • 支持做显存、量化和上下文余量的部署预估,并提醒代码完成不等于数据正确。

不能支持的判断

  • 不支持把单作者硬件观察当作通用吞吐、最低配置或生产成功率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

MindStudio · Luis Chavez-Mattos · 原文发布日期 2026-08-01 · 本站编辑日期 2026-09-20

打开原始来源

DeepSeek V4 Flash

在 Tabbit 中比较 DeepSeek V4 Flash

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

定价 · 简体中文

DeepSeek V4 Flash 价格:2026 年实际要花多少钱

DeepSeek V4 Flash 在 V4.1 迁移后更换了计费口径。本文解释缓存命中、峰谷时段和可复算的任务成本。

相关评测

DeepSeek V4 模型的 Agent 能力实测CowAgent 作者用六类真实场景观察工具调用、长上下文、长期记忆、浏览器自动化和知识组织。DeepSeek V4-Flash/Pro 实测报告:从购买到实战,性价比天花板级国产大模型体验CSDN 作者记录充值、API 配置、代码生成与排错,实际把 V4-Flash 和 V4-Pro 放在同一篇个人工作流中。DeepSeek-V4-Flash 使用体验:强大模型如何真正帮你完成工作?博客园文章强调 V4-Flash 的推理、编码和 Agent 提升,并转述 DeepSWE 7.3→54.4;没有公开复测协议。官方 0731 Agent 基准与复现条件官方 0731 表列出 Terminal Bench 2.1 82.7、DeepSWE 54.4 与 Toolathlon Verified 70.3;条件是 DeepSeek Harness minimal mode、max、top_p 0.95、temperature 1.0。用官方配置把 DeepSeek 接入 Codex先备份本地配置,再用官方脚本或最小 provider 字段接入 Responses API,并用可回滚任务验证。配置思考档位并正确续接工具调用把 low/high/max、工具结果和 reasoning_content 的回传顺序整理成可复查的接入步骤。用 DSH 分层委派并汇总专论来源公开了完整起始提示词:一级研究、二级反驳与编辑、最终综合,目标是单一有引用的 Markdown 产物。用 CRISPE 框架组织 DeepSeek 任务把角色、请求、背景、约束、风格和多方案尝试写成明确的任务合同。