Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

DeepSeek V3.2 · 媒体来源 · 编辑分析

DeepSeek-V3.2 技术报告:DSA、Agent 合成数据与推理基线

技术报告把 V3.2 的优势归因于稀疏注意力、可扩展 RL 与大规模 Agent 任务合成:目标是在长上下文降低成本并提升工具泛化,但报告中的 benchmark 与 API 生产表现仍需独立复现。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源编辑分析编辑日期 2026-09-20

测试条件速查

条件
版本 V3.2 技术报告 v1;发布日期 2025-12-03;训练规模为 1,800+ 环境、85k+ 复杂指令;论文 benchmark 与 API harness 不同。

关键数据与适用场景

一句话结论

技术报告把 V3.2 的优势归因于稀疏注意力、可扩展 RL 与大规模 Agent 任务合成:目标是在长上下文降低成本并提升工具泛化,但报告中的 benchmark 与 API 生产表现仍需独立复现。

测试环境

  • 模型:DeepSeek-V3.2、V3.2-Exp、V3.2-Speciale;报告包含标准推理、长上下文、Agent 与人类偏好评估。

  • 架构:DSA(lightning indexer + fine-grained top-k selection),继续预训练后进行 specialist distillation 和 mixed RL。

  • 训练/评测数据:Agent 合成 pipeline 覆盖 1,800+ 环境、85,000+ 复杂指令;报告还提到 128K 长上下文训练和 H800 inference cost 估算。

输入/配置

报告的详细 benchmark 表/图没有完全以可复制文本呈现;其方法说明包括 thinking/non-thinking 专项、数学/编程/逻辑/通用 Agent/Agentic coding/search 六个域,及 outcome reward、length penalty、language consistency reward 等训练因素。

结果数据

  • 报告摘要称 V3.2 在多个推理 benchmark 与 GPT-5 相近,V3.2-Speciale 超过 GPT-5、接近 Gemini-3.0-Pro;Speciale 在 IMO/IOI 2025 达到金牌表现。

  • DSA 主注意力复杂度从 O(L²) 降至 O(Lk),每个 query 选择 2,048 个 key-value tokens(报告 sparse training 配置)。

  • 继续预训练的 sparse stage:1,500 steps、每步 480×128K sequences、约 943.7B tokens;这些是训练配置,不是部署必需参数。

  • 报告称 V3.2-Exp 在 Artificial Analysis Long Context Reasoning 比 V3.1-Terminus 高 4 分;并引用 Fiction.liveBench 多项领先,但这是报告引用的外部评测,不是本次独立复现。

结论

V3.2 的架构/训练路线针对长上下文效率与 Agent 泛化,适合把它作为开放权重 Agent 基线研究;但实际服务要分开验证 short/long context、thinking/tool-use 和 provider parser。

局限

  • 这是 DeepSeek 自报技术报告,benchmark 选择、提示、脚手架和评测细节不全;不能只据摘要排名下结论。

  • 训练 token、top-k 和 DSA 复杂度不直接决定 API 成本或用户可见质量。

  • V3.2、V3.2-Exp、Speciale 的 checkpoint/能力不同;跨变体比较会混淆。

  • 外部 Artificial Analysis/Fiction.liveBench 结果应回到原始页面复核。

复现步骤

  1. 选定模型变体、权重/服务端和任务 split,固定 thinking、工具、上下文长度与输出预算。

  2. 分层跑标准推理、代码、长上下文、工具调用和 Agent outcome 任务。

  3. 对长上下文记录 token/s、首 token、GPU/费用和准确率;对 Agent 保存完整 tool traces。

  4. 与 GPT/其他开放模型使用同 harness 对照,并区分官方报告数、外部结果和自己的复现数。

能支持的判断

  • 支持解释 DSA 与 Agent 合成数据为何被作为长上下文和工具泛化依据。

不能支持的判断

  • 不支持由训练规模推出你的成功率、延迟或成本。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

arXiv / DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models · DeepSeek-AI · 原文发布日期 2025-12-03 · 本站编辑日期 2026-09-20

打开原始来源

DeepSeek V3.2

在 Tabbit 中比较 DeepSeek V3.2

下载 Tabbit 客户端后检查模型可用性

相关评测

SWE-bench Leaderboard 中 DeepSeek V3.2 的编码 Agent 结果SWE-bench 官方 leaderboard 的 mini-SWE-agent 条目显示 DeepSeek V3.2 high 为 70.00% resolved、$0.45/题,V3.2 Reasoner 为 60.00%、$0.03/题,证明 Agent harness/版本与推理配置会显著改变结果。DeepSeek-V3.2 官方发布:V3.2 与 Speciale 的推理/Agent 定位官方把 V3.2 定位为日常平衡型、可在 thinking 与 non-thinking 中调用工具的 Agent 模型,把 V3.2-Speciale 定位为最高推理/竞赛型但发布时不支持工具,二者不能混作一个模型。Reddit LocalLLaMA 对 DeepSeek V3.2 Agent 编码的体验边界社区报告在 Claude Code 的个人场景中 MiniMax M2 更高效但规划深度不足,GLM 4.6 更可靠;对 DeepSeek V3.2 的判断仍待实测,并明确提醒 SWE-bench 只是粗略近似,不能代替真实工作流。DeepSeek-V3.2 的长上下文与 Agent 证据锚定工作流DeepSeek 的技术报告显示 V3.2 用大规模环境/复杂指令合成来训练 Agent 泛化;使用时应把工具结果、任务约束和可验证 outcome 组织成轨迹,而不是只依赖一句“请自主思考”。DeepSeek-V3.2 的思考式工具调用与多轮状态配置V3.2 把 thinking 直接融入 tool-use;多轮工具请求必须完整回传上一轮 `reasoning_content`,否则 API 会报错或丢失推理状态,且 thinking 模式不应配置 temperature/top_p。