技术报告把 V3.2 的优势归因于稀疏注意力、可扩展 RL 与大规模 Agent 任务合成:目标是在长上下文降低成本并提升工具泛化,但报告中的 benchmark 与 API 生产表现仍需独立复现。
模型:DeepSeek-V3.2、V3.2-Exp、V3.2-Speciale;报告包含标准推理、长上下文、Agent 与人类偏好评估。
架构:DSA(lightning indexer + fine-grained top-k selection),继续预训练后进行 specialist distillation 和 mixed RL。
训练/评测数据:Agent 合成 pipeline 覆盖 1,800+ 环境、85,000+ 复杂指令;报告还提到 128K 长上下文训练和 H800 inference cost 估算。
报告的详细 benchmark 表/图没有完全以可复制文本呈现;其方法说明包括 thinking/non-thinking 专项、数学/编程/逻辑/通用 Agent/Agentic coding/search 六个域,及 outcome reward、length penalty、language consistency reward 等训练因素。
报告摘要称 V3.2 在多个推理 benchmark 与 GPT-5 相近,V3.2-Speciale 超过 GPT-5、接近 Gemini-3.0-Pro;Speciale 在 IMO/IOI 2025 达到金牌表现。
DSA 主注意力复杂度从 O(L²) 降至 O(Lk),每个 query 选择 2,048 个 key-value tokens(报告 sparse training 配置)。
继续预训练的 sparse stage:1,500 steps、每步 480×128K sequences、约 943.7B tokens;这些是训练配置,不是部署必需参数。
报告称 V3.2-Exp 在 Artificial Analysis Long Context Reasoning 比 V3.1-Terminus 高 4 分;并引用 Fiction.liveBench 多项领先,但这是报告引用的外部评测,不是本次独立复现。
V3.2 的架构/训练路线针对长上下文效率与 Agent 泛化,适合把它作为开放权重 Agent 基线研究;但实际服务要分开验证 short/long context、thinking/tool-use 和 provider parser。
这是 DeepSeek 自报技术报告,benchmark 选择、提示、脚手架和评测细节不全;不能只据摘要排名下结论。
训练 token、top-k 和 DSA 复杂度不直接决定 API 成本或用户可见质量。
V3.2、V3.2-Exp、Speciale 的 checkpoint/能力不同;跨变体比较会混淆。
外部 Artificial Analysis/Fiction.liveBench 结果应回到原始页面复核。
选定模型变体、权重/服务端和任务 split,固定 thinking、工具、上下文长度与输出预算。
分层跑标准推理、代码、长上下文、工具调用和 Agent outcome 任务。
对长上下文记录 token/s、首 token、GPU/费用和准确率;对 Agent 保存完整 tool traces。
与 GPT/其他开放模型使用同 harness 对照,并区分官方报告数、外部结果和自己的复现数。
DeepSeek V3.2