官方把 V3.2 定位为日常平衡型、可在 thinking 与 non-thinking 中调用工具的 Agent 模型,把 V3.2-Speciale 定位为最高推理/竞赛型但发布时不支持工具,二者不能混作一个模型。
DeepSeek API Docs / DeepSeek-V3.2 Release · 查看证据DeepSeek V3.2 · 测评与证据
DeepSeek V3.2,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
技术报告把 V3.2 的优势归因于稀疏注意力、可扩展 RL 与大规模 Agent 任务合成:目标是在长上下文降低成本并提升工具泛化,但报告中的 benchmark 与 API 生产表现仍需独立复现。
arXiv / DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models · 查看证据SWE-bench 官方 leaderboard 的 mini-SWE-agent 条目显示 DeepSeek V3.2 high 为 70.00% resolved、$0.45/题,V3.2 Reasoner 为 60.00%、$0.03/题,证明 Agent harness/版本与推理配置会显著改变结果。
SWE-bench Leaderboards · 查看证据精选证据
DeepSeek-V3.2 官方发布:V3.2 与 Speciale 的推理/Agent 定位
官方把 V3.2 定位为日常平衡型、可在 thinking 与 non-thinking 中调用工具的 Agent 模型,把 V3.2-Speciale 定位为最高推理/竞赛型但发布时不支持工具,二者不能混作一个模型。
待验证:本次未能重新核实原文。
- 条件
- 版本 V3.2 与 V3.2-Speciale;官方页 2025-12-01;V3.2 覆盖 App/Web/API,Speciale 为 API-only 临时端点且发布时不支持工具;完整 harness 未公开。
DeepSeek-V3.2 技术报告:DSA、Agent 合成数据与推理基线
技术报告把 V3.2 的优势归因于稀疏注意力、可扩展 RL 与大规模 Agent 任务合成:目标是在长上下文降低成本并提升工具泛化,但报告中的 benchmark 与 API 生产表现仍需独立复现。
待验证:本次未能重新核实原文。
- 条件
- 版本 V3.2 技术报告 v1;发布日期 2025-12-03;训练规模为 1,800+ 环境、85k+ 复杂指令;论文 benchmark 与 API harness 不同。
SWE-bench Leaderboard 中 DeepSeek V3.2 的编码 Agent 结果
SWE-bench 官方 leaderboard 的 mini-SWE-agent 条目显示 DeepSeek V3.2 high 为 70.00% resolved、$0.45/题,V3.2 Reasoner 为 60.00%、$0.03/题,证明 Agent harness/版本与推理配置会显著改变结果。
待验证:本次未能重新核实原文。
- 条件
- 版本/档位 V3.2 high 与 V3.2 Reasoner;mini-SWE-agent;榜单条目日期 2026-02-17/2025-12-01;Verified 为 500 实例,完整日志未公开。
Reddit LocalLLaMA 对 DeepSeek V3.2 Agent 编码的体验边界
社区报告在 Claude Code 的个人场景中 MiniMax M2 更高效但规划深度不足,GLM 4.6 更可靠;对 DeepSeek V3.2 的判断仍待实测,并明确提醒 SWE-bench 只是粗略近似,不能代替真实工作流。
待验证:本次未能重新核实原文。
- 条件
- 版本 V3.2 未锁定 provider、snapshot 或 Claude Code;任务是个人 Agent 编码;评论者样本约 2025-12,日志和重复未公开。
全部来源
全部来源
DeepSeek-V3.2 官方发布:V3.2 与 Speciale 的推理/Agent 定位
官方把 V3.2 定位为日常平衡型、可在 thinking 与 non-thinking 中调用工具的 Agent 模型,把 V3.2-Speciale 定位为最高推理/竞赛型但发布时不支持工具,二者不能混作一个模型。
待验证:本次未能重新核实原文。
- 条件
- 版本 V3.2 与 V3.2-Speciale;官方页 2025-12-01;V3.2 覆盖 App/Web/API,Speciale 为 API-only 临时端点且发布时不支持工具;完整 harness 未公开。
DeepSeek-V3.2 技术报告:DSA、Agent 合成数据与推理基线
技术报告把 V3.2 的优势归因于稀疏注意力、可扩展 RL 与大规模 Agent 任务合成:目标是在长上下文降低成本并提升工具泛化,但报告中的 benchmark 与 API 生产表现仍需独立复现。
待验证:本次未能重新核实原文。
- 条件
- 版本 V3.2 技术报告 v1;发布日期 2025-12-03;训练规模为 1,800+ 环境、85k+ 复杂指令;论文 benchmark 与 API harness 不同。
SWE-bench Leaderboard 中 DeepSeek V3.2 的编码 Agent 结果
SWE-bench 官方 leaderboard 的 mini-SWE-agent 条目显示 DeepSeek V3.2 high 为 70.00% resolved、$0.45/题,V3.2 Reasoner 为 60.00%、$0.03/题,证明 Agent harness/版本与推理配置会显著改变结果。
待验证:本次未能重新核实原文。
- 条件
- 版本/档位 V3.2 high 与 V3.2 Reasoner;mini-SWE-agent;榜单条目日期 2026-02-17/2025-12-01;Verified 为 500 实例,完整日志未公开。
Reddit LocalLLaMA 对 DeepSeek V3.2 Agent 编码的体验边界
社区报告在 Claude Code 的个人场景中 MiniMax M2 更高效但规划深度不足,GLM 4.6 更可靠;对 DeepSeek V3.2 的判断仍待实测,并明确提醒 SWE-bench 只是粗略近似,不能代替真实工作流。
待验证:本次未能重新核实原文。
- 条件
- 版本 V3.2 未锁定 provider、snapshot 或 Claude Code;任务是个人 Agent 编码;评论者样本约 2025-12,日志和重复未公开。