Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

DeepSeek V3.2 · 媒体来源 · 编辑分析

SWE-bench Leaderboard 中 DeepSeek V3.2 的编码 Agent 结果

SWE-bench 官方 leaderboard 的 mini-SWE-agent 条目显示 DeepSeek V3.2 high 为 70.00% resolved、$0.45/题,V3.2 Reasoner 为 60.00%、$0.03/题,证明 Agent harness/版本与推理配置会显著改变结果。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源编辑分析编辑日期 2026-09-20

测试条件速查

条件
版本/档位 V3.2 high 与 V3.2 Reasoner;mini-SWE-agent;榜单条目日期 2026-02-17/2025-12-01;Verified 为 500 实例,完整日志未公开。

关键数据与适用场景

一句话结论

SWE-bench 官方 leaderboard 的 mini-SWE-agent 条目显示 DeepSeek V3.2 high 为 70.00% resolved、$0.45/题,V3.2 Reasoner 为 60.00%、$0.03/题,证明 Agent harness/版本与推理配置会显著改变结果。

测试环境

  • 任务集:真实 GitHub issue;原始 benchmark 覆盖 12 个 Python 仓库,扩展页说明多语言任务覆盖 42 个仓库/9 种语言。

  • Agent:mini-SWE-agent;不同条目使用不同 release。

  • 指标:% Resolved、平均成本、模型、日期、release。

  • 团队核验:页面标注部分条目由 SWE-bench 团队直接运行或核查。

输入/配置

  • DeepSeek V3.2 high:mini-SWE-agent 2.0.0,日期 2026-02-17,70.00%,$0.45/题。

  • DeepSeek V3.2 Reasoner:mini-SWE-agent 1.17.1,日期 2025-12-01,60.00%,$0.03/题。

结果数据

同一表中,DeepSeek V3.2 high 排名 14,70.00%;与同 harness 的 Claude 4.5 Sonnet high 71.40%、Kimi K2.5 high 70.80%、GPT 5.2 high 72.80% 可作相对参照。V3.2 Reasoner 的 60.00% 来自更早 release/harness,不应直接和 2.0.0 行当作纯模型差异。

结论

DeepSeek V3.2 在真实 issue 修复 Agent 中是强开放模型基线;部署时应优先复现 high + 当前 harness 的质量/成本,再单独评估低成本 Reasoner 配置。

局限

  • Leaderboard 的“DeepSeek V3.2 high”不等同于所有 API alias 或自托管 checkpoint;Chat/Thinking/tool protocol 可能不同。

  • 两行日期和 mini-SWE-agent 版本不同,不能把 70 vs 60 解释为单纯 reasoning effort。

  • 页面没有逐题 prompt、失败轨迹、token 分布和置信区间;平均成本不等于你的 provider 账单。

  • resolved 仅衡量 issue 修复,不覆盖研究、对话或长上下文问答。

复现步骤

  1. 固定 SWE-bench split、任务版本、mini-SWE-agent release、模型 checkpoint、thinking/tool 配置和超时。

  2. 对 V3.2 high 与 Reasoner 分开跑,保存 patch、测试日志、reasoning_content、调用轨迹、token 和成本。

  3. 使用同 harness 跑一个闭源/开放参照模型,报告 resolved、timeout、error 和平均成本。

  4. 把 leaderboard 行作为可复核基线,标明你的 provider/harness 是否一致。

能支持的判断

  • 支持比较两个条目的 resolved、任务成本和推理档位差异。

不能支持的判断

  • 不支持把榜单结果当作当前价格、通用代码质量或无工具仓库成功率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

SWE-bench Leaderboards · SWE-bench 团队 · 原文发布日期 2026-02-17 · 本站编辑日期 2026-09-20

打开原始来源

DeepSeek V3.2

在 Tabbit 中比较 DeepSeek V3.2

下载 Tabbit 客户端后检查模型可用性

相关评测

DeepSeek-V3.2 技术报告:DSA、Agent 合成数据与推理基线技术报告把 V3.2 的优势归因于稀疏注意力、可扩展 RL 与大规模 Agent 任务合成:目标是在长上下文降低成本并提升工具泛化,但报告中的 benchmark 与 API 生产表现仍需独立复现。DeepSeek-V3.2 官方发布:V3.2 与 Speciale 的推理/Agent 定位官方把 V3.2 定位为日常平衡型、可在 thinking 与 non-thinking 中调用工具的 Agent 模型,把 V3.2-Speciale 定位为最高推理/竞赛型但发布时不支持工具,二者不能混作一个模型。Reddit LocalLLaMA 对 DeepSeek V3.2 Agent 编码的体验边界社区报告在 Claude Code 的个人场景中 MiniMax M2 更高效但规划深度不足,GLM 4.6 更可靠;对 DeepSeek V3.2 的判断仍待实测,并明确提醒 SWE-bench 只是粗略近似,不能代替真实工作流。DeepSeek-V3.2 的长上下文与 Agent 证据锚定工作流DeepSeek 的技术报告显示 V3.2 用大规模环境/复杂指令合成来训练 Agent 泛化;使用时应把工具结果、任务约束和可验证 outcome 组织成轨迹,而不是只依赖一句“请自主思考”。DeepSeek-V3.2 的思考式工具调用与多轮状态配置V3.2 把 thinking 直接融入 tool-use;多轮工具请求必须完整回传上一轮 `reasoning_content`,否则 API 会报错或丢失推理状态,且 thinking 模式不应配置 temperature/top_p。