SWE-bench 官方 leaderboard 的 mini-SWE-agent 条目显示 DeepSeek V3.2 high 为 70.00% resolved、$0.45/题,V3.2 Reasoner 为 60.00%、$0.03/题,证明 Agent harness/版本与推理配置会显著改变结果。
任务集:真实 GitHub issue;原始 benchmark 覆盖 12 个 Python 仓库,扩展页说明多语言任务覆盖 42 个仓库/9 种语言。
Agent:mini-SWE-agent;不同条目使用不同 release。
指标:% Resolved、平均成本、模型、日期、release。
团队核验:页面标注部分条目由 SWE-bench 团队直接运行或核查。
DeepSeek V3.2 high:mini-SWE-agent 2.0.0,日期 2026-02-17,70.00%,$0.45/题。
DeepSeek V3.2 Reasoner:mini-SWE-agent 1.17.1,日期 2025-12-01,60.00%,$0.03/题。
同一表中,DeepSeek V3.2 high 排名 14,70.00%;与同 harness 的 Claude 4.5 Sonnet high 71.40%、Kimi K2.5 high 70.80%、GPT 5.2 high 72.80% 可作相对参照。V3.2 Reasoner 的 60.00% 来自更早 release/harness,不应直接和 2.0.0 行当作纯模型差异。
DeepSeek V3.2 在真实 issue 修复 Agent 中是强开放模型基线;部署时应优先复现 high + 当前 harness 的质量/成本,再单独评估低成本 Reasoner 配置。
Leaderboard 的“DeepSeek V3.2 high”不等同于所有 API alias 或自托管 checkpoint;Chat/Thinking/tool protocol 可能不同。
两行日期和 mini-SWE-agent 版本不同,不能把 70 vs 60 解释为单纯 reasoning effort。
页面没有逐题 prompt、失败轨迹、token 分布和置信区间;平均成本不等于你的 provider 账单。
resolved 仅衡量 issue 修复,不覆盖研究、对话或长上下文问答。
固定 SWE-bench split、任务版本、mini-SWE-agent release、模型 checkpoint、thinking/tool 配置和超时。
对 V3.2 high 与 Reasoner 分开跑,保存 patch、测试日志、reasoning_content、调用轨迹、token 和成本。
使用同 harness 跑一个闭源/开放参照模型,报告 resolved、timeout、error 和平均成本。
把 leaderboard 行作为可复核基线,标明你的 provider/harness 是否一致。
DeepSeek V3.2