Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体DeepSeek V3.2

SWE-bench Leaderboard 中 DeepSeek V3.2 的编码 Agent 结果

原始来源

SWE-bench Leaderboards

作者SWE-bench 团队

原文日期2026-02-17

Tabbit 整理2026-08-19

查看原文

一句话结论

SWE-bench 官方 leaderboard 的 mini-SWE-agent 条目显示 DeepSeek V3.2 high 为 70.00% resolved、$0.45/题,V3.2 Reasoner 为 60.00%、$0.03/题,证明 Agent harness/版本与推理配置会显著改变结果。

测试环境

  • 任务集:真实 GitHub issue;原始 benchmark 覆盖 12 个 Python 仓库,扩展页说明多语言任务覆盖 42 个仓库/9 种语言。

  • Agent:mini-SWE-agent;不同条目使用不同 release。

  • 指标:% Resolved、平均成本、模型、日期、release。

  • 团队核验:页面标注部分条目由 SWE-bench 团队直接运行或核查。

输入/配置

  • DeepSeek V3.2 high:mini-SWE-agent 2.0.0,日期 2026-02-17,70.00%,$0.45/题。

  • DeepSeek V3.2 Reasoner:mini-SWE-agent 1.17.1,日期 2025-12-01,60.00%,$0.03/题。

结果数据

同一表中,DeepSeek V3.2 high 排名 14,70.00%;与同 harness 的 Claude 4.5 Sonnet high 71.40%、Kimi K2.5 high 70.80%、GPT 5.2 high 72.80% 可作相对参照。V3.2 Reasoner 的 60.00% 来自更早 release/harness,不应直接和 2.0.0 行当作纯模型差异。

结论

DeepSeek V3.2 在真实 issue 修复 Agent 中是强开放模型基线;部署时应优先复现 high + 当前 harness 的质量/成本,再单独评估低成本 Reasoner 配置。

局限

  • Leaderboard 的“DeepSeek V3.2 high”不等同于所有 API alias 或自托管 checkpoint;Chat/Thinking/tool protocol 可能不同。

  • 两行日期和 mini-SWE-agent 版本不同,不能把 70 vs 60 解释为单纯 reasoning effort。

  • 页面没有逐题 prompt、失败轨迹、token 分布和置信区间;平均成本不等于你的 provider 账单。

  • resolved 仅衡量 issue 修复,不覆盖研究、对话或长上下文问答。

复现步骤

  1. 固定 SWE-bench split、任务版本、mini-SWE-agent release、模型 checkpoint、thinking/tool 配置和超时。

  2. 对 V3.2 high 与 Reasoner 分开跑,保存 patch、测试日志、reasoning_content、调用轨迹、token 和成本。

  3. 使用同 harness 跑一个闭源/开放参照模型,报告 resolved、timeout、error 和平均成本。

  4. 把 leaderboard 行作为可复核基线,标明你的 provider/harness 是否一致。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

DeepSeek V3.2

在 Tabbit 中使用并对比模型

DeepSeek V3.2

相关测评

官方DeepSeek API Docs / DeepSeek-V3.2 Release2025-12-01

DeepSeek-V3.2 官方发布:V3.2 与 Speciale 的推理/Agent 定位

媒体arXiv / DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models2025-12-03

DeepSeek-V3.2 技术报告:DSA、Agent 合成数据与推理基线

社区Reddit / r/LocalLLaMA2025-12

Reddit LocalLLaMA 对 DeepSeek V3.2 Agent 编码的体验边界

DeepSeek V3.2

相关提示词

官方DeepSeek API Docs / DeepSeek-V3.2 Release 与 Thinking Mode2025-12-01

DeepSeek-V3.2 的思考式工具调用与多轮状态配置

媒体DeepSeek-V3.2 技术报告(arXiv)2025-12-03

DeepSeek-V3.2 的长上下文与 Agent 证据锚定工作流