社区报告在 Claude Code 的个人场景中 MiniMax M2 更高效但规划深度不足,GLM 4.6 更可靠;对 DeepSeek V3.2 的判断仍待实测,并明确提醒 SWE-bench 只是粗略近似,不能代替真实工作流。
环境:Claude Code,开放权重模型本地/API 使用;作者有 MiniMax M2 与 GLM 4.6 经验,尚未完成 V3.2 亲自测试。
输入/配置:agentic coding 任务和 SWE-bench 排名讨论;没有公开统一 issue 集、采样参数、工具轨迹或重复次数。
结果形式:个人工作流报告和对 benchmark 外推的谨慎意见。
帖子没有完整 prompt。可复用实验设计是:在同一个 Claude Code/Agent harness、同一仓库和同一工具权限中分别运行 V3.2、GLM 4.6、MiniMax,记录计划偏航、工具调用和测试结果,而不是只看榜单。
作者称 MiniMax M2 作为 tool-calling agent 高效、compact、effective,但复杂规划容易偏航;GLM 4.6 更适合 daily drive,适当引导后接近 Sonnet 4.5 的个人体验。
作者在采集时尚未亲测 DeepSeek V3.2,只基于他人信息推测其可能略高于/接近 GLM 4.6;这是明确的未验证推测。
作者指出 SWE-bench 只是解决真实 GitHub issue 的粗略近似,忽略现实使用的不确定性与 benchmark 误差。
该报告的价值是提示“开放模型在真实 Agent harness 的规划、工具调用和稳定性可能与榜单不同”;DeepSeek V3.2 应以自己的仓库级任务和工具轨迹验证,而不是从帖子推断胜负。
作者没有实际测试 V3.2,不能将其推测写成测评结果。
体验来自单一用户、特定 Claude Code 配置,且比较模型版本可能不同。
无公开输入、输出、成功率、成本和统计方法,证据等级只能是个人体验。
固定同一 Agent harness、模型版本、工具权限、上下文和预算,准备至少 20 个真实 issue。
预注册完成标准:计划覆盖、patch 正确、测试通过、无越权写入和最终报告准确。
保存完整 prompt、reasoning/tool traces、patch、测试和失败原因,独立盲审偏航。
与 SWE-bench leaderboard 的 70% high 结果并列,但明确说明 harness 差异。
DeepSeek V3.2