BenchLM 的动态证据账本列出 M2.7 18 条来源可展示结果,SWE-Pro 56.2%、SWE-Rebench 51.9%、SWE Multilingual 76.5%、VIBE-Pro 55.6%、Toolathlon 46.3%,同时标记该模型已被 M3 superseded,适合做历史基线。
目录状态:页面标记 Open Weight、Non-Reasoning、200K context、Released 2026-03-18,并标为 Superseded。
数据时间:2026-08-17;公开总分 63.06/100、#45/218,但该总分是 BenchLM 自定义聚合。
证据:页面区分 Provider exact、Benchmark exact、Secondary exact,并提供原始链接。
覆盖:Coding 9、Agentic 6、Knowledge 2、Math 1 等多类 benchmark;不是统一一次实验。
页面把 MiniMax 官方发布、SWE-Rebench、Vibe Code、React Native、Claw-Eval、Gert Labs、Epoch AI 等结果放在同一账本中;每行的模型版本、工具、采样和重复次数不完全相同。
| 基准 | 得分 | 页面证据 |
|---|---|---|
| SWE-Rebench | 51.9% | Benchmark exact |
| SWE-bench Pro | 56.2% | Provider exact,MiniMax 官方 |
| SWE-bench Verified (mini-swe-agent v2) | 75.4% | Secondary exact |
| SWE Multilingual | 76.5% | Provider exact |
| Multi-SWE Bench | 52.7% | Provider exact |
| VIBE-Pro | 55.6% | Provider exact |
| Terminal-Bench 2.0 | 57.0% | Provider exact |
| Toolathlon | 46.3% | Provider exact |
| MLE-Bench Lite | 66.6% | Provider exact |
| MM-ClawBench | 62.7% | Provider exact |
| NL2Repo | 39.8% | Provider exact |
账本支持 M2.7 作为工程/工具 Agent 的历史强基线,但“已过时”意味着部署前要比较 M3 或当前模型;在同一 benchmark/harness 下,不能直接使用动态榜单的自定义总分做选型。
BenchLM 总分和排名受自定义权重、覆盖和动态模型目录影响。
Provider exact 仍是厂商报告;Benchmark exact 的不同 harness 不能无条件合并。
页面记录的 SWE-bench Verified 75.4% 与 MiniMax 官方重点发布的 SWE-Pro 56.22% 不是同一测试,不能互换。
页面当前数据会更新,必须保存采集日期、来源 URL 和模型是否 superseded。
从 BenchLM 每行打开原始 benchmark/官方来源,固定版本、split、harness 和参数。
至少复跑 SWE-Rebench、SWE-Pro、Terminal-Bench、Toolathlon 和 MM Claw 类任务。
分别记录 resolved/accuracy、工具调用、token、延迟、费用和失败样本。
与 M3/其他当前模型使用同一 harness 对照,并在报告中保留 M2.7 历史结果。
MiniMax M2.7