官方结果显示 M2.7 在真实工程、端到端项目和 Office/Agent 任务上覆盖面很广:SWE-Pro 56.22%、VIBE-Pro 55.6%、Terminal Bench 2 57.0%、GDPval-AA 1495、MM Claw 62.7%,但完整 harness 仍未公开。
模型:MiniMax M2.7;官方 API/Agent 与内部 Agent harness。
工程基准:SWE-Pro、VIBE-Pro、Terminal Bench 2、NL2Repo、SWE Multilingual、Multi SWE Bench。
办公/Agent 基准:GDPval-AA、Toolathlon、MM Claw(40+ skills/复杂工作)、MLE Bench Lite(22 ML competitions)。
配置:各基准由官方/内部 harness 执行;文章未给每个测试的完整输入、采样、重复次数、成本和置信区间。
官方案例包含生产日志/监控/部署时间线/trace/数据库/代码库的调试流程、Web/Android/iOS/模拟项目交付、Word/Excel/PPT 多轮编辑、研究报告与 TSMC 收入模型。部分结果来自内部复杂 skills、Agent Teams 和动态工具搜索。
SWE-Pro:56.22%;SWE Multilingual:76.5;Multi SWE Bench:52.7。
VIBE-Pro:55.6%;Terminal Bench 2:57.0%;NL2Repo:39.8%。
GDPval-AA:ELO 1495,官方称为 open-source models 中最高;Toolathlon:46.3%。
MM Claw:62.7%,官方称接近 Sonnet 4.6;在 40+ 个每个超过 2,000 tokens 的复杂 skills 上,skill adherence 97%。
MLE Bench Lite:3 次 24 小时试验平均 medal rate 66.6%,最佳 9 gold/5 silver/1 bronze。
M2.7 适合需要真实工程系统理解、端到端交付、工具/skills 编排的 Agent;但使用公开 API 时应把官方内部 harness 当作上限参考,重新测量裸模型或自有 scaffold 的效果。
这是厂商发布基准,完整 prompt、任务 split、harness、成本、失败样本和统计方差未公开。
许多数字依赖 MiniMax 内部 Agent Teams、memory、skills 和动态工具搜索,不能直接归因于裸模型。
GDPval-AA、MM Claw、SWE-Pro 等指标性质不同,不应合成一个总分。
“reduced recovery time under three minutes”是官方内部多次案例,不是受控平均性能。
明确选择 API、开源权重、vLLM/SGLang 或自定义 Agent harness,并锁定版本。
选取编码 issue、端到端项目、Terminal、办公文档、工具调用和长程实验任务,提供相同工具与权限。
记录 prompt、skill/tool 定义、调用轨迹、patch、测试、成本、延迟和人工介入。
将结果按基准和 harness 分层,单独报告裸模型与 Agent 编排收益。
MiniMax M2.7