模型:MiniMax M3,约 428B 总参数、约 23B 激活参数的 MoE;MiniMax Sparse Attention(MSA)支持最高 1M context;原生图像/视频输入和 computer use。
公开基准:SWE-Bench Pro、Terminal-Bench 2.1、SWE-fficiency、KernelBench Hard、MCP Atlas、PostTrainBench。
长任务案例:论文复现、NVIDIA Hopper FP8 GEMM 优化、让模型自主后训练四个基础模型。
评测方式:官方内部基础设施,部分任务使用 Claude Code/Terminus 2 等 harness;官方说明 SWE-Bench Verified 运行 4 次取平均,其他指标使用相应 sandbox 和超时。
官方基准基于 M3 的 coding/Agent 配置;Terminal-Bench 2.1 使用 8C16G sandbox、2 小时超时、128K 最大输出、Terminus 2 scaffolding。
论文复现:把论文、代码和实验日志放在长任务上下文,模型自主运行近 12 小时。
CUDA 优化:提供任务描述、benchmark 脚本和不能直接运行的 Triton skeleton,没有参考高性能实现;模型通过 benchmark 反馈迭代。
| 基准/案例 | 官方结果 |
|---|---|
| SWE-Bench Pro | 59.0% |
| Terminal-Bench 2.1 | 66.0% |
| SWE-fficiency | 34.8% |
| KernelBench Hard | 28.8% |
| MCP Atlas | 74.2% |
| PostTrainBench | 0.37(Opus 4.7: 0.42;GPT-5.5: 0.39) |
论文复现:近 12 小时、18 个 commits、23 张实验图,完成核心实验并复现主要趋势。
CUDA FP8 GEMM:约 24 小时、147 次 benchmark 提交、1,959 次工具调用;峰值利用率 7.6%→71.3%,相对初版 9.4×。
官方称 MSA 在 1M context 下每 token 计算量约为上一代的 1/20,prefill 加速超过 9×、decode 超过 15×;这是架构/服务侧数据,不是用户端通用吞吐承诺。
M3 的证据最集中在长时程编码、工具反馈迭代和多模态 Agent,而不是简单单轮聊天。官方案例显示它能在明确 benchmark 反馈下持续探索较长时间;基准分数处于可用的前沿区间,但不能脱离 harness 和内部评测口径解读。
全部为厂商自报,部分对照分数来自官方榜单或不同 harness;官方未公开所有原始轨迹、失败样本和随机种子。
论文复现和 CUDA 优化是精选案例,不能代表普通仓库的成功率。
1M context 和 MSA 加速数据不等于每个 API provider 都提供相同上下文、延迟或价格。
对公开代码任务固定 sandbox、工具、超时、输出上限和 harness,至少运行三次。
单独复现实验型长任务:记录每次提交、基准分、工具调用、token、墙钟时间和人工介入。
把模型能力、harness 编排和硬件/服务吞吐分开报告;不要用精选案例替代任务集统计。
对需要图像/视频输入的任务核验实际 API 端点是否提供原生多模态和相同计费。
官方发布页明确列出上述 5 项编码/Agent 基准和 PostTrainBench 对照值。
官方发布页公开了 12 小时论文复现与 24 小时 CUDA 优化的时间、提交数、工具调用和结果变化。
官方评测方法说明了 SWE-Bench Verified、Terminal-Bench 2.1 和 NL2Repo 的主要 harness/sandbox 口径。
官方定位是把“frontier coding、1M context、native multimodality”放在同一模型中;实际选型仍要回到具体工具链和反馈闭环。
MiniMax M3