MiMo-V2.6-Pro · 媒体来源 · 厂商自报
这份官方报告把 MiMo-V2.6-Pro 定义为 1.02T 总参数、约 42B 激活参数的原生全模态稀疏 MoE,并用大批量、多环境、多 harness 和 groupwise grader 的 RL 训练获得较强 Agent 基准成绩;但表中大部分数字是厂商自报,公开信息仍不足以独立复现每个 benchmark。
这份官方报告把 MiMo-V2.6-Pro 定义为 1.02T 总参数、约 42B 激活参数的原生全模态稀疏 MoE,并用大批量、多环境、多 harness 和 groupwise grader 的 RL 训练获得较强 Agent 基准成绩;但表中大部分数字是厂商自报,公开信息仍不足以独立复现每个 benchmark。
适合的任务:长上下文代码 Agent、通用工具工作流、视觉网页/设计任务、漏洞复现,以及需要文本、图像、视频和音频联合理解的 Agent 场景。
不适合的任务:仅凭官方表格判断生产成功率、成本效率或统计显著性;把内部 benchmark、训练曲线或演示案例当成独立盲测;把 Pro-RL 权重结果直接等同于 API 的 mimo-v2.6-pro-ultraspeed。
适用的模型版本:主要是开源 checkpoint XiaomiMiMo/MiMo-V2.6-Pro-RL;官方 API 使用小写别名 mimo-v2.6-pro,但报告没有证明 API 路由与公开权重在提供商、采样或后处理上完全相同。MiMo-V2.6-Flash-RL、MiMo-V2.6-Distill-Qwen-9B 和 UltraSpeed 必须单独记录。
适用的客户端、Agent 或 API:报告实验使用自有 Agent harness;模型卡给出 SGLang、vLLM、AI Studio、MiMo Code、MiMo Desktop、Open Platform API 和 OpenRouter 的部署入口。官方没有公开每个外部客户端的评测 harness 等价性。
推荐的推理档位和参数:报告称比较基线统一使用各模型最高可用 reasoning setting(max);模型卡建议采样 temperature=1.0、top_p=0.95。其余参数、工具超时、随机种子和 API 端点应在复测时显式记录。
报告覆盖 MiMo-V2.6-Pro 与 Flash 两个系列成员;本篇只把 Pro 的数据作为主结果。
| 项目 | MiMo-V2.6-Pro-RL 官方报告值 |
|---|---|
| 总参数 / 激活参数 | 1.02T / 约 42B |
| 主干 | 稀疏 MoE Transformer;首层为全局注意力 + dense FFN,其后交错 SWA 与 GA |
| 主干层数 | 70 层,其中 60 个 SWA、10 个 GA |
| 隐藏维度 | 6144 |
| 专家 | 384 个 routed experts,每 token 激活 8 个 |
| 滑动窗口 | 128 |
| 上下文 | 训练流程扩展至 1M tokens |
| 模态 | text、image、video、audio |
| 视觉编码器 | MiMo-ViT,681M 参数;28 层(24 SWA / 4 GA);patch 为 2 × 16 × 16;空间 merge 为 2 × 2 |
| 音频编码器 | AudioTokenizer 308M 参数;audio patch encoder 127M 参数 |
| MTP / speculative decoder | 5 层 SWA;以最多 1,024 个 backbone context positions 为条件,一次预测后续 7 个 token |
报告的预训练设置是两阶段:先以 text-only 数据训练语言主干,再与视觉和音频编码器联合进行全模态训练。Pro 的预训练 token 总量为 30T,其中 text 阶段 27T、omni 阶段 3T;上下文从 32K 扩展到 256K。随后 mid-training 在 256K 上训练,再在最后阶段扩展到 1M,并切换到面向大 batch 的 Muown 变体;embedding、LM head 和 MoE router 仍使用 AdamW,同时采用 MXFP4 quantization-aware training。
报告称先进行短 SFT,再进行一次混合任务 RL。核心设置如下:
| 项目 | 官方报告值 |
|---|---|
| 算法 | GRPO,异步 partial rollouts,staleness 为 4 |
| 每步 prompt 数 | 1,568 |
| 每个 prompt rollout 数 | 16 |
| 全局训练 batch | 约 25K trajectories |
| 每步训练 token | 约 2.7B–3.7B;约 110K–150K tokens / sequence |
| Pro RL 成本 | 约 260 万美元(报告第 8 页写约 $2.6M;官方发布页写约 $2.62M) |
| RL 任务混合 | coding 68%、general tool use 12%、aesthetic design 13%、context following 3%、cybersecurity 4% |
| 优化器 | Muown,学习率 3e-6,无 weight decay / warmup,gradient clipping 1.0;RL 阶段冻结 router |
| 评测基线推理档位 | 可配置 reasoning effort 的基线统一取最高支持档位 max |
训练信号不只使用 binary test reward。高通过率 code 任务使用 Groupwise Reward Synthesis(GRS)离线生成 task-specific solution/behavior rubrics,再按 R_i = R_test × S_sol × S_beh 合成 reward;其余 code 任务主要使用 Groupwise Advantage Redistribution(GAR),在同一 rollout group 内比较通过和失败轨迹,把正 advantage 更多分配给质量更高的通过解。报告还使用 group-relative length penalty、tool/format 行为惩罚和 batch-level advantage rebalancing,鼓励更短、更稳定的解。
报告把 harness 视为训练变量,而不是固定的产品外壳。训练用四个最小化、可组合的 mini-harness,均由 system prompt、tools、context management 和最小 Agent loop 组成;训练后在三个未见过的 harness(Codex、Claude Code、mini-swe-agent)上检查迁移。报告图 10 显示,DeepSWE v1.1 的 held-out harness 平均 Pass@1 约从 50% 升到 66%,但图中未给出逐题输入、样本数和置信区间。
环境分为四类:
Code:GitHub issue/PR、日常开发、规格驱动、源码驱动和长程工程任务;任务通过可执行测试,并用四次 rollout 审计 specification–test 对齐。
General agent:本地可重置 workspace、软件 mock、文件和数据库;使用代码检查与 LLM rubric 检查,另用跨模型 rollout 审查过严或过松的 rubric。
Visual agent:网页、交互应用、游戏、3D、slides、SVG、视频和 Figma;开放设计结合 pointwise 与 groupwise grading,高保真复制结合像素相似度和 LLM judging。
Cybersecurity:以 ASan/MSan/UBSan 报告中的漏洞类型和项目级栈顶位置作为 rule-based oracle;PoC 只有同时匹配两者才算通过。
报告还描述了 reward-hacking 防线:清理缓存、构建产物、Git 后续提交和网络访问,使用 hack agent 反复探测泄漏,再在训练中离线审计轨迹。作者称最终训练过程中确认的 reward-hacking 轨迹占比对 Pro 和 Flash 均低于 2%;这是厂商自报监控指标,不是外部审计结果。
以下数值来自技术报告 Table 3(Pro、Flash、上一代 Pro 与若干闭源模型对照)。- 表示报告未提供,不应补 0。除 GDPval-AA 的分数尺度外,其余表中数值按报告原样记录;官方没有在表格中提供每项的样本量、随机种子或完整 harness 配置。
| 类别 | Benchmark | MiMo-V2.6-Pro | Flash | MiMo-V2.5-Pro | Claude Opus 5 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|---|---|---|---|
| Code | DeepSWE v1.1 | 71.9 | 67.9 | 19.0 | 74.0 | 73.0 | 70.0 |
| Code | ProgramBench | 26.5 | 26.0 | 12.5 | 37.0 | 25.0 | 33.0 |
| Code | MiMo Code Bench | 63.2 | 61.2 | 40.4 | 68.6 | 59.3 | - |
| General | AutomationBench v1.0.6 | 53.1 | 52.3 | 16.0 | 50.3 | 45.8 | 46.2 |
| General | Toolathlon-Verified | 76.9 | 73.6 | 49.1 | 80.6 | 74.9 | 77.9 |
| General | GDPval-AA 2.1 | 1673 | - | 1107 | 1708 | 1588 | 1595 |
| General | Agents’ Last Exam | 31.6 | 27.6 | 13.2 | 31.6 | 30.8 | 25.7 |
| General | Terminal Bench 4.0 | 34.9 | 28.8 | 1.5 | 49.0 | 39.9 | 42.4 |
| General | Terminal Bench 2.1 | 89.9 | 87.6 | 65.2 | 89.1 | 88.8 | 84.3 |
| General | OSWorld-Verified | 82.0 | 80.8 | - | 83.4 | 83.0 | 86.0 |
| General | JobBench | 62.0 | 61.2 | 25.0 | 65.7 | 45.4 | 57.4 |
| Cyber | CyberGym | 94.0 | 95.1 | 40.0 | - | - | - |
| Cyber | MiMo Cyber Bench | 80.2 | 77.2 | 0.0 | - | - | - |
| Cyber | ExploitGym | 17.8 | 6.0 | 0.2 | 22.1 | 30.3 | 28.4 |
| Cyber | ExploitBench | 47.9 | 25.3 | 16.6 | 70.0 | 78.5 | 78.0 |
| Cyber | SEC Bench Pro | 66.3 | 47.5 | 17.7 | - | 79.1 | - |
| Visual | MiMo Visual Coding | 72.3 | 71.5 | - | 70.0 | 73.4 | 69.1 |
报告另给出两个过程性证据:
DeepSWE v1.1 的 average@3 在 Pro RL 过程中从 58.4 升至 72.6,Flash 从 48.7 升至 65.7;这是同一训练流程的前后变化,不是独立模型对照。
Pro 的 router 若不冻结,报告在 decoder layer 9 观察到 CV 从 0.78 升至 2.0、peak load 从约 6× 升至 16×、cold experts 从 0.5% 升至 22%;冻结 router 的 run 保持 CV 约 0.7、peak load 约 5.5×、cold experts 约 1%,benchmark 仍增长。该消融支持“RL 阶段冻结 MoE router”的工程选择。
要复核报告结果,至少应固定以下条件,并把公开权重与 API 结果分开:
下载 XiaomiMiMo/MiMo-V2.6-Pro-RL,记录 commit SHA、权重精度、推理引擎和 GPU 拓扑;不要把 Flash、Distill-Qwen-9B 或 UltraSpeed 混入 Pro 结果。
按模型卡的官方配置启动推理。vLLM 关键参数为 --tensor-parallel-size 8、--trust-remote-code、--gpu-memory-utilization 0.95、--max-model-len auto、--reasoning-parser mimo、--tool-call-parser mimo、--enable-auto-tool-choice、--generation-config vllm;采样先记录 temperature=1.0、top_p=0.95。
对每个 benchmark 保存版本、任务集、样本量、system prompt、工具 schema、最大 turns/tokens、超时、随机种子、逐题输出和评分日志。报告没有公开其中全部字段,缺失处必须标注“未公开”。
先复跑公开的 DeepSWE v1.1、ProgramBench、Terminal Bench 2.1、OSWorld-Verified、Toolathlon-Verified、CyberGym、ExploitBench 等,再单独实现或申请 MiMo 内部 benchmark;内部任务不可用公开数字假装复现。
复现 harness 转移时,分别在四个训练 mini-harness 和 Codex、Claude Code、mini-swe-agent 三个 held-out harness 运行同一代码任务,并报告每个 harness 的 Pass@1、样本量及均值计算方式。
复核 reward-hacking 时,在隔离、无网络环境中记录环境清理、hack-agent 探测、轨迹审计和 verifier 输出;不要仅用最终分数判断 reward 是否可靠。
技术报告第 1 页:摘要、1,568 samples、每步 2.7–3.7B tokens、四类环境、多 harness、groupwise grading 和冻结 router 的总览。
第 4–6 页:Hybrid-SWA 主干、MiMo-ViT、双阶段音频编码器、MTP 解码器和 Pro/Flash 配置表。
第 7–9 页:Pro 预训练 30T tokens(27T text + 3T omni)、mid-training 上下文扩展、RL 成本和 batch/rollout 设置。
第 10–16 页:code/general/visual/cyber 环境构建、测试稳定性、multi-harness 设计和 reward-hacking 防线。
第 17–20 页:GRS、GAR、长度惩罚与行为惩罚公式;GRS 的公开定义为 R_i = R_test_i × S_sol_i × S_beh_i。
第 20–24 页:RL task mix、Muown 参数、评测类别、held-out harness、router freeze 消融和失败分析。
第 26 页:Table 3 的 17 项 Pro benchmark 结果;第 34–36 页:Distill-Qwen-9B 的开放环境与多 harness 辅助实验。
官方模型卡公开的部署配置和模型元数据:https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/README.md。
厂商自报:Table 3、训练成本、训练前后分数、reward-hacking 占比和 harness 转移曲线均来自 Xiaomi MiMo;本篇没有把它们写成独立复测。
缺少复现要件:报告公开 benchmark 名称和总分,但没有为每个 benchmark 给出完整 prompt、system prompt、工具 schema、样本量、随机种子、逐题日志、置信区间、并行度和完整评分脚本。
内部任务不可直接横比:MiMo Code Bench、MiMo Cyber Bench、MiMo Visual Coding 是内部 benchmark;没有公开完整任务集时,只能作为厂商自报指标。
不同模型/端点不能混算:Pro-RL 权重、API mimo-v2.6-pro、mimo-v2.6-pro-ultraspeed、Flash 和 Distill-Qwen-9B 的计算图、服务层和推理配置可能不同。
训练过程分数不等于最终对照:DeepSWE 的 58.4→72.6 是 RL 过程的 checkpoint 变化,受数据、环境、grader、harness 和优化器共同影响,不能归因于单一架构因素。
图表近似值需保留不确定性:held-out harness 的“约 50%→66%”来自报告曲线,报告未在正文给出精确逐步数据;不能伪装成精确统计量。
报告没有给出统一失败率:虽然报告分析了 OOM、DBE、grader 网络不可达、expert imbalance 和 partial-rollout 等失败,但没有提供每个 benchmark 的失败样本分布,因此分数不代表端到端稳定性。
部署要求高:Pro 是 1.02T 稀疏 MoE,模型卡的官方 vLLM/SGLang 示例需要多卡/多节点配置;单卡或不同量化、不同并行策略的结果不能直接与表 3 对齐。
报告标题中的核心表述是 “Scaling Reinforcement Learning Towards Self-Improvement”,说明它的主要贡献是 RL 训练系统与环境,而不是仅发布一个静态模型权重。
报告训练设置明确写出 “1,568 prompts with 16 rollouts per prompt”;这解释了为何官方结果不能直接按普通单轮聊天调用复现。
模型卡把 Pro 的技术报告入口标为 “Technical Report”,并公开 MiMo_V2_6_technical_report.pdf、架构图、SGLang/vLLM 配置和完整 benchmark 表;本篇数字均优先核对该 PDF,而不是搜索摘要或转载。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Hugging Face(XiaomiMiMo 官方模型卡与技术报告) · LLM-Core Xiaomi / Xiaomi MiMo Team · 原文发布日期 2026-09-22 · 本站编辑日期 2026-09-22
打开原始来源MiMo-V2.6-Pro
下载 Tabbit 客户端后检查模型可用性