MiMo-V2.6-Flash · 媒体来源 · 厂商自报
官方模型卡将 XiaomiMiMo/MiMo-V2.6-Flash-RL 定义为 MiMo-V2.6 系列的效率平衡 checkpoint,并报告其在代码、通用 Agent、网络安全和视觉 Agent 基准上的结果;但评测硬件、样本量、完整 harness、提示词和解码设置未公开,结果应视为厂商报告,不能直接外推到所有任务或独立复现实验。
官方模型卡将 XiaomiMiMo/MiMo-V2.6-Flash-RL 定义为 MiMo-V2.6 系列的效率平衡 checkpoint,并报告其在代码、通用 Agent、网络安全和视觉 Agent 基准上的结果;但评测硬件、样本量、完整 harness、提示词和解码设置未公开,结果应视为厂商报告,不能直接外推到所有任务或独立复现实验。
适合判断的任务:长上下文、多模态输入、代码 Agent、通用 Agent、网络安全和视觉编码任务的官方能力定位;SGLang/vLLM 本地部署边界。
不适合外推的任务:未列出的任务、不同 harness 或不同解码参数下的准确率、延迟、吞吐、成本和生产稳定性;表格中的跨模型比较也不能替代同条件独立测试。
适用的模型版本:仅 MiMo-V2.6-Flash-RL;表中的 MiMo-V2.6 Flash 与该 checkpoint 对应。本文不把 MiMo-V2.6-Pro-RL、MiMo-V2.5-Pro 或其他旧版/Pro 型号的数据并入 Flash。
测试环境或客户端:Hugging Face 模型卡;可见部署示例包括 SGLang、vLLM、Transformers 和 Docker。评测硬件、操作系统、驱动、服务版本和 API 客户端未注明。
推理档位和参数:模型卡建议 temperature=1.0、top_p=0.95;未注明各基准是否使用该设置。SGLang 示例使用 --tp 8 --dp 2、--mem-fraction-static 0.65、EAGLE 草稿参数和 --reasoning-parser mimo --tool-call-parser mimo;vLLM 示例使用 --tensor-parallel-size 4、--gpu-memory-utilization 0.95、--max-model-len auto 及同样的解析器配置。
模型卡可见的方法信息分为训练/对齐描述和结果表两部分:
训练/对齐侧描述:官方称使用一次混合 RL 运行覆盖代码、通用 Agent、视觉和网络安全;任务与多个 harness 混在同一批次中。异步 GRPO 的可见规模是每步 1,568 prompts × 16 rollouts,每次更新涉及数十亿 token。GRS 以组内对比 rollout 生成任务化 rubric,GAR 对通过的轨迹排序并重新分配 advantage。
结果表:模型卡列出代码 Agent、通用 Agent、网络安全、视觉 Agent 四组基准,并将 Flash 与 MiMo-V2.6 Pro、MiMo-V2.5 Pro、Claude Opus 5、GPT-5.6 Sol、Claude Fable 5 并列。
可见评测条件:部分基准包含版本号,例如 DeepSWE v1.1、AutomationBench v1.0.6、GDPval-AA 2.1、Terminal Bench 4.0/2.1;其余版本、样本量、提示词、few-shot 设置、工具配置、评分脚本、硬件和重复次数均未注明。
结果性质:以下数字全部是模型卡中的厂商报告值;页面没有提供 Flash 的独立复测记录或逐项可复现的评测命令。
按模型卡原表抄录全部列(- 保留为原文缺失标记):
| 类别 | 基准(版本) | MiMo-V2.6 Pro | MiMo-V2.6 Flash | MiMo-V2.5 Pro | Claude Opus 5 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|---|---|---|---|
| Code Agent | DeepSWE v1.1 | 71.9 | 67.9 | 19.0 | 74.0 | 73.0 | 70.0 |
| Code Agent | ProgramBench | 26.5 | 26.0 | 12.5 | 37.0 | 25.0 | 33.0 |
| Code Agent | MiMo Code Bench | 63.2 | 61.2 | 40.4 | 68.6 | 59.3 | - |
| General Agent | AutomationBench v1.0.6 | 53.1 | 52.3 | 16.0 | 50.3 | 45.8 | 46.2 |
| General Agent | Toolathlon-Verified | 76.9 | 73.6 | 49.1 | 80.6 | 74.9 | 77.9 |
| General Agent | GDPval-AA 2.1 | 1673 | - | 1107 | 1708 | 1588 | 1595 |
| General Agent | Agents’ Last Exam | 31.6 | 27.6 | 13.2 | 31.6 | 30.8 | 25.7 |
| General Agent | Terminal Bench 4.0 | 34.9 | 28.8 | 1.5 | 49.0 | 39.9 | 42.4 |
| General Agent | Terminal Bench 2.1 | 89.9 | 87.6 | 65.2 | 89.1 | 88.8 | 84.3 |
| General Agent | OSWorld-Verified | 82.0 | 80.8 | - | 83.4 | 83.0 | 86.0 |
| General Agent | JobBench | 62.0 | 61.2 | 25.0 | 65.7 | 45.4 | 57.4 |
| Cybersecurity | CyberGym | 94.0 | 95.1 | 40.0 | - | - | - |
| Cybersecurity | MiMo Cyber Bench | 80.2 | 77.2 | 0.0 | - | - | - |
| Cybersecurity | ExploitGym | 17.8 | 6.0 | 0.2 | 22.1 | 30.3 | 28.4 |
| Cybersecurity | ExploitBench | 47.9 | 25.3 | 16.6 | 70.0 | 78.5 | 78.0 |
| Cybersecurity | SEC Bench Pro | 66.3 | 47.5 | 17.7 | - | 79.1 | - |
| Visual Agent | MiMo VisualCoding | 72.3 | 71.5 | - | 70.0 | 73.4 | 69.1 |
表中 - 是原文的缺失标记,不应解释为 0。由于各列的评测条件未注明,不能据此确认不同模型使用了同一 harness、提示词或时间窗口。
精确仓库标识:XiaomiMiMo/MiMo-V2.6-Flash-RL;模型卡标题和部署命令均使用此标识。
系列定位:MiMo-V2.6 系列中的 efficiency-balanced checkpoint。
架构:稀疏 MoE;模型卡摘要写为总参数 309B、激活参数 15B。
上下文:最大上下文 1M tokens;仓库 config.json 的 max_position_embeddings 为 1048576。
模态:文本、图像、视频、音频;标签含 multimodal、vision-language、audio、video-understanding、agent、long-context。
视觉编码器:681M 参数 MiMo ViT,28 层(24 SWA + 4 全注意力)。
音频编码器:308M 参数 AudioTokenizer + 127M 音频 patch encoder。
主干配置:48 层(39 SWA + 9 GA)、hidden size 4096、SWA Q/KV heads 64/8、GA Q/KV heads 64/4、sliding window 128、256 个 routed experts、每 token 激活 8 个 expert。
推测解码:5 层 SWA MTP speculative decoder;模型卡称每次前向预测后续 7 个 token,部署示例另配置 EAGLE 草稿步骤。
同一 Hugging Face 页面侧边栏另显示 Model size: 159B params,并列出 F32、BF16、F8_E4M3、U8 张量类型。模型卡正文的 309B total / 15B activated 是架构摘要,页面没有解释 159B 与其如何对应,也没有说明 159B 是否按某种权重格式、去除模块或统计口径计算。因此本文不强行换算或合并:
厂商架构口径:309B 总参数、15B 激活参数;用于描述稀疏 MoE 计算结构。
Hugging Face 页面摘要口径:159B params;仅作为页面元数据记录,不能替代正文架构数字。
复现建议:引用参数时同时注明口径,并以仓库当前 config.json、权重索引和实际加载日志进一步核对;不能把 159B 解释为 15B 激活参数,也不能把 Flash 与 Pro 合并。
在官方表格中,Flash 在 CyberGym(95.1)和 Terminal Bench 2.1(87.6)等项目表现较高;在 ExploitGym(6.0)、ExploitBench(25.3)和 SEC Bench Pro(47.5)上明显低于同表的 MiMo-V2.6 Pro。以上是逐项结果,不构成总体排名。
结果覆盖范围有限:GDPval-AA 2.1 的 Flash 值为空,且各基准的样本量、硬件、提示词、工具/harness 和评分细则未公开;不能据此推导延迟、吞吐、成本或真实业务成功率。
模型卡给出了本地部署边界,但它不是性能实测:SGLang 示例依赖 trust-remote-code、TP/DP 和 MTP/EAGLE 配置;vLLM 示例注明稳定版可能滞后,并指向预构建镜像 vllm/vllm-openai:mimov25-cu129。实际兼容性应以当前框架版本、显存和权重格式验证。
跨模型列(Claude、GPT 等)是厂商表格中的对照值,来源、时间和 harness 条件未注明;不能把它们当成同条件独立测量。
下载或挂载精确仓库 XiaomiMiMo/MiMo-V2.6-Flash-RL,不要替换为 Pro、V2.5 或其他 Flash 版本。
按模型卡的 Transformers、SGLang 或 vLLM 示例部署;保留 trust_remote_code、多模态编码器和 reasoning/tool-call parser 配置,并记录框架、镜像、驱动、GPU、显存、并行度和权重格式。
以 temperature=1.0、top_p=0.95 作为模型卡给出的采样起点;逐项记录实际 max tokens、工具设置、提示词、样本量和评分脚本。模型卡未给出这些评测细节,复现者必须自行补齐,不能声称与官方数字同条件。
运行同版本基准并分别保存原始输出、评分结果和失败样本;对表中 - 保持“未报告”,不要改写为 0。
对参数争议同时记录模型卡的 309B/15B 架构摘要、Hugging Face 159B 页面摘要、config.json 和实际加载日志,注明统计口径后再比较。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Hugging Face · Xiaomi MiMo Team · 原文发布日期 Unknown · 本站编辑日期 2026-09-22
打开原始来源MiMo-V2.6-Flash
下载 Tabbit 客户端后检查模型可用性