MiMo-V2.6-Flash · 媒体来源 · 厂商自报
厂商报告称,MiMo-V2.6-Flash 在 30 步、约 75 万条累计轨迹的 RL 训练后,DeepSWE v1.1 从 48.8 提升到 65.7;官方 Agent 基准表中,Flash 在 CyberGym 得分 95.1、Terminal Bench 2.1 得分 87.6、MiMo Visual Coding 得分 71.5。以上均为小米页面披露的结果,不是独立复测。
厂商报告称,MiMo-V2.6-Flash 在 30 步、约 75 万条累计轨迹的 RL 训练后,DeepSWE v1.1 从 48.8 提升到 65.7;官方 Agent 基准表中,Flash 在 CyberGym 得分 95.1、Terminal Bench 2.1 得分 87.6、MiMo Visual Coding 得分 71.5。以上均为小米页面披露的结果,不是独立复测。
适合判断的任务:代码 Agent、通用 Agent、网络安全 Agent、视觉 Agent,以及长程软件工程任务的官方公开基线。
不适合外推的任务:不能据此推断所有真实业务、不同提示词、不同工具链或不同推理参数下的表现;页面未给出每项基准的样本量、完整提示词、解码设置、随机种子、硬件配置或单项 harness 映射。
适用的模型版本:MiMo-V2.6-Flash;API 模型名应使用小写 mimo-v2.6-flash。
测试环境或客户端:小米 MiMo 官方发布页披露的 RL 训练与 Agent 基准;具体评测客户端、硬件、API 端点和运行配置未注明。
推理档位和参数:未注明。
官方页面称,MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 在不足 6 天内各完成 30 个训练步骤,累计约 750,000 条轨迹;训练成本分别约为 850,000 美元(Flash)和 2,620,000 美元(Pro)。页面同时报告训练任务平均通过率相对提升 25%(Flash)和 12%(Pro)。
训练规模与配置的可见信息:
每次更新使用 1,568 个样本,支持 1M 上下文长度;每个训练步骤的 token 数为 3.5–3.7B。
任务覆盖 Code、General、Visual、Cyber,并称通过多个 harness 进行多任务训练。
页面列出的开源端到端 RL 框架组件为 verl、uni-agent 和 mini-swe-agent;另称提供可组合的轻量级 mini-harnesses,但没有给出各基准对应的 harness 名称或配置。
为抑制专家负载漂移,训练中冻结 MoE Router;奖励可靠性措施包括奖励设计、对抗评测、异常检测和验证器交叉核验。
训练支持多 Agent 混合任务,并使用统一轨迹表示、惩罚机制,以及控制面与数据面解耦。
下表抄录原文图表中的可见数值。分数的量纲和百分比定义由各基准决定,原文未在发布页补充统一说明;— 表示图表未提供数值。
| 类别 | Benchmark | MiMo-V2.6-Flash | MiMo-V2.6-Pro | MiMo-V2.5-Pro | Claude Opus 5 | GPT-5.6 Sol | Fable 5 |
|---|---|---|---|---|---|---|---|
| Code Agent | DeepSWE v1.1 | 67.9 | 71.9 | 19.0 | 74.0 | 73.0 | 70.0 |
| Code Agent | ProgramBench | 26.0 | 26.5 | 12.5 | 37.0 | 25.0 | 33.0 |
| Code Agent | MiMo Code Bench | 61.2 | 63.2 | 40.4 | 68.6 | 59.3 | — |
| General Agent | AutomationBench v1.0.6 | 52.3 | 53.1 | 16.0 | 50.3 | 45.8 | 46.2 |
| General Agent | Toolathlon-Verified | 73.6 | 76.9 | 49.1 | 80.6 | 74.9 | 77.9 |
| General Agent | GDPval-AA 2.1 | — | 1673 | 1107 | 1708 | 1588 | 1595 |
| General Agent | Agents’ Last Exam | 27.6 | 31.6 | 13.2 | 31.6 | 30.8 | 25.7 |
| General Agent | Terminal Bench 4.0 | 28.8 | 34.9 | 1.5 | 49.0 | 39.9 | 42.4 |
| General Agent | Terminal Bench 2.1 | 87.6 | 89.9 | 65.2 | 89.1 | 88.8 | 84.3 |
| General Agent | OSWorld-Verified | 80.8 | 82.0 | 61.5† | 83.4 | 83.0 | 86.0 |
| General Agent | JobBench | 61.2 | 62.0 | 25.0 | 65.7 | 45.4 | 57.4 |
| Cybersecurity | CyberGym | 95.1 | 94.0 | 40.0 | — | — | — |
| Cybersecurity | MiMo Cyber Bench | 77.2 | 80.2 | 0.0 | — | — | — |
| Cybersecurity | ExploitGym | 6.0 | 17.8 | 0.2 | 22.1 | 30.3 | 28.4 |
| Cybersecurity | ExploitBench | 25.3 | 47.9 | 16.6 | 70.0 | 78.5 | 78.0 |
| Cybersecurity | SEC Bench Pro | 47.5 | 66.3 | 17.7 | — | 79.1 | — |
| Visual Agent | MiMo Visual Coding | 71.5 | 72.3 | — | 70.0 | 73.4 | 69.1 |
† 图表脚注说明:该 MiMo-V2.5 结果来自 MiMo-V2.5。原文没有说明 Flash 表中各项的测试样本量、评测日期、运行参数、置信区间或是否由同一 harness 执行。
| 模型 | 训练步骤 | 轨迹 | 训练成本 | 训练任务平均通过率相对提升 | DeepSWE v1.1(前 → 后) | 页面表述的提升 |
|---|---|---|---|---|---|---|
| MiMo-V2.6-Flash | 30 | 与 Pro 合计约 750,000 | 约 850,000 美元 | 25% | 48.8 → 65.7 | 约 17 分 |
| MiMo-V2.6-Pro | 30 | 与 Flash 合计约 750,000 | 约 2,620,000 美元 | 12% | 58.4 → 72.6 | 约 14 分 |
这里的“轨迹、成本、提升”均是厂商在发布页中的报告;原文没有给出 Flash 单独轨迹数,也没有提供独立评测记录。
页面称 MiMo-V2.6 系列包含两个原生全模态模型:Pro 与 Flash;本文只把 Flash 列作为目标模型数据。
页面文字称,RL 后 Flash “comprehensively outperformed MiMo-V2.5-Pro”,但没有在文字中给出该判断的统计口径;可核对的逐项数值以图表为准。
DeepSWE v1.1 被页面描述为 out-of-sample long-range software engineering evaluation benchmark;Flash 的发布页数值为 48.8 → 65.7。
图表比较对象明确为 MiMo-V2.6-Pro、MiMo-V2.5-Pro、Claude Opus 5、GPT-5.6 Sol 和 Fable 5;缺失值以 — 显示。
训练环境开源说明中,页面还报告从 MiMo-V2.6-Distill-Qwen-9B 的 SFT baseline 出发,在 11 个 benchmark 上均有提升,并举出 SWE-bench Verified、MiMo Cyber Bench、Terminal Bench 2.1 和 MiMo Visual Coding 的数值。这是 Distill-Qwen-9B 训练资源示例,不是 MiMo-V2.6-Flash 的基准结果,不能混入上表。
厂商主张:Flash 的公开表格显示其在 CyberGym、Terminal Bench 2.1、OSWorld-Verified 和 MiMo Visual Coding 等项目上取得较高分;RL 训练阶段的 DeepSWE v1.1 从 48.8 到 65.7。
独立测量:未提供。本文没有把官方数字当作独立复测。
版本边界:不要把 MiMo-V2-Flash、MiMo-V2.5-Pro、MiMo-V2.6-Pro 或 MiMo-V2.6-Pro-UltraSpeed 的数据改写为 Flash 数据。页面的 UltraSpeed 说明针对 Pro,最高 20 倍推理速度,不是 Flash 基准。
比较边界:图表中的不同模型可能使用不同的评测实现或可用工具;发布页未披露统一 harness、样本、提示词、采样参数和成本口径,因此不能据此作严格的跨模型因果结论。
文本与图表标签差异:正文提到 Claude Fable 5.1 和 GPT-6 Astra,基准图表列名则为 Fable 5、GPT-5.6 Sol 和 Claude Opus 5;本文按各处原样记录,不替厂商合并或校正名称。
其他可见限制:页面没有报告每项测试的失败案例、方差、置信区间、硬件、上下文截断策略、工具版本或安全限制;“comprehensively outperformed”等总体表述也未给出汇总公式。
打开原文并确认页面更新时间为 2026-09-22,阅读正文与基准图表。
使用小米公开的 mimo-v2.6-flash 模型 ID;不要替换成 Pro、V2.5-Pro、Pro UltraSpeed 或旧版 V2-Flash。
如需复核表中结果,应获取官方技术报告、评测代码、任务集版本、harness、提示词、采样参数、样本量和硬件配置;发布页本身不足以完整复现实验。
独立复测时,应单独记录实际 API/客户端、工具调用、成本和失败样本,并与本页厂商报告分栏,不得将复测结果回填为官方值。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Xiaomi MiMo 官方文档 · 小米 MiMo(厂商官方) · 原文发布日期 2026-09-22 · 本站编辑日期 2026-09-22
打开原始来源MiMo-V2.6-Flash
下载 Tabbit 客户端后检查模型可用性