MiMo-V2.6-Flash · 社区来源 · 厂商自报
该官方帖将 MiMo-V2.6-Flash 定位为与 Pro 并列的全模态模型,强调扩展强化学习、代码/通用 Agent/网络安全/视觉 Agent 能力和开放复现;附图给出 Flash 的逐项基准分,但没有公开样本量、完整 harness、硬件、提示词或解码参数,因此这些数字只能作为厂商基线。
该官方帖将 MiMo-V2.6-Flash 定位为与 Pro 并列的全模态模型,强调扩展强化学习、代码/通用 Agent/网络安全/视觉 Agent 能力和开放复现;附图给出 Flash 的逐项基准分,但没有公开样本量、完整 harness、硬件、提示词或解码参数,因此这些数字只能作为厂商基线。
适合判断的任务:代码 Agent、通用 Agent、网络安全 Agent 和视觉 Agent 的官方能力定位;判断 Flash 与 Pro 的产品分工和开源方向。
不适合外推的任务:真实业务成功率、延迟、吞吐、成本、稳定性,以及不同工具链或推理参数下的表现;也不能把 Pro 专属主张归给 Flash。
适用的模型版本:MiMo-V2.6-Flash。本帖未使用 MiMo-V2.6-Flash-RL 这一 checkpoint 名称。
测试环境或客户端:Xiaomi MiMo 官方 X 帖及其附图;评测硬件、客户端、API 端点和 harness 未注明。
推理档位和参数:未注明。
可见测评材料只有原帖附图中的一张表(图注为 “Table 3 Comparison of MiMo-V2.6 with previous-generation and frontier models on agentic benchmarks”)。表格按 Code Agent、General Agent、Cybersecurity、Visual Agent 分组,横向列出 MiMo-V2.6 Pro、MiMo-V2.6 Flash、MiMo-V2.5 Pro、Claude Opus 5、GPT-5.6 Sol 和 Fable 5。
原帖文字称两个模型通过 scaled reinforcement learning 推进,并称更强的 coding、computer use、3D reasoning 和 creative capabilities;可见线程还称 Pro 与 Flash 的 API 定价均与 V2.5 保持不变,并将 Pro、Flash、技术报告、7K+ RL task environments、端到端 RL framework 和 composable mini-harnesses 开源。这些是厂商发布信息,不是评测方法的完整披露。
来源未注明:每项基准的样本量、任务抽样规则、评测日期、完整提示词、few-shot 设置、工具权限、解码参数、硬件、重复次数、评分脚本、置信区间和失败样本。
下表只抄录附图中 MiMo-V2.6 Flash 一列;— 表示图中未提供数值。
| 类别 | Benchmark | MiMo-V2.6-Flash |
|---|---|---|
| Code Agent | DeepSWE v1.1 | 67.9 |
| Code Agent | ProgramBench | 26.0 |
| Code Agent | MiMo Code Bench | 61.2 |
| General Agent | AutomationBench v1.0.6 | 52.3 |
| General Agent | Toolathlon-Verified | 73.6 |
| General Agent | GDPval-AA 2.1 | — |
| General Agent | Agents’ Last Exam | 27.6 |
| General Agent | Terminal Bench 4.0 | 28.8 |
| General Agent | Terminal Bench 2.1 | 87.6 |
| General Agent | OSWorld-Verified | 80.8 |
| General Agent | JobBench | 61.2 |
| Cybersecurity | CyberGym | 95.1 |
| Cybersecurity | MiMo Cyber Bench | 77.2 |
| Cybersecurity | ExploitGym | 6.0 |
| Cybersecurity | ExploitBench | 25.3 |
| Cybersecurity | SEC Bench Pro | 47.5 |
| Visual Agent | MiMo Visual Coding | 71.5 |
原帖定位:Introducing Xiaomi MiMo-V2.6 — Pro & Flash.;Two omnimodal models, advancing through scaled reinforcement learning。
原帖能力表述:Stronger coding, computer use, 3D reasoning and creative capabilities。
原帖开放主张:Open model weights, technical report, RL environments and training code。
可见线程中的 Flash 相关表述:API pricing unchanged from V2.5, for both Pro and Flash;We’re open-sourcing Pro and Flash ... 7K+ RL task environments ... composable mini-harnesses。
原帖附图:https://pbs.twimg.com/media/HSxK_3caUAAsfBl?format=jpg&name=medium。图中 Flash 列的 CyberGym 为 95.1、Terminal Bench 2.1 为 87.6、MiMo Visual Coding 为 71.5;同时完整列出了上表其余项目。
明确的版本边界:原帖中 Pro performs on par with Claude Opus 5 and GPT-5.6 Sol across most agent benchmarks 以及 Pro scores 46 ... 均明确指向 Pro,不是 Flash 结果。
厂商主张:Flash 被作为 Pro 之外的全模态模型发布,并以同一张 Agent 基准表展示其代码、通用 Agent、网络安全和视觉 Agent 分数;官方线程同时强调 API 定价不变和开放 RL 资源。
独立测量:未提供。本页没有独立复测、第三方 harness 或个人体验数据。
数据解释边界:表格是一次官方发布快照,不足以推出总体排名或跨任务平均能力。不同基准的分数定义也未统一说明。
比较边界:附图中的对照模型和 Flash 可能没有使用同一时间、硬件、工具、提示词或 harness;不能把表格差异解释为严格的因果优势。
模型边界:不得把 MiMo-V2-Flash、MiMo-V2.5-Pro、MiMo-V2.6-Pro 或 MiMo-V2.6-Pro-UltraSpeed 的数据改写成 Flash 数据;本页仅记录图中 MiMo-V2.6 Flash 列。
打开原始 X 帖,确认作者为 @XiaomiMiMo,并查看原帖附图的 MiMo-V2.6 Flash 列。
按类别和基准名称逐项抄录分数;图中的 — 保持为“未提供”,不要改写为 0。
若要独立复测,需另行取得任务集版本、完整 harness、提示词、工具配置、解码参数、硬件、样本量和评分脚本;原帖本身不足以复现实验。
独立结果应与本文的厂商值分栏保存,并注明实际模型标识、客户端、运行时间和失败样本;不要用独立结果替换官方表格。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
X(Twitter) · Xiaomi MiMo(@XiaomiMiMo,厂商官方账号) · 原文发布日期 2026-09-21 · 本站编辑日期 2026-09-22
打开原始来源MiMo-V2.6-Flash
下载 Tabbit 客户端后检查模型可用性