MiMo-V2.6-Pro · 媒体来源 · 厂商自报
小米官方把 MiMo-V2.6-Pro 定位为面向 Agent、代码、视觉与电脑操作的原生全模态开源模型,并自报 Artificial Analysis Intelligence Index 46 分及多项 RL/Agent 结果;这些数字仍是厂商发布口径,不能替代同一 harness 下的独立复测。
小米官方把 MiMo-V2.6-Pro 定位为面向 Agent、代码、视觉与电脑操作的原生全模态开源模型,并自报 Artificial Analysis Intelligence Index 46 分及多项 RL/Agent 结果;这些数字仍是厂商发布口径,不能替代同一 harness 下的独立复测。
适合的任务:需要长程执行和工具调用的软件工程、漏洞复现、知识密集型工作、网页设计与开发;图像/视频/文本驱动的 3D 场景构建;Blender 建模;带视觉反馈的机器人控制;桌面办公和数据处理;材料研究、形式化证明,以及前端、PPT、视频和音乐创作。
不适合的任务:仅凭官方榜单决定生产上线;需要独立统计显著性、完整输入、随机种子和逐题日志的严谨对照;把案例演示或“可达到”描述当作稳定成功率。
适用的模型版本:mimo-v2.6-pro。官方同时列出 mimo-v2.6-flash;mimo-v2.6-pro-ultraspeed 是 API 中的高速模式标识,不应与基础 Pro 模型的测评结果混为一谈。
适用的客户端、Agent 或 API:小米 MiMo API、MiMo Desktop,以及能够提供多模态输入、工具调用、浏览器/桌面或代码执行环境的 Agent harness。官方页面未给出一套可直接复用的完整工具 schema。
推荐的推理档位和参数:官方发布页没有公开统一的 temperature、top-p、推理档位、token 上限、工具超时或随机种子;复测时应使用目标端点默认值并逐项记录,不能从本页推定推荐参数。
这是一份厂商发布说明,不是独立重跑。按官方页面可核对的实验线索,建议按以下流程复现:
固定 API 模型 ID mimo-v2.6-pro、客户端版本、工具 schema、上下文上限、超时、采样参数和 harness;不要把 mimo-v2.6-pro-ultraspeed 的延迟表现并入基础模型结果。
在同一代码仓库和同一评分脚本上复跑 SWE-bench Verified、DeepSWE v1.1、Terminal Bench 2.1 等任务,同时保存逐题输出、通过率、工具调用次数、输入/输出 token、耗时和失败类型。
对官方所说的 Agent 能力,分别测代码、通用知识、视觉任务和 Cyber 任务;报告每个子集的样本量,而不是只报告“多数 Agent Benchmark 与某模型相当”。
对全模态能力做可复核任务:输入图像/视频/文本生成 3D 场景,执行 Blender 建模,使用多视角图像完成抓取与放置,完成桌面信息检索、编辑和数据处理;保存输入素材、工具轨迹、最终文件和人工验收结果。
对材料设计和 Lean 4 形式化等科研案例,记录检索来源、工具版本、每轮提示词、模型修改、编译/模拟日志和人工复核,不把官方案例描述转成未经验证的成功率。
与其他模型比较时,使用同一输入、同一工具、同一预算、同一评分规则;将厂商自报的 AA 分数、训练改进和成本单列,并标注“未独立复现”。
页面称 MiMo-V2.6 系列由 Pro 和 Flash 两个“原生全模态”模型组成,强调递归自我改进(RSI)和在可验证复杂任务上扩展强化学习(RL)。
官方 API 说明要求使用全小写模型名:mimo-v2.6-pro、mimo-v2.6-flash 和 mimo-v2.6-pro-ultraspeed。
页面将能力范围延伸到 3D 空间推理、多模态感知和 Computer Use Agent(CUA),并把自然语言编程扩展为面向交互世界构建的 “Vibe World”。这些是能力定位,不是统一基准分数。
| 指标或设置 | MiMo-V2.6-Pro 官方页面给出的信息 | 证据边界 |
|---|---|---|
| Artificial Analysis Intelligence Index(AA Composite Intelligence Index) | 46 分 | 厂商发布页自报;页面称超过 Kimi K3 和 Qwen3.8 Max,但未在正文给出逐项输入、配置或独立核验日志 |
| DeepSWE v1.1(长程软件工程、out-of-sample) | 58.4 → 72.6,约提升 14 分 | 页面把它作为约 6 天、30 步 RL 训练后的变化;不能解释为仅替换模型带来的增益 |
| RL 训练步数 | 30 步 | 页面称 Pro 与 Flash 各完成 30 步 |
| 累计轨迹 | 约 750,000 条 | 页面将两款模型合计描述为约 75 万条,没有给出 Pro/Flash 拆分 |
| Pro RL 训练成本 | 约 262 万美元 | 厂商自报训练成本,不是单次推理成本或用户实际账单 |
| Pro 训练任务平均 pass rate | 相对提升约 12% | 页面未给出任务清单、绝对基线、置信区间或逐任务结果 |
| 单次更新 batch size | 1,568 个样本 | 官方训练设置描述;不等于推理时可用的上下文或 batch 配置 |
| 训练上下文长度 | 支持 1M context | 这是训练设置描述,不能直接当作每个 API 端点的可用上下文承诺 |
| 每个训练 step 的 token 数 | 约 3.5–3.7B | 官方训练设置描述 |
同一段官方说明还给出 Flash 的对照:DeepSWE v1.1 从 48.8 提升到 65.7(约 17 分),平均 pass rate 相对提升约 25%,训练成本约 85 万美元。该组数字用于解释官方 RL 叙述,不应当作为 Pro 的测评结果。
页面另称 MiMo-V2.6-Pro 在“多数 Agent Benchmarks”上与 Claude Opus 5 和 GPT-5.6 Sol 相当,但没有在正文列出这些 benchmark 的名称、分数、样本量或运行配置,故只能记录为官方定位,不能整理成可比的排行榜表格。
3D 开放世界:官方描述模型把图片、视频或文本需求拆为 3D 场景构建、交互逻辑编程和视觉验证等子任务,并依据渲染结果持续修正,最后生成可运行的交互世界。
Blender:官方称可根据文字或参考图进行物体和场景建模,生成可用于动画、3D 打印和游戏开发的资产。
具身智能:官方称在仿真环境中接收多视角相机图像,通过视觉反馈闭环控制 Franka Panda 机械臂,完成抓取、颜色匹配和精确放置。
Computer Use Agent:官方称模型可以理解复杂 GUI,使用办公和生产力工具完成信息检索、编辑和数据处理,并依据视觉反馈检查结果、排查问题和调整后续动作。
科研案例:官方展示了 PFAS 吸附目标的 MOF 材料设计与“干实验”筛选,以及 Li–Yorke “Period Three Implies Chaos”定理在 Lean 4 中的形式化。后者页面称最终生成超过 6,000 行 Lean 源码,并由 Lean kernel 验证、没有未证明占位符;这是官方案例陈述,不是公开盲测。
内容创作:官方称在 Design Arena 上 Pro 与 Claude Opus 5、GPT-5.6 Sol 处于相当水平,并展示前端、PPT、视频、SVG、音乐等案例;正文没有提供 Design Arena 的分数和完整评测协议。
官方页面提供了权重、技术报告、RL 训练环境和代码的开源说明,并称包含 7k+ 高质量 RL 任务环境,覆盖软件工程、漏洞复现、知识密集型工作和网页设计开发四类 Agent 任务。
页面还报告从 MiMo-V2.6-Distill-Qwen-9B 的 SFT 基线开始,RL 在 11 个 benchmark 上均有改进,包括:SWE-bench Verified 61.1 → 66.2、MiMo Cyber Bench 31.3 → 47.0、Terminal Bench 2.1 37.1 → 52.8、MiMo Visual Coding 64.0 → 72.4。这些是 Distill-Qwen-9B 训练资源的辅助结果,不能当作 MiMo-V2.6-Pro 的直接得分。
厂商自报:AA 46 分、Agent benchmark 对标、DeepSWE 改进、训练成本、轨迹数、训练吞吐、Design Arena 定位及案例结果均来自 Xiaomi MiMo 发布页;本篇没有把它们表述为独立验证。
缺少复现要件:正文没有公开每道题的输入、完整 system prompt、工具 schema、随机种子、评分脚本、失败样本、token/延迟日志和置信区间,因此不能从页面计算胜率、成本效率或统计显著性。
训练增益的归因限制:DeepSWE 的 58.4→72.6 是 RL 训练前后官方流程中的变化,可能同时受数据、环境、grader、harness 和训练策略影响;不能归因于单一模型版本。
上下文与 API 限制:1M context 是训练描述,不等于所有 API、Desktop 或 UltraSpeed 端点都开放 1M;实际端点应读取当前 API 文档并用超长输入验证。
价格结论限制:页面称同等智能水平下 Pro 的价格约为海外模型的 1/20 至 1/60,但正文没有给出用于比较的完整价格表、模型集合、token 口径和时间窗口;该比例只能作为官方宣传口径。
案例不等于稳定能力:3D、机器人、科研、形式化证明、视频和音乐案例缺乏统一样本与失败率;上线前应保留产物、日志和人工验收。
版本边界:不要把 mimo-v2.6-pro-ultraspeed 的最高 20× 推理速度描述为 Pro 基础模型的质量提升,也不要把 Flash 或 Distill-Qwen-9B 的结果并入 Pro 分数。
页面明确写道,MiMo-V2.6-Pro 在 AA Composite Intelligence Index 中为 46 分,并声称超过 Kimi K3 与 Qwen3.8 Max;该句是本页最直接的公开排名证据。
页面把 Pro 的 DeepSWE v1.1 结果写为 58.4 → 72.6,同时给出约 6 天、30 步 RL、约 262 万美元训练成本等背景;因此复核时应把“模型结果”和“训练流程结果”分开记录。
页面以 “Vibe World” 概括从代码生成到交互世界构建的扩展,并列出 3D、Blender、机械臂和 CUA 案例;这些观察支持“原生全模态 + Agent 工作流”的产品定位,但不提供统一 pass rate。
官方开源入口:https://huggingface.co/collections/XiaomiMiMo/mimo-v26。本篇的 benchmark 数字仍以发布页正文为准,未把该入口中可能更新的模型卡内容混入本来源。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Xiaomi MiMo Documentation · Xiaomi MiMo · 原文发布日期 2026-09-22 · 本站编辑日期 2026-09-22
打开原始来源MiMo-V2.6-Pro
下载 Tabbit 客户端后检查模型可用性