MiMo-V2.6-Pro · 社区来源 · 厂商自报
这条官方线程把 MiMo-V2.6-Pro 定位为公开构建的原生全模态 Agent 模型,重点覆盖代码、计算机使用、3D、设计、科研和工具工作流;线程中的榜单与案例能帮助筛选任务方向,但仍是厂商口径,不能替代同一 harness 下的独立复测。
这条官方线程把 MiMo-V2.6-Pro 定位为公开构建的原生全模态 Agent 模型,重点覆盖代码、计算机使用、3D、设计、科研和工具工作流;线程中的榜单与案例能帮助筛选任务方向,但仍是厂商口径,不能替代同一 harness 下的独立复测。
适合的任务:长程软件工程和工具调用;图像、视频或文本驱动的 3D 场景;Blender 建模;桌面搜索、编辑和数据处理;视觉反馈下的具身仿真;前端、演示文稿、SVG、视频和音乐创作;材料研究与 Lean 4 形式化证明。
不适合的任务:仅依据本线程宣称的“相当于”或价格比例做上线决策;需要逐题输入、完整工具 schema、随机种子、失败日志和统计显著性的严格比较;把一次官方案例当作稳定成功率。
适用的模型版本:mimo-v2.6-pro。线程同时提到 mimo-v2.6-flash;mimo-v2.6-pro-ultraspeed 是速度模式,不能把它的延迟指标并入基础 Pro 的质量测评。
适用的客户端、Agent 或 API:MiMo API、MiMo Desktop,以及能够提供多模态输入、代码执行、浏览器/桌面控制或其他工具的 Agent harness。官方线程还给出 API、Desktop 和 Hugging Face 入口。
推荐的推理档位和参数:官方没有在该线程或发布页给出统一的 temperature、top-p、推理档位、随机种子、工具超时或 token 配置;复测应锁定目标端点默认值并完整记录,不能从本来源推断推荐参数。
主帖介绍 Pro 与 Flash 两个原生全模态模型,称模型通过扩展强化学习推进能力,并把 Pro 描述为在多数 Agent 基准上可与 Claude Opus 5、GPT-5.6 Sol 对比。主帖还引用 Artificial Analysis Intelligence Index 的 46 分,称其为开源模型最高分。
可见后续帖补充了成本口径:Pro 与 Flash 的 API 价格沿用 V2.5;在官方认为“智能水平相当”的比较中,Pro 成本约为领先国际模型的 1/20–1/60。线程没有给出参与比较的完整模型集合、价格时间点、输入/输出 token 口径或 Artificial Analysis 的逐项运行配置,因此这里只记录为官方宣传和定位信号。
| 方向 | 线程中可见的官方描述 | 适用边界 |
|---|---|---|
| 3D / Vibe World | 将文本、图片或视频变成可玩的 3D 世界,协调 Agent 构建场景、编写交互逻辑并迭代结果;可生成 Blender 对象和场景 | 展示的是工作流能力,未给出统一成功率或任务样本量 |
| 计算机使用 | 使用桌面工具搜索、编辑和处理数据,再检查结果并调整下一步动作 | 需要匹配的桌面环境、工具权限和可观察的状态反馈 |
| 具身仿真 | 通过视觉反馈在仿真中控制 Franka Panda 机械臂 | 线程未公开控制频率、仿真器、成功标准或失败样本 |
| 材料研究 | 与小米材料研究员合作,提出捕获 PFAS 的 MOF 材料,检索文献和专利,做计算筛选并找出湿实验候选 | 这是官方案例,不等于盲测中的材料发现成功率 |
| 形式化数学 | 协助把 Li–Yorke 的 “Period Three Implies Chaos” 主定理形式化到 Lean 4;官方称整合后超过 6,000 行代码且由 Lean kernel 验证 | 线程未公开完整提示词、协作轨迹和人工修改比例 |
| 设计与多媒体 | 组合代码、设计和工具使用,覆盖界面、幻灯片、SVG、视频和音乐;在 Design Arena 上声称与 Claude Opus 5、GPT-5.6 Sol 相当 | 未提供 Design Arena 的分数、题目、评审协议或原始产物集合 |
| 开源与复现 | 开放 Pro/Flash、MiMo-V2.6-Distill-Qwen-9B、技术报告、7K+ RL 任务环境、端到端 RL 框架和可组合 mini-harness | “可复现”是发布承诺,实际复现仍需读取仓库、锁定版本并保存日志 |
| 可用性 | MiMo Desktop 与会员计划上线;Pro UltraSpeed 在 Desktop 与 API 提供,官方称最高可达 20× 更快;API 价格保持不变 | 20× 是速度模式上限,不是基础 Pro 的普遍延迟保证 |
X 主帖的“博客”链接指向 Xiaomi MiMo 官方发布页。该页面的完整比较附录给出以下 MiMo-V2.6-Pro 分数;页面说明 分数越高越好,其中标注 in-house 的项目为小米自有测试,GDPVal 2.1 (AA) 为 Artificial Analysis 报告的 Elo。
| 类别 | Benchmark | Pro 分数 | 公开口径 |
|---|---|---|---|
| Coding | DeepSWE v1.1 | 71.9 | 独立名称的代码基准;页面未给出完整运行配置 |
| Coding | ProgramBench | 26.5 | 官方比较表 |
| Coding | MiMo Code Bench | 63.2 | in-house |
| General | GDPVal 2.1 (AA) | 1673 | Artificial Analysis Elo |
| General | Toolathlon-verified | 76.9 | 官方比较表 |
| General | Automation Bench v1.0.6 | 53.1 | 官方比较表 |
| General | Agents' Last Exam | 31.6 | 官方比较表 |
| General | Terminal Bench 4.0 | 34.9 | 官方比较表 |
| General | Terminal Bench 2.1 | 89.9 | 官方比较表 |
| General | OSWorld-Verified | 82.0 | 官方比较表 |
| General | JobBench | 62.0 | 官方比较表 |
| Visual | MiMo Visual Coding | 72.3 | in-house |
| Cyber | CyberGym | 94.0 | 官方比较表 |
| Cyber | ExploitGym | 17.8 | 官方比较表 |
| Cyber | ExploitBench | 47.9 | 官方比较表 |
| Cyber | SEC Bench Pro | 66.3 | 官方比较表 |
| Cyber | MiMo Cyber Bench | 81.7 | in-house |
官方发布页还给出训练过程背景:Pro 和 Flash 各完成 30 个 RL step,总计约 750k 条轨迹;Pro 训练成本约 262 万美元,训练任务平均 pass rate 的相对提升约 12%;在 DeepSWE v1.1 上,Pro 从 58.4 提升到约 72.6。这个前后变化属于官方 RL 训练流程结果,不能解释为一次“换模型”对照,也不能与上表最终分数混为同一实验。
任务覆盖面较宽:官方同时给出代码、通用 Agent、视觉和 Cyber 类结果,且线程展示了 3D、桌面、科研、设计等工具工作流,因此 Pro 值得优先放入多工具、长程、多模态任务的候选池。
开源复现路径明确:线程公开指向技术报告、Hugging Face 和 RL 资源,适合复核训练设置、实现细节和模型权重,而不只是接受一句排行榜结论。
成本与速度是产品卖点:API 价格不变、UltraSpeed 最高 20× 的说法适合形成成本/延迟测试假设,但不能直接当作用户实际账单或 P95 延迟。
不能仅凭“多数 Agent 基准相当”断言对所有 Agent 任务都达到 Claude Opus 5 或 GPT-5.6 Sol 的水平。
不能从 Artificial Analysis 46 分反推出任意业务数据集上的准确率,也不能把官方榜单当作独立第三方测评。
不能把科研案例、Design Arena 说法或多媒体演示转换为稳定成功率;线程没有公开失败案例、样本量和评审者一致性。
不能把 mimo-v2.6-flash、mimo-v2.6-pro-ultraspeed 或 MiMo-V2.6-Distill-Qwen-9B 的结果并入基础 Pro 结论。
固定 mimo-v2.6-pro 端点、客户端版本、系统提示词、工具 schema、上下文上限、超时和采样参数;单独记录 UltraSpeed。
用同一仓库、同一 harness 和同一评分器重跑代码、Terminal、OSWorld、工具调用及视觉任务,并保存逐题输入、输出、工具轨迹、token、耗时和失败类型。
对 3D、Blender、桌面操作、材料设计和 Lean 4 分别建立任务集,保存源素材、最终文件、编译/模拟日志和人工验收结果。
与其他模型比较时保持相同预算、工具、上下文和重试规则;报告样本量、成功率、成本和 P50/P95 延迟,而不是只引用官方排名。
来源边界:本篇只使用指定 X 主帖、该帖可见的 6 条 Xiaomi MiMo 官方后续及主帖/后续直接链接的 Xiaomi MiMo 官方发布页;线程中可见的非官方引用帖未作为证据。
官方主张边界:46/46.32、价格 1/20–1/60、20×、Design Arena 对标、案例结果和 benchmark 分数均是 Xiaomi MiMo 发布口径;本篇未声称独立验证。
方法边界:X 线程没有给出完整测试提示词、任务采样、工具 schema、随机种子、评分脚本、失败样本或置信区间;官方发布页虽提供比较表和部分 RL 训练曲线,仍不足以重建全部测试。
时间边界:价格、可用客户端、模型 ID 和链接以 2026-09-22 采集时可见内容为准,后续可能变化。
X 主帖公开写明:MiMo-V2.6 包含 Pro 与 Flash,Pro 在多数 Agent 基准上与 Claude Opus 5、GPT-5.6 Sol 相当,并宣称 Artificial Analysis Intelligence Index 得分 46。
X 后续公开写明:API 定价沿用 V2.5;官方宣称 Pro 在相近智能水平下成本约为领先国际模型的 1/20–1/60。
X 后续把可见任务展开为 3D 世界、Blender、Franka Panda、桌面工具、PFAS-MOF、Lean 4、前端/演示/视频/音乐,并称 Design Arena 上与 Claude Opus 5、GPT-5.6 Sol 相当。
X 后续公开的开源清单包括 Pro/Flash、MiMo-V2.6-Distill-Qwen-9B、技术报告、7K+ RL 任务环境、端到端 RL 框架和 mini-harness。
线程直接链接的官方发布页:https://mimo.xiaomi.com/mimo-v2-6;API、Desktop 和 Hugging Face 入口以该页面当前可见链接为准。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
X(Xiaomi MiMo 官方账号);X 线程中链接的 Xiaomi MiMo 官方发布页 · Xiaomi MiMo(@XiaomiMiMo) · 原文发布日期 2026-09-22 · 本站编辑日期 2026-09-22
打开原始来源MiMo-V2.6-Pro
下载 Tabbit 客户端后检查模型可用性