MiMo-V2.6-Pro

MiMo-V2.6-Pro · 测评与证据

MiMo-V2.6-Pro,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

小米官方把 MiMo-V2.6-Pro 定位为面向 Agent、代码、视觉与电脑操作的原生全模态开源模型,并自报 Artificial Analysis Intelligence Index 46 分及多项 RL/Agent 结果;这些数字仍是厂商发布口径,不能替代同一 harness 下的独立复测。

Xiaomi MiMo Documentation · 查看证据

Artificial Analysis 在 Xiaomi provider、推理版本和默认 10,000 输入 token 的生产型工作负载下测得 MiMo-V2.6-Pro 的 Intelligence Index 为 46.324(页面显示 46)、输出速度 129.75 tokens/s、首个答案 token 延迟 17.58 秒、端到端输出 500 token 为 21.44 秒,价格处于低成本区间,但推理等待时间占首 token 延迟的大部分。

Artificial Analysis · 查看证据

完整测评与相关内容

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Pro 测评:最聪明的开源模型,却让你等 18 秒

MiMo-V2.6-Pro 公开证据测评:真实任务成败实录、18 秒等待与思考账单、社区原声两极分化,以及按工作负载给出的选型裁决。

定价 · 简体中文

MiMo-V2.6-Pro 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Pro 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、思考 Token 增量、UltraSpeed 极速模式及实际任务预算测算。

替代品 · 简体中文

MiMo-V2.6-Pro 替代品:按任务和预算选模型

用完成任务的真实成本、agent 可靠性、开源权重和部署条件,横向评估五个 MiMo-V2.6-Pro 替代方案,价格核对时间为 2026 年 9 月 22 日。

精选证据

媒体 / 基准方厂商自报

小米 MiMo 官方发布:MiMo-V2.6-Pro 基准信号与原生全模态定位

小米官方把 MiMo-V2.6-Pro 定位为面向 Agent、代码、视觉与电脑操作的原生全模态开源模型,并自报 Artificial Analysis Intelligence Index 46 分及多项 RL/Agent 结果;这些数字仍是厂商发布口径,不能替代同一 harness 下的独立复测。

来源Xiaomi MiMo Documentation
原文日期2026-09-22
采集2026-09-22
来源具体观察
小米官方把 MiMo-V2.6-Pro 定位为面向 Agent、代码、视觉与电脑操作的原生全模态开源模型,并自报 Artificial Analysis Intelligence Index 46 分及多项 RL/Agent 结果;这些数字仍是厂商发布口径,不能替代同一 harness 下的独立复测。
已公布条件
仅凭官方榜单决定生产上线;需要独立统计显著性、完整输入、随机种子和逐题日志的严谨对照;把案例演示或“可达到”描述当作稳定成功率。
视觉生成能力
社区厂商自报

MiMo-V2.6-Pro 官方 X 发布线程:任务定位、公开基准与开源入口

这条官方线程把 MiMo-V2.6-Pro 定位为公开构建的原生全模态 Agent 模型,重点覆盖代码、计算机使用、3D、设计、科研和工具工作流;线程中的榜单与案例能帮助筛选任务方向,但仍是厂商口径,不能替代同一 harness 下的独立复测。

来源X(Xiaomi MiMo 官方账号);X 线程中链接的 Xiaomi MiMo 官方发布页
原文日期2026-09-22
采集2026-09-22
来源具体观察
这条官方线程把 MiMo-V2.6-Pro 定位为公开构建的原生全模态 Agent 模型,重点覆盖代码、计算机使用、3D、设计、科研和工具工作流;线程中的榜单与案例能帮助筛选任务方向,但仍是厂商口径,不能替代同一 harness 下的独立复测。
已公布条件
仅依据本线程宣称的“相当于”或价格比例做上线决策;需要逐题输入、完整工具 schema、随机种子、失败日志和统计显著性的严格比较;把一次官方案例当作稳定成功率。
能力
媒体 / 基准方独立测量

Artificial Analysis:MiMo-V2.6-Pro 的智能指数、速度、价格与延迟

Artificial Analysis 在 Xiaomi provider、推理版本和默认 10,000 输入 token 的生产型工作负载下测得 MiMo-V2.6-Pro 的 Intelligence Index 为 46.324(页面显示 46)、输出速度 129.75 tokens/s、首个答案 token 延迟 17.58 秒、端到端输出 500 token 为 21.44 秒,价格处于低成本区间,但推理等待时间占首 token 延迟的大部分。

来源Artificial Analysis
原文日期2026-09-22
采集2026-09-22
来源具体观察
Artificial Analysis 在 Xiaomi provider、推理版本和默认 10,000 输入 token 的生产型工作负载下测得 MiMo-V2.6-Pro 的 Intelligence Index 为 46.324(页面显示 46)、输出速度 129.75 tokens/s、首个答案 token 延迟 17.58 秒、端到端输出 500 token 为 21.44 秒,价格处于低成本区间,但推理等待时间占首 token 延迟的大部分。
已公布条件
对首字响应极敏感的交互式短问答;需要按不同 provider、不同推理档位或不同随机种子做严格横向复验的任务;本页只有 Xiaomi 一个 provider,无法代表其他部署。
成本速度与延迟
媒体 / 基准方厂商自报

MiMo-V2.6-Pro 官方技术报告:架构、规模化 RL 与评测条件

这份官方报告把 MiMo-V2.6-Pro 定义为 1.02T 总参数、约 42B 激活参数的原生全模态稀疏 MoE,并用大批量、多环境、多 harness 和 groupwise grader 的 RL 训练获得较强 Agent 基准成绩;但表中大部分数字是厂商自报,公开信息仍不足以独立复现每个 benchmark。

来源Hugging Face(XiaomiMiMo 官方模型卡与技术报告)
原文日期2026-09-22
采集2026-09-22
来源具体观察
这份官方报告把 MiMo-V2.6-Pro 定义为 1.02T 总参数、约 42B 激活参数的原生全模态稀疏 MoE,并用大批量、多环境、多 harness 和 groupwise grader 的 RL 训练获得较强 Agent 基准成绩;但表中大部分数字是厂商自报,公开信息仍不足以独立复现每个 benchmark。
已公布条件
仅凭官方表格判断生产成功率、成本效率或统计显著性;把内部 benchmark、训练曲线或演示案例当成独立盲测;把 Pro-RL 权重结果直接等同于 API 的 mimo-v2.6-pro-ultraspeed。
研究能力

全部来源

全部来源

6 / 6
媒体 / 基准方厂商自报

小米 MiMo 官方发布:MiMo-V2.6-Pro 基准信号与原生全模态定位

小米官方把 MiMo-V2.6-Pro 定位为面向 Agent、代码、视觉与电脑操作的原生全模态开源模型,并自报 Artificial Analysis Intelligence Index 46 分及多项 RL/Agent 结果;这些数字仍是厂商发布口径,不能替代同一 harness 下的独立复测。

来源Xiaomi MiMo Documentation
原文日期2026-09-22
采集2026-09-22
来源具体观察
小米官方把 MiMo-V2.6-Pro 定位为面向 Agent、代码、视觉与电脑操作的原生全模态开源模型,并自报 Artificial Analysis Intelligence Index 46 分及多项 RL/Agent 结果;这些数字仍是厂商发布口径,不能替代同一 harness 下的独立复测。
已公布条件
仅凭官方榜单决定生产上线;需要独立统计显著性、完整输入、随机种子和逐题日志的严谨对照;把案例演示或“可达到”描述当作稳定成功率。
视觉生成能力
社区厂商自报

MiMo-V2.6-Pro 官方 X 发布线程:任务定位、公开基准与开源入口

这条官方线程把 MiMo-V2.6-Pro 定位为公开构建的原生全模态 Agent 模型,重点覆盖代码、计算机使用、3D、设计、科研和工具工作流;线程中的榜单与案例能帮助筛选任务方向,但仍是厂商口径,不能替代同一 harness 下的独立复测。

来源X(Xiaomi MiMo 官方账号);X 线程中链接的 Xiaomi MiMo 官方发布页
原文日期2026-09-22
采集2026-09-22
来源具体观察
这条官方线程把 MiMo-V2.6-Pro 定位为公开构建的原生全模态 Agent 模型,重点覆盖代码、计算机使用、3D、设计、科研和工具工作流;线程中的榜单与案例能帮助筛选任务方向,但仍是厂商口径,不能替代同一 harness 下的独立复测。
已公布条件
仅依据本线程宣称的“相当于”或价格比例做上线决策;需要逐题输入、完整工具 schema、随机种子、失败日志和统计显著性的严格比较;把一次官方案例当作稳定成功率。
能力
媒体 / 基准方独立测量

Artificial Analysis:MiMo-V2.6-Pro 的智能指数、速度、价格与延迟

Artificial Analysis 在 Xiaomi provider、推理版本和默认 10,000 输入 token 的生产型工作负载下测得 MiMo-V2.6-Pro 的 Intelligence Index 为 46.324(页面显示 46)、输出速度 129.75 tokens/s、首个答案 token 延迟 17.58 秒、端到端输出 500 token 为 21.44 秒,价格处于低成本区间,但推理等待时间占首 token 延迟的大部分。

来源Artificial Analysis
原文日期2026-09-22
采集2026-09-22
来源具体观察
Artificial Analysis 在 Xiaomi provider、推理版本和默认 10,000 输入 token 的生产型工作负载下测得 MiMo-V2.6-Pro 的 Intelligence Index 为 46.324(页面显示 46)、输出速度 129.75 tokens/s、首个答案 token 延迟 17.58 秒、端到端输出 500 token 为 21.44 秒,价格处于低成本区间,但推理等待时间占首 token 延迟的大部分。
已公布条件
对首字响应极敏感的交互式短问答;需要按不同 provider、不同推理档位或不同随机种子做严格横向复验的任务;本页只有 Xiaomi 一个 provider,无法代表其他部署。
成本速度与延迟
媒体 / 基准方厂商自报

MiMo-V2.6-Pro 官方技术报告:架构、规模化 RL 与评测条件

这份官方报告把 MiMo-V2.6-Pro 定义为 1.02T 总参数、约 42B 激活参数的原生全模态稀疏 MoE,并用大批量、多环境、多 harness 和 groupwise grader 的 RL 训练获得较强 Agent 基准成绩;但表中大部分数字是厂商自报,公开信息仍不足以独立复现每个 benchmark。

来源Hugging Face(XiaomiMiMo 官方模型卡与技术报告)
原文日期2026-09-22
采集2026-09-22
来源具体观察
这份官方报告把 MiMo-V2.6-Pro 定义为 1.02T 总参数、约 42B 激活参数的原生全模态稀疏 MoE,并用大批量、多环境、多 harness 和 groupwise grader 的 RL 训练获得较强 Agent 基准成绩;但表中大部分数字是厂商自报,公开信息仍不足以独立复现每个 benchmark。
已公布条件
仅凭官方表格判断生产成功率、成本效率或统计显著性;把内部 benchmark、训练曲线或演示案例当成独立盲测;把 Pro-RL 权重结果直接等同于 API 的 mimo-v2.6-pro-ultraspeed。
研究能力
媒体 / 基准方平台遥测

Arena Code Arena:MiMo-V2.6-Pro 的 WebDev AutoEval 记录

Arena 的 Code Arena | WebDev 总榜已收录 mimo-v2.6-pro,显示 AutoEval 分数 1628(+18/-18),但没有公开投票数或名次,因此只能说明它进入了 WebDev 自动评测榜,不能把 1628 当作盲投排名。

来源Arena(官方 leaderboard)
原文日期2026-09-12
采集2026-09-22
来源具体观察
Arena 的 Code Arena | WebDev 总榜已收录 mimo-v2.6-pro,显示 AutoEval 分数 1628(+18/-18),但没有公开投票数或名次,因此只能说明它进入了 WebDev 自动评测榜,不能把 1628 当作盲投排名。
已公布条件
不能据此判断通用文本、视觉、多模态、长文写作或真实项目交付质量;也不能据此判断人类偏好。
能力
社区个人体验

Reddit 实测:MiMo-V2.6-Pro 在 UI/UX 终端修改任务中陷入 grep 无限循环

在一项真实网站 UI/UX 修改任务中,发帖人称 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 都在终端触发与 grep 相关的无限循环,约 30 分钟没有修复代码;同一修改交给 DeepSeek V4.1 Flash 后则持续推进并完整输出终端工作记录。

来源Reddit,r/CommandCode
原文日期2026-09-22
采集2026-09-22
来源具体观察
在一项真实网站 UI/UX 修改任务中,发帖人称 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 都在终端触发与 grep 相关的无限循环,约 30 分钟没有修复代码;同一修改交给 DeepSeek V4.1 Flash 后则持续推进并完整输出终端工作记录。
已公布条件
不能用于判断基准分数、价格、速度、代码质量或长程 Agent 能力,也不能替代受控复测。
能力

MiMo-V2.6-Pro

在 Tabbit 中比较 MiMo-V2.6-Pro

客户端中的模型、功能和权限以当前账户为准。