Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

MiMo-V2.6-Pro · 媒体来源 · 厂商自报

MiMo-V2.6-Pro 官方技术报告:架构、规模化 RL 与评测条件

这份官方报告把 MiMo-V2.6-Pro 定义为 1.02T 总参数、约 42B 激活参数的原生全模态稀疏 MoE,并用大批量、多环境、多 harness 和 groupwise grader 的 RL 训练获得较强 Agent 基准成绩;但表中大部分数字是厂商自报,公开信息仍不足以独立复现每个 benchmark。

媒体来源厂商自报编辑日期 2026-09-22

测试条件速查

来源具体观察
这份官方报告把 MiMo-V2.6-Pro 定义为 1.02T 总参数、约 42B 激活参数的原生全模态稀疏 MoE,并用大批量、多环境、多 harness 和 groupwise grader 的 RL 训练获得较强 Agent 基准成绩;但表中大部分数字是厂商自报,公开信息仍不足以独立复现每个 benchmark。
已公布条件
仅凭官方表格判断生产成功率、成本效率或统计显著性;把内部 benchmark、训练曲线或演示案例当成独立盲测;把 Pro-RL 权重结果直接等同于 API 的 mimo-v2.6-pro-ultraspeed。

关键数据与适用场景

一句话结论

这份官方报告把 MiMo-V2.6-Pro 定义为 1.02T 总参数、约 42B 激活参数的原生全模态稀疏 MoE,并用大批量、多环境、多 harness 和 groupwise grader 的 RL 训练获得较强 Agent 基准成绩;但表中大部分数字是厂商自报,公开信息仍不足以独立复现每个 benchmark。

适用场景

  • 适合的任务:长上下文代码 Agent、通用工具工作流、视觉网页/设计任务、漏洞复现,以及需要文本、图像、视频和音频联合理解的 Agent 场景。

  • 不适合的任务:仅凭官方表格判断生产成功率、成本效率或统计显著性;把内部 benchmark、训练曲线或演示案例当成独立盲测;把 Pro-RL 权重结果直接等同于 API 的 mimo-v2.6-pro-ultraspeed。

  • 适用的模型版本:主要是开源 checkpoint XiaomiMiMo/MiMo-V2.6-Pro-RL;官方 API 使用小写别名 mimo-v2.6-pro,但报告没有证明 API 路由与公开权重在提供商、采样或后处理上完全相同。MiMo-V2.6-Flash-RL、MiMo-V2.6-Distill-Qwen-9B 和 UltraSpeed 必须单独记录。

  • 适用的客户端、Agent 或 API:报告实验使用自有 Agent harness;模型卡给出 SGLang、vLLM、AI Studio、MiMo Code、MiMo Desktop、Open Platform API 和 OpenRouter 的部署入口。官方没有公开每个外部客户端的评测 harness 等价性。

  • 推荐的推理档位和参数:报告称比较基线统一使用各模型最高可用 reasoning setting(max);模型卡建议采样 temperature=1.0、top_p=0.95。其余参数、工具超时、随机种子和 API 端点应在复测时显式记录。

测试方法

1. 报告定义的训练对象与架构

报告覆盖 MiMo-V2.6-Pro 与 Flash 两个系列成员;本篇只把 Pro 的数据作为主结果。

项目MiMo-V2.6-Pro-RL 官方报告值
总参数 / 激活参数1.02T / 约 42B
主干稀疏 MoE Transformer;首层为全局注意力 + dense FFN,其后交错 SWA 与 GA
主干层数70 层,其中 60 个 SWA、10 个 GA
隐藏维度6144
专家384 个 routed experts,每 token 激活 8 个
滑动窗口128
上下文训练流程扩展至 1M tokens
模态text、image、video、audio
视觉编码器MiMo-ViT,681M 参数;28 层(24 SWA / 4 GA);patch 为 2 × 16 × 16;空间 merge 为 2 × 2
音频编码器AudioTokenizer 308M 参数;audio patch encoder 127M 参数
MTP / speculative decoder5 层 SWA;以最多 1,024 个 backbone context positions 为条件,一次预测后续 7 个 token

报告的预训练设置是两阶段:先以 text-only 数据训练语言主干,再与视觉和音频编码器联合进行全模态训练。Pro 的预训练 token 总量为 30T,其中 text 阶段 27T、omni 阶段 3T;上下文从 32K 扩展到 256K。随后 mid-training 在 256K 上训练,再在最后阶段扩展到 1M,并切换到面向大 batch 的 Muown 变体;embedding、LM head 和 MoE router 仍使用 AdamW,同时采用 MXFP4 quantization-aware training。

2. 官方 RL 训练设置

报告称先进行短 SFT,再进行一次混合任务 RL。核心设置如下:

项目官方报告值
算法GRPO,异步 partial rollouts,staleness 为 4
每步 prompt 数1,568
每个 prompt rollout 数16
全局训练 batch约 25K trajectories
每步训练 token约 2.7B–3.7B;约 110K–150K tokens / sequence
Pro RL 成本约 260 万美元(报告第 8 页写约 $2.6M;官方发布页写约 $2.62M)
RL 任务混合coding 68%、general tool use 12%、aesthetic design 13%、context following 3%、cybersecurity 4%
优化器Muown,学习率 3e-6,无 weight decay / warmup,gradient clipping 1.0;RL 阶段冻结 router
评测基线推理档位可配置 reasoning effort 的基线统一取最高支持档位 max

训练信号不只使用 binary test reward。高通过率 code 任务使用 Groupwise Reward Synthesis(GRS)离线生成 task-specific solution/behavior rubrics,再按 R_i = R_test × S_sol × S_beh 合成 reward;其余 code 任务主要使用 Groupwise Advantage Redistribution(GAR),在同一 rollout group 内比较通过和失败轨迹,把正 advantage 更多分配给质量更高的通过解。报告还使用 group-relative length penalty、tool/format 行为惩罚和 batch-level advantage rebalancing,鼓励更短、更稳定的解。

3. Harness 与环境条件

报告把 harness 视为训练变量,而不是固定的产品外壳。训练用四个最小化、可组合的 mini-harness,均由 system prompt、tools、context management 和最小 Agent loop 组成;训练后在三个未见过的 harness(Codex、Claude Code、mini-swe-agent)上检查迁移。报告图 10 显示,DeepSWE v1.1 的 held-out harness 平均 Pass@1 约从 50% 升到 66%,但图中未给出逐题输入、样本数和置信区间。

环境分为四类:

  1. Code:GitHub issue/PR、日常开发、规格驱动、源码驱动和长程工程任务;任务通过可执行测试,并用四次 rollout 审计 specification–test 对齐。

  2. General agent:本地可重置 workspace、软件 mock、文件和数据库;使用代码检查与 LLM rubric 检查,另用跨模型 rollout 审查过严或过松的 rubric。

  3. Visual agent:网页、交互应用、游戏、3D、slides、SVG、视频和 Figma;开放设计结合 pointwise 与 groupwise grading,高保真复制结合像素相似度和 LLM judging。

  4. Cybersecurity:以 ASan/MSan/UBSan 报告中的漏洞类型和项目级栈顶位置作为 rule-based oracle;PoC 只有同时匹配两者才算通过。

报告还描述了 reward-hacking 防线:清理缓存、构建产物、Git 后续提交和网络访问,使用 hack agent 反复探测泄漏,再在训练中离线审计轨迹。作者称最终训练过程中确认的 reward-hacking 轨迹占比对 Pro 和 Flash 均低于 2%;这是厂商自报监控指标,不是外部审计结果。

4. 报告公布的 benchmark 结果

以下数值来自技术报告 Table 3(Pro、Flash、上一代 Pro 与若干闭源模型对照)。- 表示报告未提供,不应补 0。除 GDPval-AA 的分数尺度外,其余表中数值按报告原样记录;官方没有在表格中提供每项的样本量、随机种子或完整 harness 配置。

类别BenchmarkMiMo-V2.6-ProFlashMiMo-V2.5-ProClaude Opus 5GPT-5.6 SolClaude Fable 5
CodeDeepSWE v1.171.967.919.074.073.070.0
CodeProgramBench26.526.012.537.025.033.0
CodeMiMo Code Bench63.261.240.468.659.3-
GeneralAutomationBench v1.0.653.152.316.050.345.846.2
GeneralToolathlon-Verified76.973.649.180.674.977.9
GeneralGDPval-AA 2.11673-1107170815881595
GeneralAgents’ Last Exam31.627.613.231.630.825.7
GeneralTerminal Bench 4.034.928.81.549.039.942.4
GeneralTerminal Bench 2.189.987.665.289.188.884.3
GeneralOSWorld-Verified82.080.8-83.483.086.0
GeneralJobBench62.061.225.065.745.457.4
CyberCyberGym94.095.140.0---
CyberMiMo Cyber Bench80.277.20.0---
CyberExploitGym17.86.00.222.130.328.4
CyberExploitBench47.925.316.670.078.578.0
CyberSEC Bench Pro66.347.517.7-79.1-
VisualMiMo Visual Coding72.371.5-70.073.469.1

报告另给出两个过程性证据:

  • DeepSWE v1.1 的 average@3 在 Pro RL 过程中从 58.4 升至 72.6,Flash 从 48.7 升至 65.7;这是同一训练流程的前后变化,不是独立模型对照。

  • Pro 的 router 若不冻结,报告在 decoder layer 9 观察到 CV 从 0.78 升至 2.0、peak load 从约 6× 升至 16×、cold experts 从 0.5% 升至 22%;冻结 router 的 run 保持 CV 约 0.7、peak load 约 5.5×、cold experts 约 1%,benchmark 仍增长。该消融支持“RL 阶段冻结 MoE router”的工程选择。

测试/工作流步骤

要复核报告结果,至少应固定以下条件,并把公开权重与 API 结果分开:

  1. 下载 XiaomiMiMo/MiMo-V2.6-Pro-RL,记录 commit SHA、权重精度、推理引擎和 GPU 拓扑;不要把 Flash、Distill-Qwen-9B 或 UltraSpeed 混入 Pro 结果。

  2. 按模型卡的官方配置启动推理。vLLM 关键参数为 --tensor-parallel-size 8、--trust-remote-code、--gpu-memory-utilization 0.95、--max-model-len auto、--reasoning-parser mimo、--tool-call-parser mimo、--enable-auto-tool-choice、--generation-config vllm;采样先记录 temperature=1.0、top_p=0.95。

  3. 对每个 benchmark 保存版本、任务集、样本量、system prompt、工具 schema、最大 turns/tokens、超时、随机种子、逐题输出和评分日志。报告没有公开其中全部字段,缺失处必须标注“未公开”。

  4. 先复跑公开的 DeepSWE v1.1、ProgramBench、Terminal Bench 2.1、OSWorld-Verified、Toolathlon-Verified、CyberGym、ExploitBench 等,再单独实现或申请 MiMo 内部 benchmark;内部任务不可用公开数字假装复现。

  5. 复现 harness 转移时,分别在四个训练 mini-harness 和 Codex、Claude Code、mini-swe-agent 三个 held-out harness 运行同一代码任务,并报告每个 harness 的 Pass@1、样本量及均值计算方式。

  6. 复核 reward-hacking 时,在隔离、无网络环境中记录环境清理、hack-agent 探测、轨迹审计和 verifier 输出;不要仅用最终分数判断 reward 是否可靠。

原始证据与数据

  • 技术报告第 1 页:摘要、1,568 samples、每步 2.7–3.7B tokens、四类环境、多 harness、groupwise grading 和冻结 router 的总览。

  • 第 4–6 页:Hybrid-SWA 主干、MiMo-ViT、双阶段音频编码器、MTP 解码器和 Pro/Flash 配置表。

  • 第 7–9 页:Pro 预训练 30T tokens(27T text + 3T omni)、mid-training 上下文扩展、RL 成本和 batch/rollout 设置。

  • 第 10–16 页:code/general/visual/cyber 环境构建、测试稳定性、multi-harness 设计和 reward-hacking 防线。

  • 第 17–20 页:GRS、GAR、长度惩罚与行为惩罚公式;GRS 的公开定义为 R_i = R_test_i × S_sol_i × S_beh_i。

  • 第 20–24 页:RL task mix、Muown 参数、评测类别、held-out harness、router freeze 消融和失败分析。

  • 第 26 页:Table 3 的 17 项 Pro benchmark 结果;第 34–36 页:Distill-Qwen-9B 的开放环境与多 harness 辅助实验。

  • 官方模型卡公开的部署配置和模型元数据:https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/README.md。

适用边界

  • 厂商自报:Table 3、训练成本、训练前后分数、reward-hacking 占比和 harness 转移曲线均来自 Xiaomi MiMo;本篇没有把它们写成独立复测。

  • 缺少复现要件:报告公开 benchmark 名称和总分,但没有为每个 benchmark 给出完整 prompt、system prompt、工具 schema、样本量、随机种子、逐题日志、置信区间、并行度和完整评分脚本。

  • 内部任务不可直接横比:MiMo Code Bench、MiMo Cyber Bench、MiMo Visual Coding 是内部 benchmark;没有公开完整任务集时,只能作为厂商自报指标。

  • 不同模型/端点不能混算:Pro-RL 权重、API mimo-v2.6-pro、mimo-v2.6-pro-ultraspeed、Flash 和 Distill-Qwen-9B 的计算图、服务层和推理配置可能不同。

  • 训练过程分数不等于最终对照:DeepSWE 的 58.4→72.6 是 RL 过程的 checkpoint 变化,受数据、环境、grader、harness 和优化器共同影响,不能归因于单一架构因素。

  • 图表近似值需保留不确定性:held-out harness 的“约 50%→66%”来自报告曲线,报告未在正文给出精确逐步数据;不能伪装成精确统计量。

  • 报告没有给出统一失败率:虽然报告分析了 OOM、DBE、grader 网络不可达、expert imbalance 和 partial-rollout 等失败,但没有提供每个 benchmark 的失败样本分布,因此分数不代表端到端稳定性。

  • 部署要求高:Pro 是 1.02T 稀疏 MoE,模型卡的官方 vLLM/SGLang 示例需要多卡/多节点配置;单卡或不同量化、不同并行策略的结果不能直接与表 3 对齐。

来源摘录或观察(仅做合规短引)

  • 报告标题中的核心表述是 “Scaling Reinforcement Learning Towards Self-Improvement”,说明它的主要贡献是 RL 训练系统与环境,而不是仅发布一个静态模型权重。

  • 报告训练设置明确写出 “1,568 prompts with 16 rollouts per prompt”;这解释了为何官方结果不能直接按普通单轮聊天调用复现。

  • 模型卡把 Pro 的技术报告入口标为 “Technical Report”,并公开 MiMo_V2_6_technical_report.pdf、架构图、SGLang/vLLM 配置和完整 benchmark 表;本篇数字均优先核对该 PDF,而不是搜索摘要或转载。

能支持的判断

  • 长上下文代码 Agent、通用工具工作流、视觉网页/设计任务、漏洞复现,以及需要文本、图像、视频和音频联合理解的 Agent 场景。

不能支持的判断

  • 仅凭官方表格判断生产成功率、成本效率或统计显著性;把内部 benchmark、训练曲线或演示案例当成独立盲测;把 Pro-RL 权重结果直接等同于 API 的 mimo-v2.6-pro-ultraspeed。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Hugging Face(XiaomiMiMo 官方模型卡与技术报告) · LLM-Core Xiaomi / Xiaomi MiMo Team · 原文发布日期 2026-09-22 · 本站编辑日期 2026-09-22

打开原始来源

MiMo-V2.6-Pro

在 Tabbit 中比较 MiMo-V2.6-Pro

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Pro 测评:最聪明的开源模型,却让你等 18 秒

MiMo-V2.6-Pro 公开证据测评:真实任务成败实录、18 秒等待与思考账单、社区原声两极分化,以及按工作负载给出的选型裁决。

定价 · 简体中文

MiMo-V2.6-Pro 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Pro 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、思考 Token 增量、UltraSpeed 极速模式及实际任务预算测算。

替代品 · 简体中文

MiMo-V2.6-Pro 替代品:按任务和预算选模型

用完成任务的真实成本、agent 可靠性、开源权重和部署条件,横向评估五个 MiMo-V2.6-Pro 替代方案,价格核对时间为 2026 年 9 月 22 日。

模型对比 · 简体中文

MiMo-V2.6-Pro 对比 MiMo-V2.6-Flash:小米 MoE 模型选型深度评测

深度实测小米 MiMo-V2.6-Pro 与 Flash:1.02T 对比 309B MoE 架构、3.1 倍 API 费率差异、前缀缓存经济学、长程 Agent 基准与场景选型决策矩阵。

相关评测

小米 MiMo 官方发布:MiMo-V2.6-Pro 基准信号与原生全模态定位小米官方把 MiMo-V2.6-Pro 定位为面向 Agent、代码、视觉与电脑操作的原生全模态开源模型,并自报 Artificial Analysis Intelligence Index 46 分及多项 RL/Agent 结果;这些数字仍是厂商发布口径,不能替代同一 harness 下的独立复测。MiMo-V2.6-Pro 官方 X 发布线程:任务定位、公开基准与开源入口这条官方线程把 MiMo-V2.6-Pro 定位为公开构建的原生全模态 Agent 模型,重点覆盖代码、计算机使用、3D、设计、科研和工具工作流;线程中的榜单与案例能帮助筛选任务方向,但仍是厂商口径,不能替代同一 harness 下的独立复测。Arena Code Arena:MiMo-V2.6-Pro 的 WebDev AutoEval 记录Arena 的 Code Arena | WebDev 总榜已收录 mimo-v2.6-pro,显示 AutoEval 分数 1628(+18/-18),但没有公开投票数或名次,因此只能说明它进入了 WebDev 自动评测榜,不能把 1628 当作盲投排名。Reddit 实测:MiMo-V2.6-Pro 在 UI/UX 终端修改任务中陷入 grep 无限循环在一项真实网站 UI/UX 修改任务中,发帖人称 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 都在终端触发与 grep 相关的无限循环,约 30 分钟没有修复代码;同一修改交给 DeepSeek V4.1 Flash 后则持续推进并完整输出终端工作记录。小米 MiMo-V2.6-Pro 官方 API 接入与推理配置这份官方配置可直接用于通过 OpenAI 兼容协议接入 mimo-v2.6-pro,并按任务需要选择深度思考、流式输出和多轮工具调用。Hugging Face 官方 MiMo-V2.6-Pro-RL 本地部署与聊天模板配置官方模型卡已经给出 MiMo-V2.6-Pro-RL 的 SGLang 与 vLLM 服务命令,并在仓库 tokenizer 配置中定义了文本、图像、视频、音频、思考和工具调用的聊天模板;本地部署应使用 checkpoint 名称,不能把它与托管 API 的 mimo-v2.6-pro 当成同一个模型标识。小米 MiMo-V2.6-Pro 全模态输入与视觉任务工作流mimo-v2.6-pro 可通过 OpenAI Chat Completions API 读取公网 URL 或符合格式的 Base64 图像、视频和音频,但不能直接上传本地文件,媒体和文本总 Token 仍受 1M 上下文限制。小米 MiMo-V2.6-Pro 官方函数调用与多轮 Agent 工作流对 mimo-v2.6-pro,官方工作流是“模型返回完整 assistant(包括 reasoning_content 和 tool_calls)→ 客户端执行工具 → 追加 role: tool 结果 → 再请求模型”,直到本轮不再产生工具调用。