MiMo-V2.6-Pro · configuration
官方模型卡已经给出 MiMo-V2.6-Pro-RL 的 SGLang 与 vLLM 服务命令,并在仓库 tokenizer 配置中定义了文本、图像、视频、音频、思考和工具调用的聊天模板;本地部署应使用 checkpoint 名称,不能把它与托管 API 的 mimo-v2.6-pro 当成同一个模型标识。
调用 MiMo-V2.6-Pro 时固定 {{MODEL_ID}}、{{REASONING_EFFORT}} 和 {{API_BASE}}。任务是 {{TASK}},只使用 {{TOOL_ALLOWLIST}},并用 {{ACCEPTANCE}} 验收。
运行前替换每个变量,并把实际取值写进验收记录。运行前仍需替换: {{MODEL_ID}}, {{REASONING_EFFORT}}, {{API_BASE}}, {{TASK}}, {{TOOL_ALLOWLIST}}, {{ACCEPTANCE}}
调用 MiMo-V2.6-Pro 时固定 {{MODEL_ID}}、{{REASONING_EFFORT}} 和 {{API_BASE}}。任务是 {{TASK}},只使用 {{TOOL_ALLOWLIST}},并用 {{ACCEPTANCE}} 验收。
官方模型卡已经给出 MiMo-V2.6-Pro-RL 的 SGLang 与 vLLM 服务命令,并在仓库 tokenizer 配置中定义了文本、图像、视频、音频、思考和工具调用的聊天模板;本地部署应使用 checkpoint 名称,不能把它与托管 API 的 mimo-v2.6-pro 当成同一个模型标识。
适合的任务:自托管文本推理、代码与 Agent 服务,以及需要统一处理文本、图像、视频、音频输入的服务端工作流。
不适合的任务:单张消费级显卡或只需要低延迟托管 API 的调用;模型卡没有提供单卡部署方案,也没有把本地 checkpoint 的参数直接映射为 API 配额或延迟保证。
适用的模型版本:本地 checkpoint 仅指 XiaomiMiMo/MiMo-V2.6-Pro-RL;不要把下文 V2.5 部署参考中的 MiMo-V2.5 或 MiMo-V2.5-Pro 改名当作 V2.6 证据,也不要外推到 MiMo-V2.6-Flash-RL、mimo-v2.6-pro-ultraspeed。
适用的客户端、Agent 或 API:模型卡给出的 SGLang OpenAI-compatible 服务、vLLM OpenAI-compatible 服务;聊天模板来自 Hugging Face 仓库的 tokenizer_config.json / chat_template.jinja。
推荐的推理档位和参数:模型卡推荐采样 temperature=1.0、top_p=0.95。SGLang 示例使用两节点、TP16、DP2;vLLM 示例使用 --tensor-parallel-size 8,具体 GPU 数量、显存和并行度必须按本地环境重新验证。
模型卡指定 Docker 镜像为 lmsysorg/sglang:latest,并给出以下两节点服务命令。<node-rank> 和 <node0-ip> 是部署者必须替换的占位符,不能原样执行。
docker pull lmsysorg/sglang:latest
sglang serve \
--trust-remote-code \
--model-path XiaomiMiMo/MiMo-V2.6-Pro-RL \
--tp 16 \
--dp 2 \
--enable-dp-attention \
--mm-enable-dp-encoder \
--ep 16 \
--moe-a2a-backend deepep \
--moe-dense-tp-size 1 \
--mem-fraction-static 0.7 \
--max-running-requests 128 \
--chunked-prefill-size 32768 \
--page-size 64 \
--swa-full-tokens-ratio 0.3 \
--speculative-algorithm EAGLE \
--speculative-num-steps 3 \
--speculative-eagle-topk 1 \
--speculative-num-draft-tokens 4 \
--enable-multi-layer-eagle \
--reasoning-parser mimo \
--tool-call-parser mimo \
--host 0.0.0.0 \
--port 30000 \
--nnodes 2 \
--node-rank <node-rank> \
--dist-init-addr <node0-ip>:20000vllm serve XiaomiMiMo/MiMo-V2.6-Pro-RL \
--tensor-parallel-size 8 \
--trust-remote-code \
--gpu-memory-utilization 0.95 \
--max-model-len auto \
--reasoning-parser mimo \
--tool-call-parser mimo \
--enable-auto-tool-choice \
--generation-config vllm模型卡只要求跟随 vLLM MiMo-V2.5 recipe,没有给出 V2.6 专用 Docker tag。该 recipe 当前明确展示的是 XiaomiMiMo/MiMo-V2.5 和 vllm/vllm-openai:mimov25-cu129,因此不能把这个 V2.5 镜像写成 V2.6 的已验证依赖。部署 V2.6 前应确认实际 vLLM 版本、远程代码和 checkpoint 支持情况。
模型卡 API 返回的 tokenizer_config.chat_template 与仓库 chat_template.jinja 定义了以下规则。使用 Hugging Face tokenizer 时应保留仓库模板,不要另写一个会丢失特殊 token 的简化模板。
普通消息:<|im_start|>{role}\n{rendered_content}<|im_end|>
assistant 消息:<|im_start|>assistant\n<think>{reasoning_content}</think>{content}<|im_end|>
生成提示:<|im_start|>assistant\n
关闭思考(enable_thinking=false):在生成提示后追加 <think></think>内容部分的特殊映射是:
image -> <|vision_start|><|image_pad|><|vision_end|>
video -> <|vision_start|><|video_pad|><|vision_end|>
audio -> <|mimo_audio_start|><|audio_pad|><|mimo_audio_end|>模板还会把工具定义放进 You are provided with the following tools: 与 <tools>...</tools> 区块,并把工具调用序列化为 <tool_call><function=函数名>...</function></tool_call>。工具参数可以使用 <parameter=参数名>值</parameter> 形式。以上是模板源码的行为说明,不是模型卡额外发布的任务提示词。
先确认运行环境能承载模型卡中的配置:模型摘要为稀疏 MoE,总参数约 1.02T、激活参数 42B,最大上下文 1M;仓库权重还包含 FP8 配置和大量分片文件。不要按普通单卡 Transformers 模型估算显存。
选择 SGLang 或 vLLM,并直接使用 checkpoint 名称 XiaomiMiMo/MiMo-V2.6-Pro-RL。启动前检查 --tp / --tensor-parallel-size、节点数和网络端口是否与实际拓扑一致。
SGLang 多节点配置需要为每个节点设置不同的 --node-rank,并让所有节点能访问 <node0-ip>:20000;服务端口由模型卡设置为 30000。
vLLM 配置启用 --reasoning-parser mimo、--tool-call-parser mimo 和 --enable-auto-tool-choice 时,客户端也应按 OpenAI-compatible 接口传递工具定义并验证返回字段,不能只检查 HTTP 200。
用 tokenizer 的仓库模板构造最小文本请求,再逐项验证图像、视频、音频占位映射和工具调用;先小批量测试,再提高 max-running-requests 或启用 EAGLE。
将 temperature=1.0、top_p=0.95 作为模型卡建议的起点。SGLang 的 EAGLE 参数是模型卡服务命令的一部分,但其实际接受率和收益取决于任务分布,应单独压测,不把启动成功当作加速结论。
Hugging Face API 的模型元数据将仓库标识为 XiaomiMiMo/MiMo-V2.6-Pro-RL,架构为 MiMoV2ForCausalLM,library_name=transformers,模型类型为 mimo_v2,并暴露 tokenizer_config.chat_template。
模型卡的模型摘要写明:Sparse MoE,总参数约 1.02T、激活参数 42B;上下文长度 1M;模态为文本、图像、视频、音频;视觉编码器 681M 参数;音频编码器由 308M AudioTokenizer 和 127M audio patch encoder 组成;包含 5 层 MTP speculative decoder。
模型卡的 Deployment 部分直接给出 SGLang 命令:--tp 16、--dp 2、--ep 16、--enable-dp-attention、--mm-enable-dp-encoder、DeepEP、EAGLE 多层推测解码、--reasoning-parser mimo、--tool-call-parser mimo,并设置 --nnodes 2。
模型卡的 vLLM 部分直接给出 --tensor-parallel-size 8、--max-model-len auto、--reasoning-parser mimo、--tool-call-parser mimo、--enable-auto-tool-choice 和 --generation-config vllm,并建议 temperature=1.0、top_p=0.95。
SGLang 直接链接的官方 Cookbook 页面是 MiMo-V2.5 页面,页面自身区分 MiMo-V2.5-Pro 与 MiMo-V2.5,并提供 V2.5 的安装、推理、工具调用和多模态示例;这些示例用于说明 OpenAI-compatible 服务的调用形态,不是 V2.6-Pro-RL 的独立验证。
vLLM 直接链接的官方 Recipe 也是 MiMo-V2.5 页面,当前页面的示例模型为 XiaomiMiMo/MiMo-V2.5,并明确展示 V2.5 的硬件和镜像配置;因此本篇只采纳其作为模型卡所指向的部署参考,不把其 V2.5 数字改写成 V2.6 数字。
mimo-v2.6-pro 的边界| 项目 | 官方名称 | 本篇可确认的含义 |
|---|---|---|
| 本地权重 | XiaomiMiMo/MiMo-V2.6-Pro-RL | Hugging Face 上可下载的 Pro-RL checkpoint;SGLang/vLLM 命令使用此名称 |
| 托管 API | mimo-v2.6-pro | 小米 API 平台的模型 ID;现有 API 文档另行说明其端点和配额 |
| 不能混用的字段 | --model-path / model | 本地服务命令应使用 checkpoint 名称;托管 API 请求使用 API 模型 ID |
| 不能外推的版本 | MiMo-V2.6-Flash-RL、mimo-v2.6-pro-ultraspeed、V2.5 | 这些是不同 checkpoint、服务 SKU 或版本,不能用本篇命令和模板直接证明其行为相同 |
本篇是官方配置整理,不是本地复测;没有在当前环境下载约 524 GB 级别的仓库权重,也没有声称命令已在本机成功启动。
模型卡给出的 1M 上下文、参数规模、并行度和采样参数均属于官方信息;不应据此推导任意硬件上的吞吐、延迟或成本。
模型卡直接链接的 SGLang 与 vLLM 文档当前是 V2.5 页面;V2.6 的有效性以模型卡明确给出的 V2.6 命令和实际运行验证为准。
trust-remote-code 会执行仓库中的自定义代码;生产环境应固定 commit、镜像和依赖版本,并在隔离环境中审查代码。
多模态内容的特殊 token 只表示模板占位;图片、视频、音频的解码、预处理和服务端支持仍取决于所选推理框架和版本。
工具调用模板能序列化工具定义和调用,但不会替应用程序执行工具;生产 Agent 仍需实现权限控制、参数校验、超时、重试和结果回传。
本文不把 API mimo-v2.6-pro 的在线接口参数、配额或可用客户端复制到本地 checkpoint;两者应分别按各自官方文档配置。
Hugging Face 模型卡:页面将 MiMo-V2.6-Pro-RL 定义为 MiMo-V2.6 系列的 flagship checkpoint,并给出“follow the SGLang MiMo cookbook”以及 vLLM recipe 链接。
模型卡 Deployment:公开的 SGLang 配置包含 --model-path XiaomiMiMo/MiMo-V2.6-Pro-RL、两节点参数、EAGLE 参数以及 reasoning/tool-call parser;vLLM 配置包含 TP8、自动工具选择和 generation-config vllm。
模型卡 tokenizer 配置:模板源码对 image、video、audio 内容写入对应的视觉或音频特殊 token,并以 enable_thinking 控制是否追加空的 <think></think>。
官方部署参考:SGLang Cookbook 和 vLLM Recipe 的页面标题与正文均是 MiMo-V2.5;它们是模型卡直接指向的部署参考,不是对 V2.6-Pro-RL 的独立测评。
Hugging Face / SGLang Documentation / vLLM Recipes · 原文日期: 2026-09-21 · 编辑日期: 2026-09-22
阅读原始来源MiMo-V2.6-Pro
请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。