Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
提示词与工作流

MiMo-V2.6-Pro · configuration

Hugging Face 官方 MiMo-V2.6-Pro-RL 本地部署与聊天模板配置

官方模型卡已经给出 MiMo-V2.6-Pro-RL 的 SGLang 与 vLLM 服务命令,并在仓库 tokenizer 配置中定义了文本、图像、视频、音频、思考和工具调用的聊天模板;本地部署应使用 checkpoint 名称,不能把它与托管 API 的 mimo-v2.6-pro 当成同一个模型标识。

来源已核对;未实测模型卡给出的 SGLang OpenAI-compatible 服务、vLLM OpenAI-compatible 服务;聊天模板来自 Hugging Face 仓库的 tokenizer_config.json / chat_template.jinja。

前置条件与输入

  • 模型 ID
  • 推理或调用参数
  • API 端点
  • 任务说明
  • 验收标准

完整可复制模板

编辑改写:任务模板

Tabbit 编辑改写;非来源原文
调用 MiMo-V2.6-Pro 时固定 {{MODEL_ID}}、{{REASONING_EFFORT}} 和 {{API_BASE}}。任务是 {{TASK}},只使用 {{TOOL_ALLOWLIST}},并用 {{ACCEPTANCE}} 验收。

运行前替换每个变量,并把实际取值写进验收记录。

运行前仍需替换: {{MODEL_ID}}, {{REASONING_EFFORT}}, {{API_BASE}}, {{TASK}}, {{TOOL_ALLOWLIST}}, {{ACCEPTANCE}}

调用 MiMo-V2.6-Pro 时固定 {{MODEL_ID}}、{{REASONING_EFFORT}} 和 {{API_BASE}}。任务是 {{TASK}},只使用 {{TOOL_ALLOWLIST}},并用 {{ACCEPTANCE}} 验收。

查看来源研究笔记

一句话结论

官方模型卡已经给出 MiMo-V2.6-Pro-RL 的 SGLang 与 vLLM 服务命令,并在仓库 tokenizer 配置中定义了文本、图像、视频、音频、思考和工具调用的聊天模板;本地部署应使用 checkpoint 名称,不能把它与托管 API 的 mimo-v2.6-pro 当成同一个模型标识。

适用场景

  • 适合的任务:自托管文本推理、代码与 Agent 服务,以及需要统一处理文本、图像、视频、音频输入的服务端工作流。

  • 不适合的任务:单张消费级显卡或只需要低延迟托管 API 的调用;模型卡没有提供单卡部署方案,也没有把本地 checkpoint 的参数直接映射为 API 配额或延迟保证。

  • 适用的模型版本:本地 checkpoint 仅指 XiaomiMiMo/MiMo-V2.6-Pro-RL;不要把下文 V2.5 部署参考中的 MiMo-V2.5 或 MiMo-V2.5-Pro 改名当作 V2.6 证据,也不要外推到 MiMo-V2.6-Flash-RL、mimo-v2.6-pro-ultraspeed。

  • 适用的客户端、Agent 或 API:模型卡给出的 SGLang OpenAI-compatible 服务、vLLM OpenAI-compatible 服务;聊天模板来自 Hugging Face 仓库的 tokenizer_config.json / chat_template.jinja。

  • 推荐的推理档位和参数:模型卡推荐采样 temperature=1.0、top_p=0.95。SGLang 示例使用两节点、TP16、DP2;vLLM 示例使用 --tensor-parallel-size 8,具体 GPU 数量、显存和并行度必须按本地环境重新验证。

可直接使用的内容

1. SGLang 服务配置(模型卡原文命令)

模型卡指定 Docker 镜像为 lmsysorg/sglang:latest,并给出以下两节点服务命令。<node-rank> 和 <node0-ip> 是部署者必须替换的占位符,不能原样执行。

docker pull lmsysorg/sglang:latest

sglang serve \
  --trust-remote-code \
  --model-path XiaomiMiMo/MiMo-V2.6-Pro-RL \
  --tp 16 \
  --dp 2 \
  --enable-dp-attention \
  --mm-enable-dp-encoder \
  --ep 16 \
  --moe-a2a-backend deepep \
  --moe-dense-tp-size 1 \
  --mem-fraction-static 0.7 \
  --max-running-requests 128 \
  --chunked-prefill-size 32768 \
  --page-size 64 \
  --swa-full-tokens-ratio 0.3 \
  --speculative-algorithm EAGLE \
  --speculative-num-steps 3 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 4 \
  --enable-multi-layer-eagle \
  --reasoning-parser mimo \
  --tool-call-parser mimo \
  --host 0.0.0.0 \
  --port 30000 \
  --nnodes 2 \
  --node-rank <node-rank> \
  --dist-init-addr <node0-ip>:20000

2. vLLM 服务配置(模型卡原文命令)

vllm serve XiaomiMiMo/MiMo-V2.6-Pro-RL \
  --tensor-parallel-size 8 \
  --trust-remote-code \
  --gpu-memory-utilization 0.95 \
  --max-model-len auto \
  --reasoning-parser mimo \
  --tool-call-parser mimo \
  --enable-auto-tool-choice \
  --generation-config vllm

模型卡只要求跟随 vLLM MiMo-V2.5 recipe,没有给出 V2.6 专用 Docker tag。该 recipe 当前明确展示的是 XiaomiMiMo/MiMo-V2.5 和 vllm/vllm-openai:mimov25-cu129,因此不能把这个 V2.5 镜像写成 V2.6 的已验证依赖。部署 V2.6 前应确认实际 vLLM 版本、远程代码和 checkpoint 支持情况。

3. 聊天模板的可复核行为

模型卡 API 返回的 tokenizer_config.chat_template 与仓库 chat_template.jinja 定义了以下规则。使用 Hugging Face tokenizer 时应保留仓库模板,不要另写一个会丢失特殊 token 的简化模板。

普通消息:<|im_start|>{role}\n{rendered_content}<|im_end|>
assistant 消息:<|im_start|>assistant\n<think>{reasoning_content}</think>{content}<|im_end|>
生成提示:<|im_start|>assistant\n
关闭思考(enable_thinking=false):在生成提示后追加 <think></think>

内容部分的特殊映射是:

image  -> <|vision_start|><|image_pad|><|vision_end|>
video  -> <|vision_start|><|video_pad|><|vision_end|>
audio  -> <|mimo_audio_start|><|audio_pad|><|mimo_audio_end|>

模板还会把工具定义放进 You are provided with the following tools: 与 <tools>...</tools> 区块,并把工具调用序列化为 <tool_call><function=函数名>...</function></tool_call>。工具参数可以使用 <parameter=参数名>值</parameter> 形式。以上是模板源码的行为说明,不是模型卡额外发布的任务提示词。

测试/工作流步骤

  1. 先确认运行环境能承载模型卡中的配置:模型摘要为稀疏 MoE,总参数约 1.02T、激活参数 42B,最大上下文 1M;仓库权重还包含 FP8 配置和大量分片文件。不要按普通单卡 Transformers 模型估算显存。

  2. 选择 SGLang 或 vLLM,并直接使用 checkpoint 名称 XiaomiMiMo/MiMo-V2.6-Pro-RL。启动前检查 --tp / --tensor-parallel-size、节点数和网络端口是否与实际拓扑一致。

  3. SGLang 多节点配置需要为每个节点设置不同的 --node-rank,并让所有节点能访问 <node0-ip>:20000;服务端口由模型卡设置为 30000。

  4. vLLM 配置启用 --reasoning-parser mimo、--tool-call-parser mimo 和 --enable-auto-tool-choice 时,客户端也应按 OpenAI-compatible 接口传递工具定义并验证返回字段,不能只检查 HTTP 200。

  5. 用 tokenizer 的仓库模板构造最小文本请求,再逐项验证图像、视频、音频占位映射和工具调用;先小批量测试,再提高 max-running-requests 或启用 EAGLE。

  6. 将 temperature=1.0、top_p=0.95 作为模型卡建议的起点。SGLang 的 EAGLE 参数是模型卡服务命令的一部分,但其实际接受率和收益取决于任务分布,应单独压测,不把启动成功当作加速结论。

原始证据与数据

  • Hugging Face API 的模型元数据将仓库标识为 XiaomiMiMo/MiMo-V2.6-Pro-RL,架构为 MiMoV2ForCausalLM,library_name=transformers,模型类型为 mimo_v2,并暴露 tokenizer_config.chat_template。

  • 模型卡的模型摘要写明:Sparse MoE,总参数约 1.02T、激活参数 42B;上下文长度 1M;模态为文本、图像、视频、音频;视觉编码器 681M 参数;音频编码器由 308M AudioTokenizer 和 127M audio patch encoder 组成;包含 5 层 MTP speculative decoder。

  • 模型卡的 Deployment 部分直接给出 SGLang 命令:--tp 16、--dp 2、--ep 16、--enable-dp-attention、--mm-enable-dp-encoder、DeepEP、EAGLE 多层推测解码、--reasoning-parser mimo、--tool-call-parser mimo,并设置 --nnodes 2。

  • 模型卡的 vLLM 部分直接给出 --tensor-parallel-size 8、--max-model-len auto、--reasoning-parser mimo、--tool-call-parser mimo、--enable-auto-tool-choice 和 --generation-config vllm,并建议 temperature=1.0、top_p=0.95。

  • SGLang 直接链接的官方 Cookbook 页面是 MiMo-V2.5 页面,页面自身区分 MiMo-V2.5-Pro 与 MiMo-V2.5,并提供 V2.5 的安装、推理、工具调用和多模态示例;这些示例用于说明 OpenAI-compatible 服务的调用形态,不是 V2.6-Pro-RL 的独立验证。

  • vLLM 直接链接的官方 Recipe 也是 MiMo-V2.5 页面,当前页面的示例模型为 XiaomiMiMo/MiMo-V2.5,并明确展示 V2.5 的硬件和镜像配置;因此本篇只采纳其作为模型卡所指向的部署参考,不把其 V2.5 数字改写成 V2.6 数字。

Pro-RL checkpoint 与 API mimo-v2.6-pro 的边界

项目官方名称本篇可确认的含义
本地权重XiaomiMiMo/MiMo-V2.6-Pro-RLHugging Face 上可下载的 Pro-RL checkpoint;SGLang/vLLM 命令使用此名称
托管 APImimo-v2.6-pro小米 API 平台的模型 ID;现有 API 文档另行说明其端点和配额
不能混用的字段--model-path / model本地服务命令应使用 checkpoint 名称;托管 API 请求使用 API 模型 ID
不能外推的版本MiMo-V2.6-Flash-RL、mimo-v2.6-pro-ultraspeed、V2.5这些是不同 checkpoint、服务 SKU 或版本,不能用本篇命令和模板直接证明其行为相同

适用边界

  • 本篇是官方配置整理,不是本地复测;没有在当前环境下载约 524 GB 级别的仓库权重,也没有声称命令已在本机成功启动。

  • 模型卡给出的 1M 上下文、参数规模、并行度和采样参数均属于官方信息;不应据此推导任意硬件上的吞吐、延迟或成本。

  • 模型卡直接链接的 SGLang 与 vLLM 文档当前是 V2.5 页面;V2.6 的有效性以模型卡明确给出的 V2.6 命令和实际运行验证为准。

  • trust-remote-code 会执行仓库中的自定义代码;生产环境应固定 commit、镜像和依赖版本,并在隔离环境中审查代码。

  • 多模态内容的特殊 token 只表示模板占位;图片、视频、音频的解码、预处理和服务端支持仍取决于所选推理框架和版本。

  • 工具调用模板能序列化工具定义和调用,但不会替应用程序执行工具;生产 Agent 仍需实现权限控制、参数校验、超时、重试和结果回传。

  • 本文不把 API mimo-v2.6-pro 的在线接口参数、配额或可用客户端复制到本地 checkpoint;两者应分别按各自官方文档配置。

来源摘录或观察(仅做合规短引)

  1. Hugging Face 模型卡:页面将 MiMo-V2.6-Pro-RL 定义为 MiMo-V2.6 系列的 flagship checkpoint,并给出“follow the SGLang MiMo cookbook”以及 vLLM recipe 链接。

  2. 模型卡 Deployment:公开的 SGLang 配置包含 --model-path XiaomiMiMo/MiMo-V2.6-Pro-RL、两节点参数、EAGLE 参数以及 reasoning/tool-call parser;vLLM 配置包含 TP8、自动工具选择和 generation-config vllm。

  3. 模型卡 tokenizer 配置:模板源码对 image、video、audio 内容写入对应的视觉或音频特殊 token,并以 enable_thinking 控制是否追加空的 <think></think>。

  4. 官方部署参考:SGLang Cookbook 和 vLLM Recipe 的页面标题与正文均是 MiMo-V2.5;它们是模型卡直接指向的部署参考,不是对 V2.6-Pro-RL 的独立测评。

来源与日期

Hugging Face / SGLang Documentation / vLLM Recipes · 原文日期: 2026-09-21 · 编辑日期: 2026-09-22

阅读原始来源
变量检查

仍需替换: 6

{{MODEL_ID}}{{REASONING_EFFORT}}{{API_BASE}}{{TASK}}{{TOOL_ALLOWLIST}}{{ACCEPTANCE}}

相关提示词

小米 MiMo-V2.6-Pro 官方 API 接入与推理配置小米 MiMo-V2.6-Pro 全模态输入与视觉任务工作流小米 MiMo-V2.6-Pro 官方函数调用与多轮 Agent 工作流

相关测评

小米 MiMo 官方发布:MiMo-V2.6-Pro 基准信号与原生全模态定位Artificial Analysis:MiMo-V2.6-Pro 的智能指数、速度、价格与延迟MiMo-V2.6-Pro 官方技术报告:架构、规模化 RL 与评测条件MiMo-V2.6-Pro 官方 X 发布线程:任务定位、公开基准与开源入口

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Pro 测评:最聪明的开源模型,却让你等 18 秒

MiMo-V2.6-Pro 公开证据测评:真实任务成败实录、18 秒等待与思考账单、社区原声两极分化,以及按工作负载给出的选型裁决。

定价 · 简体中文

MiMo-V2.6-Pro 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Pro 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、思考 Token 增量、UltraSpeed 极速模式及实际任务预算测算。

替代品 · 简体中文

MiMo-V2.6-Pro 替代品:按任务和预算选模型

用完成任务的真实成本、agent 可靠性、开源权重和部署条件,横向评估五个 MiMo-V2.6-Pro 替代方案,价格核对时间为 2026 年 9 月 22 日。

模型对比 · 简体中文

MiMo-V2.6-Pro 对比 MiMo-V2.6-Flash:小米 MoE 模型选型深度评测

深度实测小米 MiMo-V2.6-Pro 与 Flash:1.02T 对比 309B MoE 架构、3.1 倍 API 费率差异、前缀缓存经济学、长程 Agent 基准与场景选型决策矩阵。

MiMo-V2.6-Pro

在 Tabbit 中使用 MiMo-V2.6-Pro

请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。