MiMo-V2.6-Pro · workflow
mimo-v2.6-pro 可通过 OpenAI Chat Completions API 读取公网 URL 或符合格式的 Base64 图像、视频和音频,但不能直接上传本地文件,媒体和文本总 Token 仍受 1M 上下文限制。
用 MiMo-V2.6-Pro 处理 {{TASK}}:先固定 {{MODEL_ID}} 和 {{INPUT_FORMAT}},再按 {{TOOL_STEPS}} 执行,并用 {{ACCEPTANCE}} 核对结果。
运行前替换每个变量,并把实际取值写进验收记录。运行前仍需替换: {{TASK}}, {{MODEL_ID}}, {{INPUT_FORMAT}}, {{TOOL_STEPS}}, {{ACCEPTANCE}}
用 MiMo-V2.6-Pro 处理 {{TASK}}:先固定 {{MODEL_ID}} 和 {{INPUT_FORMAT}},再按 {{TOOL_STEPS}} 执行,并用 {{ACCEPTANCE}} 核对结果。
mimo-v2.6-pro 可通过 OpenAI Chat Completions API 读取公网 URL 或符合格式的 Base64 图像、视频和音频,但不能直接上传本地文件,媒体和文本总 Token 仍受 1M 上下文限制。
适合的任务:图片描述与分类、多图差异分析、视频内容与时序分析、音频内容分析,以及在这些任务上继续生成结构化总结。
不适合的任务:把本地路径直接交给 API;官方明确说明 mimo-v2.6-pro 暂不支持图片、视频和音频本地文件上传。对需要逐字听写的专用语音识别任务,应另行评估官方 mimo-v2.5-asr,本文不将多模态理解示例当作 ASR 测评。
适用的模型版本:mimo-v2.6-pro。官方页面也列出 mimo-v2.6-flash、mimo-v2.6-pro-ultraspeed 和 mimo-v2.5,但本文代码、限制和结论只针对 Pro。
适用的客户端、Agent 或 API:OpenAI Chat Completions API,Python openai SDK;示例使用 https://api.xiaomimimo.com/v1。
推荐的推理档位和参数:先用官方示例的 max_completion_tokens=1024 做连通性验证;视频根据时序任务调 fps,根据画面细节调 media_resolution。复杂媒体分析可提高输出预算,但必须把媒体 Token、文本 Token 和输出预算合并检查上下文上限。
以下请求结构来自官方图片理解页面,运行前替换 API Key、图片 URL 和任务文本:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MIMO_API_KEY"],
base_url="https://api.xiaomimimo.com/v1",
)
completion = client.chat.completions.create(
model="mimo-v2.6-pro",
messages=[
{
"role": "system",
"content": "You are MiMo, an AI assistant developed by Xiaomi.",
},
{
"role": "user",
"content": [
{
"type": "image_url",
"image_url": {
"url": "https://example.com/image.png"
},
},
{
"type": "text",
"text": "请描述图片内容,并按主体、场景、动作和不确定项分组。",
},
],
},
],
max_completion_tokens=1024,
)
print(completion.model_dump_json())OpenAI 兼容协议的 image_url.url 必须携带 data:{MIME_TYPE};base64, 前缀;$BASE64_IMAGE 本身只放纯 Base64 字符串。
import base64
with open("image.png", "rb") as f:
base64_image = base64.b64encode(f.read()).decode("ascii")
image_url = f"data:image/png;base64,{base64_image}"
completion = client.chat.completions.create(
model="mimo-v2.6-pro",
messages=[
{"role": "user", "content": [
{"type": "image_url", "image_url": {"url": image_url}},
{"type": "text", "text": "识别图片中的关键字段,并标出无法确认的字段。"},
]},
],
max_completion_tokens=1024,
)官方视频示例使用 video_url,并将 fps 设为 2、media_resolution 设为 default:
completion = client.chat.completions.create(
model="mimo-v2.6-pro",
messages=[
{
"role": "user",
"content": [
{
"type": "video_url",
"video_url": {
"url": "https://example.com/video.mp4"
},
"fps": 2,
"media_resolution": "default",
},
{
"type": "text",
"text": "按时间顺序概括视频中的事件,并指出关键画面变化。",
},
],
},
],
max_completion_tokens=1024,
)当动作变化快或需要更细的时间定位时可提高 fps;当重点是小物体或纹理时可使用 media_resolution="max"。这两个字段属于视频输入项,不是模型名称或推理模式参数。
官方音频示例使用 input_audio.data 传入公网 URL:
completion = client.chat.completions.create(
model="mimo-v2.6-pro",
messages=[
{
"role": "user",
"content": [
{
"type": "input_audio",
"input_audio": {
"data": "https://example.com/audio.wav"
},
},
{
"type": "text",
"text": "概括音频内容,区分说话人可确认的信息和不确定的信息。",
},
],
},
],
max_completion_tokens=1024,
)音频 Base64 仍需使用 data:{MIME_TYPE};base64,$BASE64_AUDIO 形式:
audio_data = f"data:audio/wav;base64,{base64_audio}"准备 MIMO_API_KEY,安装 openai SDK,并确认媒体地址在公网可访问;不要把本地路径或真实 Key 放进请求。
先发送一张小型 PNG 或一段短音频,使用 max_completion_tokens=1024,确认响应中的 model 为 mimo-v2.6-pro,且 choices[0].message.content 非空。
图片任务验证两种输入:公网 URL 和 data:{MIME_TYPE};base64,;检查 MIME 类型与真实文件一致。图片格式只使用官方列出的 JPEG、PNG、GIF、WebP 或 BMP。
视频任务先使用 fps=2、media_resolution="default",再只改变一个变量进行对照:快速动作提高 fps,细节识别改为 max。确认 URL、格式和文件大小符合限制。
音频任务先用 WAV 或 MP3 URL,再测试 Base64;检查返回结果的 usage.prompt_tokens_details.audio_tokens(若响应提供该字段),并与时长乘以 6.25 的官方估算作数量级对照。
每次记录:模型 ID、媒体类型、URL/Base64 方式、MIME 类型、媒体大小、视频 fps/media_resolution、文本问题、max_completion_tokens、响应 usage 和错误信息。
若响应为空、媒体无法识别或出现上下文/大小错误,先缩短媒体或降低视频 fps/分辨率,再重试;不要仅凭 HTTP 成功就认为模型正确理解了媒体。
官方页面直接列出支持模型:mimo-v2.6-flash、mimo-v2.6-pro、mimo-v2.6-pro-ultraspeed 和 mimo-v2.5。
支持图片公网 URL 和 Base64 两种方式;URL 和 Base64 单张图片大小均不得超过 50 MB。
支持格式:JPEG、PNG、GIF、WebP、BMP。
多图数量受模型上下文限制,图片与文本的总 Token 必须小于模型上下文长度。
官方说明 Pro 暂不支持本地文件上传。
官方示例响应的 model 为 mimo-v2.6-pro,并展示了 image_tokens 用量字段;实际用量以 API 响应为准。
官方页面直接列出支持模型:mimo-v2.6-flash、mimo-v2.6-pro、mimo-v2.6-pro-ultraspeed 和 mimo-v2.5。
支持视频公网 URL 和 Base64;URL 单个视频不超过 300 MB,Base64 字符串不超过 50 MB。
支持格式:MP4、MOV、AVI、WMV;官方提醒格式变种较多,必须通过测试确认可识别。
多视频数量受上下文限制,所有视频与文本总 Token 必须小于模型上下文长度。
fps 默认 2,范围 [0.1, 10];越高抽帧越密集、时序细节越多、Token 消耗越高。
media_resolution 支持 default 与 max;default 平衡效果和效率,max 提升小物体与细节纹理识别能力。
视频 Token 分为 video_tokens 与 audio_tokens;官方页面给出音频 Token 约为音频时长(秒)乘以 6.25,所有估算仅供参考,实际用量以响应为准。
官方说明 Pro 暂不支持视频本地文件上传。
官方页面直接列出支持模型:mimo-v2.6-flash、mimo-v2.6-pro、mimo-v2.6-pro-ultraspeed 和 mimo-v2.5。
支持音频公网 URL 和 Base64;URL 单个音频不超过 100 MB,Base64 字符串不超过 50 MB。
支持格式:MP3、WAV、FLAC、M4A、OGG;官方提醒格式变种较多,必须通过测试确认可识别。
多音频数量受上下文限制,所有音频与文本总 Token 必须小于模型上下文长度。
官方说明音频 Token 约为音频时长(秒)乘以 6.25,实际用量以 API 响应为准。
官方说明 Pro 暂不支持音频本地文件上传。
“支持模型列表”证明的是官方 API 接受该模型用于全模态输入,不是图像、视频或音频理解能力的独立基准测试。
公网 URL 必须能被服务端访问;私有网络、过期签名 URL 或需要登录的链接不能按成功路径假定。
Base64 的 50 MB 是编码字符串大小限制,不等于原始文件可安全达到 50 MB;编码膨胀和请求体限制应留出余量。
多媒体 Token 与文本、输出共同占用上下文;即使单个文件未超大小限制,组合输入仍可能超出上下文上限。
视频 fps 提高会增加输入 Token 和延迟;media_resolution="max" 也会增加成本,必须以任务需要为依据。
官方示例的日期、系统提示词和 max_completion_tokens=1024 是示例配置,不应当被解读为 Pro 的唯一必需值。
文档没有为本文任务提供“本地文件上传”接口;不要通过猜测字段名或其他浏览器方式绕过该限制。
文档没有承诺所有媒体编码变种、音频说话人分离、时间戳精度或 OCR 准确率;这些能力需要在自己的样本上验证。
图片理解(官方):页面说明图片可用 URL 或 Base64 传入,并明确示例中的 model 为 mimo-v2.6-pro;同时列出 50 MB 单图限制、支持格式和多图上下文限制。
视频理解(官方):页面说明视频可用 URL 或 Base64 传入,并明确使用 video_url、fps 和 media_resolution;同时列出 300 MB URL、50 MB Base64、fps 范围 [0.1, 10] 和 default/max 分辨率档次。
音频理解(官方):页面说明音频可用 URL 或 Base64 传入,并明确使用 input_audio.data;同时列出 100 MB URL、50 MB Base64、支持格式及约 6.25 tokens/秒 的估算。
三个页面的常见问题均明确列出 mimo-v2.6-pro 暂不支持本地文件上传;因此本文只提供 URL 和 Base64 工作流。
小米 Xiaomi MiMo 官方文档 · 原文日期: 2026-09-22 · 编辑日期: 2026-09-22
阅读原始来源MiMo-V2.6-Pro
请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。