Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
提示词与工作流

MiMo-V2.6-Pro · workflow

小米 MiMo-V2.6-Pro 全模态输入与视觉任务工作流

mimo-v2.6-pro 可通过 OpenAI Chat Completions API 读取公网 URL 或符合格式的 Base64 图像、视频和音频,但不能直接上传本地文件,媒体和文本总 Token 仍受 1M 上下文限制。

来源已核对;未实测OpenAI Chat Completions API,Python openai SDK;示例使用 https://api.xiaomimimo.com/v1。

前置条件与输入

  • 任务目标
  • 输入材料
  • 工具或步骤约束
  • 验收标准

完整可复制模板

编辑改写:任务模板

Tabbit 编辑改写;非来源原文
用 MiMo-V2.6-Pro 处理 {{TASK}}:先固定 {{MODEL_ID}} 和 {{INPUT_FORMAT}},再按 {{TOOL_STEPS}} 执行,并用 {{ACCEPTANCE}} 核对结果。

运行前替换每个变量,并把实际取值写进验收记录。

运行前仍需替换: {{TASK}}, {{MODEL_ID}}, {{INPUT_FORMAT}}, {{TOOL_STEPS}}, {{ACCEPTANCE}}

用 MiMo-V2.6-Pro 处理 {{TASK}}:先固定 {{MODEL_ID}} 和 {{INPUT_FORMAT}},再按 {{TOOL_STEPS}} 执行,并用 {{ACCEPTANCE}} 核对结果。

查看来源研究笔记

一句话结论

mimo-v2.6-pro 可通过 OpenAI Chat Completions API 读取公网 URL 或符合格式的 Base64 图像、视频和音频,但不能直接上传本地文件,媒体和文本总 Token 仍受 1M 上下文限制。

适用场景

  • 适合的任务:图片描述与分类、多图差异分析、视频内容与时序分析、音频内容分析,以及在这些任务上继续生成结构化总结。

  • 不适合的任务:把本地路径直接交给 API;官方明确说明 mimo-v2.6-pro 暂不支持图片、视频和音频本地文件上传。对需要逐字听写的专用语音识别任务,应另行评估官方 mimo-v2.5-asr,本文不将多模态理解示例当作 ASR 测评。

  • 适用的模型版本:mimo-v2.6-pro。官方页面也列出 mimo-v2.6-flash、mimo-v2.6-pro-ultraspeed 和 mimo-v2.5,但本文代码、限制和结论只针对 Pro。

  • 适用的客户端、Agent 或 API:OpenAI Chat Completions API,Python openai SDK;示例使用 https://api.xiaomimimo.com/v1。

  • 推荐的推理档位和参数:先用官方示例的 max_completion_tokens=1024 做连通性验证;视频根据时序任务调 fps,根据画面细节调 media_resolution。复杂媒体分析可提高输出预算,但必须把媒体 Token、文本 Token 和输出预算合并检查上下文上限。

可直接使用的内容

图像 URL:描述或分类

以下请求结构来自官方图片理解页面,运行前替换 API Key、图片 URL 和任务文本:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MIMO_API_KEY"],
    base_url="https://api.xiaomimimo.com/v1",
)

completion = client.chat.completions.create(
    model="mimo-v2.6-pro",
    messages=[
        {
            "role": "system",
            "content": "You are MiMo, an AI assistant developed by Xiaomi.",
        },
        {
            "role": "user",
            "content": [
                {
                    "type": "image_url",
                    "image_url": {
                        "url": "https://example.com/image.png"
                    },
                },
                {
                    "type": "text",
                    "text": "请描述图片内容,并按主体、场景、动作和不确定项分组。",
                },
            ],
        },
    ],
    max_completion_tokens=1024,
)

print(completion.model_dump_json())

图像 Base64:不可公开访问的图片

OpenAI 兼容协议的 image_url.url 必须携带 data:{MIME_TYPE};base64, 前缀;$BASE64_IMAGE 本身只放纯 Base64 字符串。

import base64

with open("image.png", "rb") as f:
    base64_image = base64.b64encode(f.read()).decode("ascii")

image_url = f"data:image/png;base64,{base64_image}"

completion = client.chat.completions.create(
    model="mimo-v2.6-pro",
    messages=[
        {"role": "user", "content": [
            {"type": "image_url", "image_url": {"url": image_url}},
            {"type": "text", "text": "识别图片中的关键字段,并标出无法确认的字段。"},
        ]},
    ],
    max_completion_tokens=1024,
)

视频 URL:调节抽帧和分辨率

官方视频示例使用 video_url,并将 fps 设为 2、media_resolution 设为 default:

completion = client.chat.completions.create(
    model="mimo-v2.6-pro",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "video_url",
                    "video_url": {
                        "url": "https://example.com/video.mp4"
                    },
                    "fps": 2,
                    "media_resolution": "default",
                },
                {
                    "type": "text",
                    "text": "按时间顺序概括视频中的事件,并指出关键画面变化。",
                },
            ],
        },
    ],
    max_completion_tokens=1024,
)

当动作变化快或需要更细的时间定位时可提高 fps;当重点是小物体或纹理时可使用 media_resolution="max"。这两个字段属于视频输入项,不是模型名称或推理模式参数。

音频 URL:内容分析

官方音频示例使用 input_audio.data 传入公网 URL:

completion = client.chat.completions.create(
    model="mimo-v2.6-pro",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "input_audio",
                    "input_audio": {
                        "data": "https://example.com/audio.wav"
                    },
                },
                {
                    "type": "text",
                    "text": "概括音频内容,区分说话人可确认的信息和不确定的信息。",
                },
            ],
        },
    ],
    max_completion_tokens=1024,
)

音频 Base64 仍需使用 data:{MIME_TYPE};base64,$BASE64_AUDIO 形式:

audio_data = f"data:audio/wav;base64,{base64_audio}"

测试/工作流步骤

  1. 准备 MIMO_API_KEY,安装 openai SDK,并确认媒体地址在公网可访问;不要把本地路径或真实 Key 放进请求。

  2. 先发送一张小型 PNG 或一段短音频,使用 max_completion_tokens=1024,确认响应中的 model 为 mimo-v2.6-pro,且 choices[0].message.content 非空。

  3. 图片任务验证两种输入:公网 URL 和 data:{MIME_TYPE};base64,;检查 MIME 类型与真实文件一致。图片格式只使用官方列出的 JPEG、PNG、GIF、WebP 或 BMP。

  4. 视频任务先使用 fps=2、media_resolution="default",再只改变一个变量进行对照:快速动作提高 fps,细节识别改为 max。确认 URL、格式和文件大小符合限制。

  5. 音频任务先用 WAV 或 MP3 URL,再测试 Base64;检查返回结果的 usage.prompt_tokens_details.audio_tokens(若响应提供该字段),并与时长乘以 6.25 的官方估算作数量级对照。

  6. 每次记录:模型 ID、媒体类型、URL/Base64 方式、MIME 类型、媒体大小、视频 fps/media_resolution、文本问题、max_completion_tokens、响应 usage 和错误信息。

  7. 若响应为空、媒体无法识别或出现上下文/大小错误,先缩短媒体或降低视频 fps/分辨率,再重试;不要仅凭 HTTP 成功就认为模型正确理解了媒体。

原始证据与数据

图片理解

  • 官方页面直接列出支持模型:mimo-v2.6-flash、mimo-v2.6-pro、mimo-v2.6-pro-ultraspeed 和 mimo-v2.5。

  • 支持图片公网 URL 和 Base64 两种方式;URL 和 Base64 单张图片大小均不得超过 50 MB。

  • 支持格式:JPEG、PNG、GIF、WebP、BMP。

  • 多图数量受模型上下文限制,图片与文本的总 Token 必须小于模型上下文长度。

  • 官方说明 Pro 暂不支持本地文件上传。

  • 官方示例响应的 model 为 mimo-v2.6-pro,并展示了 image_tokens 用量字段;实际用量以 API 响应为准。

视频理解

  • 官方页面直接列出支持模型:mimo-v2.6-flash、mimo-v2.6-pro、mimo-v2.6-pro-ultraspeed 和 mimo-v2.5。

  • 支持视频公网 URL 和 Base64;URL 单个视频不超过 300 MB,Base64 字符串不超过 50 MB。

  • 支持格式:MP4、MOV、AVI、WMV;官方提醒格式变种较多,必须通过测试确认可识别。

  • 多视频数量受上下文限制,所有视频与文本总 Token 必须小于模型上下文长度。

  • fps 默认 2,范围 [0.1, 10];越高抽帧越密集、时序细节越多、Token 消耗越高。

  • media_resolution 支持 default 与 max;default 平衡效果和效率,max 提升小物体与细节纹理识别能力。

  • 视频 Token 分为 video_tokens 与 audio_tokens;官方页面给出音频 Token 约为音频时长(秒)乘以 6.25,所有估算仅供参考,实际用量以响应为准。

  • 官方说明 Pro 暂不支持视频本地文件上传。

音频理解

  • 官方页面直接列出支持模型:mimo-v2.6-flash、mimo-v2.6-pro、mimo-v2.6-pro-ultraspeed 和 mimo-v2.5。

  • 支持音频公网 URL 和 Base64;URL 单个音频不超过 100 MB,Base64 字符串不超过 50 MB。

  • 支持格式:MP3、WAV、FLAC、M4A、OGG;官方提醒格式变种较多,必须通过测试确认可识别。

  • 多音频数量受上下文限制,所有音频与文本总 Token 必须小于模型上下文长度。

  • 官方说明音频 Token 约为音频时长(秒)乘以 6.25,实际用量以 API 响应为准。

  • 官方说明 Pro 暂不支持音频本地文件上传。

适用边界

  • “支持模型列表”证明的是官方 API 接受该模型用于全模态输入,不是图像、视频或音频理解能力的独立基准测试。

  • 公网 URL 必须能被服务端访问;私有网络、过期签名 URL 或需要登录的链接不能按成功路径假定。

  • Base64 的 50 MB 是编码字符串大小限制,不等于原始文件可安全达到 50 MB;编码膨胀和请求体限制应留出余量。

  • 多媒体 Token 与文本、输出共同占用上下文;即使单个文件未超大小限制,组合输入仍可能超出上下文上限。

  • 视频 fps 提高会增加输入 Token 和延迟;media_resolution="max" 也会增加成本,必须以任务需要为依据。

  • 官方示例的日期、系统提示词和 max_completion_tokens=1024 是示例配置,不应当被解读为 Pro 的唯一必需值。

  • 文档没有为本文任务提供“本地文件上传”接口;不要通过猜测字段名或其他浏览器方式绕过该限制。

  • 文档没有承诺所有媒体编码变种、音频说话人分离、时间戳精度或 OCR 准确率;这些能力需要在自己的样本上验证。

来源摘录或观察(仅做合规短引)

  1. 图片理解(官方):页面说明图片可用 URL 或 Base64 传入,并明确示例中的 model 为 mimo-v2.6-pro;同时列出 50 MB 单图限制、支持格式和多图上下文限制。

  2. 视频理解(官方):页面说明视频可用 URL 或 Base64 传入,并明确使用 video_url、fps 和 media_resolution;同时列出 300 MB URL、50 MB Base64、fps 范围 [0.1, 10] 和 default/max 分辨率档次。

  3. 音频理解(官方):页面说明音频可用 URL 或 Base64 传入,并明确使用 input_audio.data;同时列出 100 MB URL、50 MB Base64、支持格式及约 6.25 tokens/秒 的估算。

  4. 三个页面的常见问题均明确列出 mimo-v2.6-pro 暂不支持本地文件上传;因此本文只提供 URL 和 Base64 工作流。

来源与日期

小米 Xiaomi MiMo 官方文档 · 原文日期: 2026-09-22 · 编辑日期: 2026-09-22

阅读原始来源
变量检查

仍需替换: 5

{{TASK}}{{MODEL_ID}}{{INPUT_FORMAT}}{{TOOL_STEPS}}{{ACCEPTANCE}}

相关提示词

小米 MiMo-V2.6-Pro 官方 API 接入与推理配置Hugging Face 官方 MiMo-V2.6-Pro-RL 本地部署与聊天模板配置小米 MiMo-V2.6-Pro 官方函数调用与多轮 Agent 工作流

相关测评

小米 MiMo 官方发布:MiMo-V2.6-Pro 基准信号与原生全模态定位Artificial Analysis:MiMo-V2.6-Pro 的智能指数、速度、价格与延迟MiMo-V2.6-Pro 官方技术报告:架构、规模化 RL 与评测条件MiMo-V2.6-Pro 官方 X 发布线程:任务定位、公开基准与开源入口

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Pro 测评:最聪明的开源模型,却让你等 18 秒

MiMo-V2.6-Pro 公开证据测评:真实任务成败实录、18 秒等待与思考账单、社区原声两极分化,以及按工作负载给出的选型裁决。

定价 · 简体中文

MiMo-V2.6-Pro 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Pro 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、思考 Token 增量、UltraSpeed 极速模式及实际任务预算测算。

替代品 · 简体中文

MiMo-V2.6-Pro 替代品:按任务和预算选模型

用完成任务的真实成本、agent 可靠性、开源权重和部署条件,横向评估五个 MiMo-V2.6-Pro 替代方案,价格核对时间为 2026 年 9 月 22 日。

模型对比 · 简体中文

MiMo-V2.6-Pro 对比 MiMo-V2.6-Flash:小米 MoE 模型选型深度评测

深度实测小米 MiMo-V2.6-Pro 与 Flash:1.02T 对比 309B MoE 架构、3.1 倍 API 费率差异、前缀缓存经济学、长程 Agent 基准与场景选型决策矩阵。

MiMo-V2.6-Pro

在 Tabbit 中使用 MiMo-V2.6-Pro

请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。