MiMo-V2.6-Flash · workflow
mimo-v2.6-flash 支持音频理解;将音频作为 input_audio 放入用户消息,再附加文字任务指令。音频可用公开 URL 或带 MIME 前缀的 Base64,不能直接上传本地文件。
mimo-v2.6-flash 支持音频理解;将音频作为 input_audio 放入用户消息,再附加文字任务指令。音频可用公开 URL 或带 MIME 前缀的 Base64,不能直接上传本地文件。
适合的任务:音频内容描述、语音内容分析,以及需要同时读取音频和文字指令的多模态问答。
不适合的任务:直接上传本地音频;未经测试就假定所有音频格式变体都能识别;超过输入大小或上下文限制的音频任务。
适用的模型版本:mimo-v2.6-flash。原文同时列出 mimo-v2.6-pro、mimo-v2.6-pro-ultraspeed 和 mimo-v2.5,本文不把这些型号的示例响应归因于 Flash。
适用的客户端、Agent 或 API:MiMo API 的 OpenAI 兼容 Chat Completions;官方示例使用 OpenAI Python SDK 和 Curl,API 地址为 https://api.xiaomimimo.com/v1。
推荐的推理档位和参数:文档未提供 Flash 专属推理档位或固定参数建议。max_completion_tokens=1024 只出现在官方 Pro 示例中,使用 Flash 时应按任务输出长度调整。
下面是按官方请求结构整理的 Flash 配置骨架。官方页面的代码将 model 写为 mimo-v2.6-pro;这里只依据同页的 Supported models 列表将模型 ID 改为 mimo-v2.6-flash,不表示官方提供了 Flash 专属响应。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ.get("MIMO_API_KEY"),
base_url="https://api.xiaomimimo.com/v1",
)
completion = client.chat.completions.create(
model="mimo-v2.6-flash",
messages=[
{
"role": "user",
"content": [
{
"type": "input_audio",
"input_audio": {
"data": "https://example.com/audio/example.wav"
},
},
{
"type": "text",
"text": "请描述这段音频的内容",
},
],
}
],
max_completion_tokens=1024,
)
print(completion.model_dump_json())如果音频不能通过公网访问,将 data 替换为带实际 MIME 类型的 Data URI:
"data": "data:{MIME_TYPE};base64,$BASE64_AUDIO"其中 {MIME_TYPE} 要替换为音频的真实 MIME 类型,$BASE64_AUDIO 只能放纯 Base64 字符串,不要重复添加前缀。官方页面示例中的 please describe the content of the audio 是可替换的文字任务指令,不是 Flash 专属提示词。
准备 MiMo API Key,设置 MIMO_API_KEY,并使用 https://api.xiaomimimo.com/v1。
将请求模型设为 mimo-v2.6-flash。
选择一种输入方式:
公开 URL:提供可公开访问的音频地址,单个文件不超过 100 MB。
Base64:先编码音频,再使用 data:{MIME_TYPE};base64,$BASE64_AUDIO,单个音频的 Base64 字符串不超过 50 MB。
在同一个用户消息的 content 数组中放入 input_audio 和文字任务指令。
发送 Chat Completions 请求,读取返回的 message.content;生产环境同时记录 API 返回的实际用量。
先用实际文件验证可识别性,再扩大格式、时长和多音频输入范围。
页面概述称,音频理解模型可根据提供的音频回答,支持音频 URL 和 Base64 两种输入方式。
Supported models 明确列出 mimo-v2.6-flash,同时列出 mimo-v2.6-pro、mimo-v2.6-pro-ultraspeed 和 mimo-v2.5。
官方代码使用 content 数组传入 type: "input_audio",并在其后放入 type: "text" 的音频任务指令。
支持的音频格式为 MP3、WAV、FLAC、M4A、OGG;页面说明格式变体较多,不能保证全部识别,应通过测试确认。
URL 输入要求公开可访问地址,单个文件不超过 100 MB;Base64 输入的单个音频字符串不超过 50 MB。
多个音频的数量受模型上下文长度限制,所有音频和文字的 token 总数必须低于模型上下文长度。
页面给出的音频 token 估算式为:总 token 数 ≈ 音频时长(秒) × 6.25;这是估算值,实际用量以 API 响应为准。
费用按输入 token、缓存命中输入 token 和输出 token 计算;账单和用量可在 Console 的 Billing 页面查看。
FAQ 明确说明 mimo-v2.6-flash、Pro、Pro UltraSpeed 和 mimo-v2.5 当前都不支持上传本地音频文件。
页面中的 Quick Start、URL、Base64 Python/Curl 示例及响应均使用 mimo-v2.6-pro;响应里的内容、reasoning_content、token 用量和 model 字段都不是 Flash 实测结果。
官方“支持 mimo-v2.6-flash”只证明型号在支持列表中,不等于页面提供了 Flash 专属的准确率、延迟、响应或 token 基线。
URL 必须能被服务端访问;内网地址、本地路径或未公开的对象存储地址不能按该流程直接使用。
Base64 的 50 MB 限制针对编码后的字符串,不是原始音频文件大小;编码后还应确认总上下文长度足够。
“支持格式”不保证所有编码参数、容器变体或损坏文件都能识别,应用应处理识别失败并保留可诊断的错误信息。
音频 token 估算不能替代 API 实际计量,也不能据此外推 Flash 与 Pro、Pro UltraSpeed 或旧版模型的价格、速度或效果差异。
打开原文,确认页面的 Supported models 包含 mimo-v2.6-flash,并确认页面更新时间为 2026-09-22。
准备可公开访问的测试音频,或生成带真实 MIME 类型的 Base64 Data URI。
按上述请求结构调用 mimo-v2.6-flash,改变文字任务指令并记录返回内容、错误和 API 用量。
分别测试 URL、Base64、支持格式和多音频输入;将公开文档中的 Pro 示例与 Flash 的实际返回严格分开记录。
本文只整理官方工作流,未声称已完成 Flash API 独立测量。
Xiaomi MiMo 官方文档 · 原文日期: 2026-09-22 · 编辑日期: 2026-09-22
阅读原始来源MiMo-V2.6-Flash
请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。