Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
提示词与工作流

MiMo-V2.6-Flash · workflow

MiMo-V2.6-Flash 音频理解工作流:URL 与 Base64 输入配置

mimo-v2.6-flash 支持音频理解;将音频作为 input_audio 放入用户消息,再附加文字任务指令。音频可用公开 URL 或带 MIME 前缀的 Base64,不能直接上传本地文件。

来源已核对;未实测MiMo API 的 OpenAI 兼容 Chat Completions;官方示例使用 OpenAI Python SDK 和 Curl,API 地址为 https://api.xiaomimimo.com/v1。

前置条件与输入

  • 任务目标
  • 输入材料
  • 工具或步骤约束
  • 验收标准

一句话结论

mimo-v2.6-flash 支持音频理解;将音频作为 input_audio 放入用户消息,再附加文字任务指令。音频可用公开 URL 或带 MIME 前缀的 Base64,不能直接上传本地文件。

适用场景

  • 适合的任务:音频内容描述、语音内容分析,以及需要同时读取音频和文字指令的多模态问答。

  • 不适合的任务:直接上传本地音频;未经测试就假定所有音频格式变体都能识别;超过输入大小或上下文限制的音频任务。

  • 适用的模型版本:mimo-v2.6-flash。原文同时列出 mimo-v2.6-pro、mimo-v2.6-pro-ultraspeed 和 mimo-v2.5,本文不把这些型号的示例响应归因于 Flash。

  • 适用的客户端、Agent 或 API:MiMo API 的 OpenAI 兼容 Chat Completions;官方示例使用 OpenAI Python SDK 和 Curl,API 地址为 https://api.xiaomimimo.com/v1。

  • 推荐的推理档位和参数:文档未提供 Flash 专属推理档位或固定参数建议。max_completion_tokens=1024 只出现在官方 Pro 示例中,使用 Flash 时应按任务输出长度调整。

可直接使用的内容

下面是按官方请求结构整理的 Flash 配置骨架。官方页面的代码将 model 写为 mimo-v2.6-pro;这里只依据同页的 Supported models 列表将模型 ID 改为 mimo-v2.6-flash,不表示官方提供了 Flash 专属响应。

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ.get("MIMO_API_KEY"),
    base_url="https://api.xiaomimimo.com/v1",
)

completion = client.chat.completions.create(
    model="mimo-v2.6-flash",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "input_audio",
                    "input_audio": {
                        "data": "https://example.com/audio/example.wav"
                    },
                },
                {
                    "type": "text",
                    "text": "请描述这段音频的内容",
                },
            ],
        }
    ],
    max_completion_tokens=1024,
)

print(completion.model_dump_json())

如果音频不能通过公网访问,将 data 替换为带实际 MIME 类型的 Data URI:

"data": "data:{MIME_TYPE};base64,$BASE64_AUDIO"

其中 {MIME_TYPE} 要替换为音频的真实 MIME 类型,$BASE64_AUDIO 只能放纯 Base64 字符串,不要重复添加前缀。官方页面示例中的 please describe the content of the audio 是可替换的文字任务指令,不是 Flash 专属提示词。

测试或工作流步骤

  1. 准备 MiMo API Key,设置 MIMO_API_KEY,并使用 https://api.xiaomimimo.com/v1。

  2. 将请求模型设为 mimo-v2.6-flash。

  3. 选择一种输入方式:

    • 公开 URL:提供可公开访问的音频地址,单个文件不超过 100 MB。

    • Base64:先编码音频,再使用 data:{MIME_TYPE};base64,$BASE64_AUDIO,单个音频的 Base64 字符串不超过 50 MB。

  4. 在同一个用户消息的 content 数组中放入 input_audio 和文字任务指令。

  5. 发送 Chat Completions 请求,读取返回的 message.content;生产环境同时记录 API 返回的实际用量。

  6. 先用实际文件验证可识别性,再扩大格式、时长和多音频输入范围。

原始证据与数据

  • 页面概述称,音频理解模型可根据提供的音频回答,支持音频 URL 和 Base64 两种输入方式。

  • Supported models 明确列出 mimo-v2.6-flash,同时列出 mimo-v2.6-pro、mimo-v2.6-pro-ultraspeed 和 mimo-v2.5。

  • 官方代码使用 content 数组传入 type: "input_audio",并在其后放入 type: "text" 的音频任务指令。

  • 支持的音频格式为 MP3、WAV、FLAC、M4A、OGG;页面说明格式变体较多,不能保证全部识别,应通过测试确认。

  • URL 输入要求公开可访问地址,单个文件不超过 100 MB;Base64 输入的单个音频字符串不超过 50 MB。

  • 多个音频的数量受模型上下文长度限制,所有音频和文字的 token 总数必须低于模型上下文长度。

  • 页面给出的音频 token 估算式为:总 token 数 ≈ 音频时长(秒) × 6.25;这是估算值,实际用量以 API 响应为准。

  • 费用按输入 token、缓存命中输入 token 和输出 token 计算;账单和用量可在 Console 的 Billing 页面查看。

  • FAQ 明确说明 mimo-v2.6-flash、Pro、Pro UltraSpeed 和 mimo-v2.5 当前都不支持上传本地音频文件。

  • 页面中的 Quick Start、URL、Base64 Python/Curl 示例及响应均使用 mimo-v2.6-pro;响应里的内容、reasoning_content、token 用量和 model 字段都不是 Flash 实测结果。

适用边界

  • 官方“支持 mimo-v2.6-flash”只证明型号在支持列表中,不等于页面提供了 Flash 专属的准确率、延迟、响应或 token 基线。

  • URL 必须能被服务端访问;内网地址、本地路径或未公开的对象存储地址不能按该流程直接使用。

  • Base64 的 50 MB 限制针对编码后的字符串,不是原始音频文件大小;编码后还应确认总上下文长度足够。

  • “支持格式”不保证所有编码参数、容器变体或损坏文件都能识别,应用应处理识别失败并保留可诊断的错误信息。

  • 音频 token 估算不能替代 API 实际计量,也不能据此外推 Flash 与 Pro、Pro UltraSpeed 或旧版模型的价格、速度或效果差异。

复现说明

  1. 打开原文,确认页面的 Supported models 包含 mimo-v2.6-flash,并确认页面更新时间为 2026-09-22。

  2. 准备可公开访问的测试音频,或生成带真实 MIME 类型的 Base64 Data URI。

  3. 按上述请求结构调用 mimo-v2.6-flash,改变文字任务指令并记录返回内容、错误和 API 用量。

  4. 分别测试 URL、Base64、支持格式和多音频输入;将公开文档中的 Pro 示例与 Flash 的实际返回严格分开记录。

  5. 本文只整理官方工作流,未声称已完成 Flash API 独立测量。

来源与日期

Xiaomi MiMo 官方文档 · 原文日期: 2026-09-22 · 编辑日期: 2026-09-22

阅读原始来源
变量检查

无必填变量

相关提示词

MiMo-V2.6-Flash Web Search 工具调用工作流MiMo-V2.6-Flash 深度思考配置与多轮工具调用工作流MiMo-V2.6-Flash 结构化输出:JSON 模式配置与校验工作流MiMo-V2.6-Flash Batch API 批量推理工作流

相关测评

MiMo-V2.6-Flash 官方基准:30 步强化学习与 Agent 结果MiMo-V2.6-Flash-RL Hugging Face 官方基准与部署边界BenchLM:MiMo-V2.6-Flash 与 Pro 的同系列成本和公开基准对比MiMo-V2.6-Flash 官方 X 发布线程:Flash 的基准定位与双模型策略

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Flash 深度测评:高吞吐自动化主力,长程规划的有条件升级

基于公开实证与技术基准对小米 MiMo-V2.6-Flash 的深度测评:解析 15B 激活 MoE 吞吐、基准局限、长程纠错悬崖、计费机制与工作负载选型。

定价 · 简体中文

MiMo-V2.6-Flash 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Flash 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、MoE 高吞吐架构与大规模任务预算测算。

模型对比 · 简体中文

MiMo-V2.6-Pro 对比 MiMo-V2.6-Flash:小米 MoE 模型选型深度评测

深度实测小米 MiMo-V2.6-Pro 与 Flash:1.02T 对比 309B MoE 架构、3.1 倍 API 费率差异、前缀缓存经济学、长程 Agent 基准与场景选型决策矩阵。

MiMo-V2.6-Flash

在 Tabbit 中使用 MiMo-V2.6-Flash

请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。