MiMo-V2.6-Flash · workflow
mimo-v2.6-flash 可通过 OpenAI 兼容的 Batch API 异步处理大规模请求:准备 JSONL 文件、上传文件、创建批任务、查询状态、下载成功或错误结果;官方文档称批量推理价格为实时 API 的 50%。
mimo-v2.6-flash 可通过 OpenAI 兼容的 Batch API 异步处理大规模请求:准备 JSONL 文件、上传文件、创建批任务、查询状态、下载成功或错误结果;官方文档称批量推理价格为实时 API 的 50%。
适合的任务:模型评测、回归测试、数据标注、内容审核、批量摘要、翻译、结构化抽取和学术研究等不要求实时响应的任务。
不适合的任务:实时问答、需要流式输出的任务,以及希望在原任务内自动重试或续跑的任务;官方说明 Batch API 不支持流式输出,也不支持任务内重试或恢复。
适用的模型版本:mimo-v2.6-flash;批量调用时模型名必须使用小写。页面还列出 mimo-v2.6-pro,但本文不把 Pro 的示例、结果或性能归因于 Flash,也未发现页面提及 MiMo-V2.6-Flash-RL。
适用的客户端、Agent 或 API:Xiaomi MiMo Batch API;API 兼容 OpenAI 协议,可使用 Curl 或 OpenAI Python SDK。控制台上传目前只支持 OpenAI Chat Completions 文件格式,API 还支持 Responses 和 Anthropic Messages 格式。
推荐的推理档位和参数:原文未提供 Flash 专属推理档位。API 示例使用 endpoint="/v1/chat/completions"、completion_window="24h";控制台创建任务时可设置 1–14 天的最大等待时间。
下面是官方 JSONL 文件格式中使用 mimo-v2.6-flash 的最小示例。每行是一个独立请求;custom_id 必须在同一文件内唯一,实际任务只需替换 content。
{"custom_id":"request-1","method":"POST","url":"/v1/chat/completions","body":{"model":"mimo-v2.6-flash","messages":[{"role":"user","content":"Hello"}]}}API 工作流的最小配置骨架:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://batch-api-${region}.xiaomimimo.com/v1",
)
file = client.files.create(
file=open("input.jsonl", "rb"),
purpose="batch",
)
batch = client.batches.create(
input_file_id=file.id,
endpoint="/v1/chat/completions",
completion_window="24h",
)
batch = client.batches.retrieve(batch.id)
if batch.output_file_id:
result = client.files.content(batch.output_file_id)
with open("output.jsonl", "wb") as f:
f.write(result.content)flowchart LR
A[账户与实名验证] --> B[准备 JSONL]
B --> C[上传文件]
C --> D[创建 Batch 任务]
D --> E[查询状态与进度]
E -->|completed| F[下载成功文件]
E -->|有失败请求| G[下载错误文件并重提失败项]完成前置条件:注册 MiMo Open Platform 账户,完成实名验证,充值余额,创建 API Key,并从 Batch Inference 页面取得 Base URL。Batch API 从账户现金余额按实际 token 用量扣费,不使用 Token Plan 配额。
准备输入文件:使用 JSONL,每行一个 JSON 请求;单文件默认最大 128 MB,单文件只能包含同一个 batch endpoint 的请求。每条请求必须有文件内唯一的字符串 custom_id;body 必须是底层模型调用 API 的合法 JSON 对象。
上传文件:向 https://batch-api-${region}.xiaomimimo.com/v1/files 发送 purpose=batch 和本地文件。文件默认保留 30 天。
创建任务:向 /v1/batches 提交 input_file_id、endpoint 和 completion_window="24h"。控制台流程还需要填写任务描述;任务提交后由系统按离峰资源自动调度,不保证立即开始。
查询与管理:通过 /v1/batches/{batch_id} 查询状态和 request_counts。文档列出的状态包括 validating、in_progress、completed、failed、cancelling 和 cancelled;In Progress 任务可取消,取消是异步操作。
下载结果:任务完成后下载 output_file_id 对应的成功文件;若存在失败请求,再下载 error_file_id 对应的错误文件。两个文件都包含 custom_id,用于和输入请求对齐。
失败处理:Batch API 不支持任务内 retry/resume。检查错误文件后,建立新 JSONL 文件,仅重新提交失败请求;部分成功请求仍会正常计费。
及时备份:输入文件和结果文件默认只保留 30 天,过期后自动删除且不可恢复。
官方支持:页面明确列出 mimo-v2.6-flash,并要求批量调用中的模型名使用小写;页面另列 mimo-v2.6-pro,不构成 Flash 的测评结果。
协议与接口:Batch API 与 OpenAI Batch 协议兼容;API 文件格式支持 /v1/chat/completions、/v1/responses 和 /anthropic/v1/messages,控制台上传目前只支持 Completions 格式。
价格主张:官方称 Batch Inference 价格为实时 API 的 50%。页面列出的 Flash 价格为:
中国大陆:输入(cache hit)¥0.01、输入(cache miss)¥0.50、输出 ¥1.00,单位为每百万 tokens。
海外:输入(cache hit)$0.0014、输入(cache miss)$0.07、输出 $0.14,单位为每百万 tokens。
文件约束:默认最大文件大小 128 MB;每个 custom_id 必须在文件内唯一;每个文件只能对应一个 batch endpoint。
结果关联:成功文件逐行返回请求结果,错误文件逐行返回失败原因;两者均原样保留输入的 custom_id。
生命周期:文件及结果默认保留 30 天;API 创建任务的示例 completion_window 为 24h,控制台说明的最大等待时间范围为 1–14 天。
计费边界:只有成功完成的请求计费;文件解析或执行失败的请求不计费;取消前已经完成的请求正常计费。余额在任务运行中不足时,已完成部分生成成功文件并计费,未执行部分生成失败文件且不计费。
页面时间:正文显示 Update Time September 21, 2026。
这是官方工作流和价格说明,不是 Flash 的独立准确率、延迟或吞吐测评;来源未提供 Flash 专属样本量、测试 harness、参数对比或实测结果。
“实时 API 价格的 50%”是厂商定价说明;实际费用仍取决于输入缓存命中、输入 token 和输出 token 用量。
批量任务是离线异步处理,不能把普通 API 的实时响应或流式协议直接套入 Batch API。
completion_window="24h" 是 API 文档示例和字段说明中的值;控制台的 1–14 天设置是另一种界面参数,不能据此推断 API 可任意设置同样范围。
不应把页面中的 mimo-v2.6-pro 请求示例、价格之外的能力或结果外推到 Flash;页面也没有提供 MiMo-V2.6-Flash-RL 的 Batch API 证据。
打开原文并确认页面的 Batch API 支持列表包含 mimo-v2.6-flash,记录页面更新时间。
准备仅含 mimo-v2.6-flash 请求的 JSONL 文件,确保 custom_id 唯一、文件不超过 128 MB,并在同一文件中只使用一个 endpoint。
使用有效的 MiMo API Key 调用文件上传、Batch 创建、状态查询和结果下载接口;本文未执行真实 API 提交,不声称已有 Flash 运行结果。
下载成功文件和错误文件后,用 custom_id 对齐输入与输出,单独统计成功、失败和计费请求;在 30 天保留期内完成备份。
Xiaomi MiMo 官方文档 · 原文日期: 2026-09-21 · 编辑日期: 2026-09-22
阅读原始来源MiMo-V2.6-Flash
请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。