MiMo-V2.6-Flash · configuration
mimo-v2.6-flash 支持用 thinking.type 开关深度思考,默认开启;启用后不要自定义 temperature 或 top_p,并在多轮工具调用中完整回传历史 assistant 消息的 reasoning_content。
调用 MiMo-V2.6-Flash 时固定 {{MODEL_ID}}、{{REASONING_EFFORT}} 和 {{API_BASE}}。任务是 {{TASK}},只使用 {{TOOL_ALLOWLIST}},并用 {{ACCEPTANCE}} 验收。
运行前替换每个变量,并把实际取值写进验收记录。运行前仍需替换: {{MODEL_ID}}, {{REASONING_EFFORT}}, {{API_BASE}}, {{TASK}}, {{TOOL_ALLOWLIST}}, {{ACCEPTANCE}}
调用 MiMo-V2.6-Flash 时固定 {{MODEL_ID}}、{{REASONING_EFFORT}} 和 {{API_BASE}}。任务是 {{TASK}},只使用 {{TOOL_ALLOWLIST}},并用 {{ACCEPTANCE}} 验收。
mimo-v2.6-flash 支持用 thinking.type 开关深度思考,默认开启;启用后不要自定义 temperature 或 top_p,并在多轮工具调用中完整回传历史 assistant 消息的 reasoning_content。
适合的任务:复杂推理、代码生成、数学计算和多步分析。
不适合的任务:对响应延迟或输出预算特别敏感、且不需要深度分析的简单问答;官方说明启用深度思考会增加延迟。
适用的模型版本:mimo-v2.6-flash。原文同列 mimo-v2.6-pro、mimo-v2.6-pro-ultraspeed、mimo-v2.5-pro 和 mimo-v2.5;本文不把这些版本的示例响应当作 Flash 数据。
适用的客户端、Agent 或 API:MiMo API 的 OpenAI Chat Completions 兼容接口;Python SDK 中 thinking 不是标准 OpenAI 参数,需放进 extra_body。
推荐的推理档位和参数:文档未提供 Flash 专属推理档位。thinking.type 使用 enabled 或 disabled;深度思考模式下有效 temperature=1.0、top_p=0.95,不支持自定义。
下面是按官方支持列表将示例模型 ID 替换为 mimo-v2.6-flash 的配置骨架。原文的 Python、响应和流式示例均写的是 mimo-v2.6-pro,所以这段代码表达的是 Flash 的官方支持范围与通用参数规则,不是官方提供的 Flash 实测响应。
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MIMO_API_KEY"],
base_url="https://api.xiaomimimo.com/v1",
)
completion = client.chat.completions.create(
model="mimo-v2.6-flash",
messages=[
{"role": "user", "content": "请拆解这个多步骤问题,并给出可验证的结论。"}
],
max_completion_tokens=2048,
stream=True,
extra_body={"thinking": {"type": "enabled"}},
)
for chunk in completion:
print(chunk.model_dump_json())关闭深度思考时,只需改为:
extra_body={"thinking": {"type": "disabled"}}使用 https://api.xiaomimimo.com/v1 和 mimo-v2.6-flash 创建 Chat Completions 请求。
在 Python SDK 中把 thinking 放入 extra_body,设置 thinking.type 为 enabled 或 disabled;Flash 默认是 enabled。
深度思考模式下不要依赖自定义 temperature、top_p;即使传入,实际有效值也会被强制为 1.0 和 0.95。
根据总输出预算设置 max_completion_tokens。它同时消耗思考内容和最终答案的 token;思考较长时,答案可能被截断。
需要实时观察过程时设置 stream: true。官方说明流式响应先通过 reasoning_content 逐步返回思考内容,再通过 content 返回最终答案。
在 Agent 多轮工具调用中,将历史 assistant 消息中的 reasoning_content 完整放回后续请求;缺失时 API 会返回 400。
回归检查至少覆盖:开启与关闭两种配置、流式字段顺序、足够的输出预算,以及带工具调用历史的下一轮请求。
官方“Supported Models”明确列出 mimo-v2.6-flash,并同时列出 Pro、Pro UltraSpeed、V2.5 Pro 和 V2.5;该列表没有给出 Flash 单独的效果、延迟或 token 测试数据。
官方“Request Parameters”规定使用 thinking.type,值为 enabled 或 disabled;页面列出的默认开启模型包含 mimo-v2.6-flash。
官方“Parameter Limitations”规定深度思考下上述支持模型不支持自定义 temperature 与 top_p,有效值强制为 1.0 与 0.95。
官方“Multi-turn Conversation Pass-through Requirements”规定:Agent 多轮历史含工具调用时,后续包含工具调用的请求必须完整回传 reasoning_content,否则返回 400;缺失该字段还可能导致上下文不完整、指令遵循下降和幻觉增加。
官方“Other Notes”说明 max_completion_tokens 同时限制思考内容和最终答案,并建议思考较长时提供足够预算;启用深度思考会增加延迟,建议用 stream: true。
页面列出的受影响 Agent 产品包括:OpenAI 兼容协议下的 TRAE、Cursor、Roo Code、Codex、GitHub Copilot CLI、Zed、AutoGen、Goose;Anthropic 兼容协议下的 TRAE、GitHub Copilot CLI、AutoGen、Goose、OpenClaw、OpenCode、Kilo Code。
页面里的完整 Python、Curl、响应和多轮工具调用示例均将 model 写为 mimo-v2.6-pro;这些 Pro 示例不作为 mimo-v2.6-flash 的实测结果。
“支持列表包含 Flash”只证明文档声明支持,不等于本文已完成 Flash API 请求、准确率、延迟或 token 的独立测量。
reasoning_content 是接口字段;是否向最终用户展示原始思考内容,应由产品按隐私、安全和交互需求另行决定。
max_completion_tokens 太小会让长思考挤占最终答案空间;应按任务复杂度和答案长度做预算,而不是照搬示例的 1024。
Pro、Pro UltraSpeed、V2.5 Pro 和 V2.5 只用于说明文档的共用支持范围;不能据此推断 Flash 与它们的质量、速度或成本相同。
采集时使用 Tabbit 完整打开并读取官方页面,页面更新时间为 2026-09-22。复现需准备 MiMo API Key,并按上面的 Flash 配置分别发起 enabled、disabled 和 stream=True 请求;若测试多轮工具调用,还需把每轮 assistant 消息(含完整 reasoning_content)追加回 messages。本文未声称这些请求已在本地执行,也未把官方 Pro 示例当作 Flash 测试数据。
Xiaomi MiMo 官方文档 · 原文日期: 2026-09-22 · 编辑日期: 2026-09-22
阅读原始来源MiMo-V2.6-Flash
请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。