Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
提示词与工作流

MiMo-V2.6-Flash · configuration

MiMo-V2.6-Flash 深度思考配置与多轮工具调用工作流

mimo-v2.6-flash 支持用 thinking.type 开关深度思考,默认开启;启用后不要自定义 temperature 或 top_p,并在多轮工具调用中完整回传历史 assistant 消息的 reasoning_content。

来源已核对;未实测MiMo API 的 OpenAI Chat Completions 兼容接口;Python SDK 中 thinking 不是标准 OpenAI 参数,需放进 extra_body。

前置条件与输入

  • 模型 ID
  • 推理或调用参数
  • API 端点
  • 任务说明
  • 验收标准

完整可复制模板

编辑改写:任务模板

Tabbit 编辑改写;非来源原文
调用 MiMo-V2.6-Flash 时固定 {{MODEL_ID}}、{{REASONING_EFFORT}} 和 {{API_BASE}}。任务是 {{TASK}},只使用 {{TOOL_ALLOWLIST}},并用 {{ACCEPTANCE}} 验收。

运行前替换每个变量,并把实际取值写进验收记录。

运行前仍需替换: {{MODEL_ID}}, {{REASONING_EFFORT}}, {{API_BASE}}, {{TASK}}, {{TOOL_ALLOWLIST}}, {{ACCEPTANCE}}

调用 MiMo-V2.6-Flash 时固定 {{MODEL_ID}}、{{REASONING_EFFORT}} 和 {{API_BASE}}。任务是 {{TASK}},只使用 {{TOOL_ALLOWLIST}},并用 {{ACCEPTANCE}} 验收。

查看来源研究笔记

一句话结论

mimo-v2.6-flash 支持用 thinking.type 开关深度思考,默认开启;启用后不要自定义 temperature 或 top_p,并在多轮工具调用中完整回传历史 assistant 消息的 reasoning_content。

适用场景

  • 适合的任务:复杂推理、代码生成、数学计算和多步分析。

  • 不适合的任务:对响应延迟或输出预算特别敏感、且不需要深度分析的简单问答;官方说明启用深度思考会增加延迟。

  • 适用的模型版本:mimo-v2.6-flash。原文同列 mimo-v2.6-pro、mimo-v2.6-pro-ultraspeed、mimo-v2.5-pro 和 mimo-v2.5;本文不把这些版本的示例响应当作 Flash 数据。

  • 适用的客户端、Agent 或 API:MiMo API 的 OpenAI Chat Completions 兼容接口;Python SDK 中 thinking 不是标准 OpenAI 参数,需放进 extra_body。

  • 推荐的推理档位和参数:文档未提供 Flash 专属推理档位。thinking.type 使用 enabled 或 disabled;深度思考模式下有效 temperature=1.0、top_p=0.95,不支持自定义。

可直接使用的内容

下面是按官方支持列表将示例模型 ID 替换为 mimo-v2.6-flash 的配置骨架。原文的 Python、响应和流式示例均写的是 mimo-v2.6-pro,所以这段代码表达的是 Flash 的官方支持范围与通用参数规则,不是官方提供的 Flash 实测响应。

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["MIMO_API_KEY"],
    base_url="https://api.xiaomimimo.com/v1",
)

completion = client.chat.completions.create(
    model="mimo-v2.6-flash",
    messages=[
        {"role": "user", "content": "请拆解这个多步骤问题,并给出可验证的结论。"}
    ],
    max_completion_tokens=2048,
    stream=True,
    extra_body={"thinking": {"type": "enabled"}},
)

for chunk in completion:
    print(chunk.model_dump_json())

关闭深度思考时,只需改为:

extra_body={"thinking": {"type": "disabled"}}

测试或工作流步骤

  1. 使用 https://api.xiaomimimo.com/v1 和 mimo-v2.6-flash 创建 Chat Completions 请求。

  2. 在 Python SDK 中把 thinking 放入 extra_body,设置 thinking.type 为 enabled 或 disabled;Flash 默认是 enabled。

  3. 深度思考模式下不要依赖自定义 temperature、top_p;即使传入,实际有效值也会被强制为 1.0 和 0.95。

  4. 根据总输出预算设置 max_completion_tokens。它同时消耗思考内容和最终答案的 token;思考较长时,答案可能被截断。

  5. 需要实时观察过程时设置 stream: true。官方说明流式响应先通过 reasoning_content 逐步返回思考内容,再通过 content 返回最终答案。

  6. 在 Agent 多轮工具调用中,将历史 assistant 消息中的 reasoning_content 完整放回后续请求;缺失时 API 会返回 400。

  7. 回归检查至少覆盖:开启与关闭两种配置、流式字段顺序、足够的输出预算,以及带工具调用历史的下一轮请求。

原始证据与数据

  • 官方“Supported Models”明确列出 mimo-v2.6-flash,并同时列出 Pro、Pro UltraSpeed、V2.5 Pro 和 V2.5;该列表没有给出 Flash 单独的效果、延迟或 token 测试数据。

  • 官方“Request Parameters”规定使用 thinking.type,值为 enabled 或 disabled;页面列出的默认开启模型包含 mimo-v2.6-flash。

  • 官方“Parameter Limitations”规定深度思考下上述支持模型不支持自定义 temperature 与 top_p,有效值强制为 1.0 与 0.95。

  • 官方“Multi-turn Conversation Pass-through Requirements”规定:Agent 多轮历史含工具调用时,后续包含工具调用的请求必须完整回传 reasoning_content,否则返回 400;缺失该字段还可能导致上下文不完整、指令遵循下降和幻觉增加。

  • 官方“Other Notes”说明 max_completion_tokens 同时限制思考内容和最终答案,并建议思考较长时提供足够预算;启用深度思考会增加延迟,建议用 stream: true。

  • 页面列出的受影响 Agent 产品包括:OpenAI 兼容协议下的 TRAE、Cursor、Roo Code、Codex、GitHub Copilot CLI、Zed、AutoGen、Goose;Anthropic 兼容协议下的 TRAE、GitHub Copilot CLI、AutoGen、Goose、OpenClaw、OpenCode、Kilo Code。

  • 页面里的完整 Python、Curl、响应和多轮工具调用示例均将 model 写为 mimo-v2.6-pro;这些 Pro 示例不作为 mimo-v2.6-flash 的实测结果。

适用边界

  • “支持列表包含 Flash”只证明文档声明支持,不等于本文已完成 Flash API 请求、准确率、延迟或 token 的独立测量。

  • reasoning_content 是接口字段;是否向最终用户展示原始思考内容,应由产品按隐私、安全和交互需求另行决定。

  • max_completion_tokens 太小会让长思考挤占最终答案空间;应按任务复杂度和答案长度做预算,而不是照搬示例的 1024。

  • Pro、Pro UltraSpeed、V2.5 Pro 和 V2.5 只用于说明文档的共用支持范围;不能据此推断 Flash 与它们的质量、速度或成本相同。

复现说明

采集时使用 Tabbit 完整打开并读取官方页面,页面更新时间为 2026-09-22。复现需准备 MiMo API Key,并按上面的 Flash 配置分别发起 enabled、disabled 和 stream=True 请求;若测试多轮工具调用,还需把每轮 assistant 消息(含完整 reasoning_content)追加回 messages。本文未声称这些请求已在本地执行,也未把官方 Pro 示例当作 Flash 测试数据。

来源与日期

Xiaomi MiMo 官方文档 · 原文日期: 2026-09-22 · 编辑日期: 2026-09-22

阅读原始来源
变量检查

仍需替换: 6

{{MODEL_ID}}{{REASONING_EFFORT}}{{API_BASE}}{{TASK}}{{TOOL_ALLOWLIST}}{{ACCEPTANCE}}

相关提示词

MiMo-V2.6-Flash Web Search 工具调用工作流MiMo-V2.6-Flash 结构化输出:JSON 模式配置与校验工作流MiMo-V2.6-Flash Batch API 批量推理工作流MiMo-V2.6-Flash 音频理解工作流:URL 与 Base64 输入配置

相关测评

MiMo-V2.6-Flash 官方基准:30 步强化学习与 Agent 结果MiMo-V2.6-Flash-RL Hugging Face 官方基准与部署边界BenchLM:MiMo-V2.6-Flash 与 Pro 的同系列成本和公开基准对比MiMo-V2.6-Flash 官方 X 发布线程:Flash 的基准定位与双模型策略

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Flash 深度测评:高吞吐自动化主力,长程规划的有条件升级

基于公开实证与技术基准对小米 MiMo-V2.6-Flash 的深度测评:解析 15B 激活 MoE 吞吐、基准局限、长程纠错悬崖、计费机制与工作负载选型。

定价 · 简体中文

MiMo-V2.6-Flash 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Flash 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、MoE 高吞吐架构与大规模任务预算测算。

模型对比 · 简体中文

MiMo-V2.6-Pro 对比 MiMo-V2.6-Flash:小米 MoE 模型选型深度评测

深度实测小米 MiMo-V2.6-Pro 与 Flash:1.02T 对比 309B MoE 架构、3.1 倍 API 费率差异、前缀缓存经济学、长程 Agent 基准与场景选型决策矩阵。

MiMo-V2.6-Flash

在 Tabbit 中使用 MiMo-V2.6-Flash

请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。