Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

MiMo-V2.6-Flash · 媒体来源 · 厂商自报

MiMo-V2.6-Flash-RL Hugging Face 官方基准与部署边界

官方模型卡将 XiaomiMiMo/MiMo-V2.6-Flash-RL 定义为 MiMo-V2.6 系列的效率平衡 checkpoint,并报告其在代码、通用 Agent、网络安全和视觉 Agent 基准上的结果;但评测硬件、样本量、完整 harness、提示词和解码设置未公开,结果应视为厂商报告,不能直接外推到所有任务或独立复现实验。

媒体来源厂商自报编辑日期 2026-09-22

测试条件速查

来源具体观察
官方模型卡将 XiaomiMiMo/MiMo-V2.6-Flash-RL 定义为 MiMo-V2.6 系列的效率平衡 checkpoint,并报告其在代码、通用 Agent、网络安全和视觉 Agent 基准上的结果;但评测硬件、样本量、完整 harness、提示词和解码设置未公开,结果应视为厂商报告,不能直接外推到所有任务或独立复现实验。
已公布条件
未列出的任务、不同 harness 或不同解码参数下的准确率、延迟、吞吐、成本和生产稳定性;表格中的跨模型比较也不能替代同条件独立测试。

关键数据与适用场景

一句话结论

官方模型卡将 XiaomiMiMo/MiMo-V2.6-Flash-RL 定义为 MiMo-V2.6 系列的效率平衡 checkpoint,并报告其在代码、通用 Agent、网络安全和视觉 Agent 基准上的结果;但评测硬件、样本量、完整 harness、提示词和解码设置未公开,结果应视为厂商报告,不能直接外推到所有任务或独立复现实验。

适用场景

  • 适合判断的任务:长上下文、多模态输入、代码 Agent、通用 Agent、网络安全和视觉编码任务的官方能力定位;SGLang/vLLM 本地部署边界。

  • 不适合外推的任务:未列出的任务、不同 harness 或不同解码参数下的准确率、延迟、吞吐、成本和生产稳定性;表格中的跨模型比较也不能替代同条件独立测试。

  • 适用的模型版本:仅 MiMo-V2.6-Flash-RL;表中的 MiMo-V2.6 Flash 与该 checkpoint 对应。本文不把 MiMo-V2.6-Pro-RL、MiMo-V2.5-Pro 或其他旧版/Pro 型号的数据并入 Flash。

  • 测试环境或客户端:Hugging Face 模型卡;可见部署示例包括 SGLang、vLLM、Transformers 和 Docker。评测硬件、操作系统、驱动、服务版本和 API 客户端未注明。

  • 推理档位和参数:模型卡建议 temperature=1.0、top_p=0.95;未注明各基准是否使用该设置。SGLang 示例使用 --tp 8 --dp 2、--mem-fraction-static 0.65、EAGLE 草稿参数和 --reasoning-parser mimo --tool-call-parser mimo;vLLM 示例使用 --tensor-parallel-size 4、--gpu-memory-utilization 0.95、--max-model-len auto 及同样的解析器配置。

测评方法

模型卡可见的方法信息分为训练/对齐描述和结果表两部分:

  1. 训练/对齐侧描述:官方称使用一次混合 RL 运行覆盖代码、通用 Agent、视觉和网络安全;任务与多个 harness 混在同一批次中。异步 GRPO 的可见规模是每步 1,568 prompts × 16 rollouts,每次更新涉及数十亿 token。GRS 以组内对比 rollout 生成任务化 rubric,GAR 对通过的轨迹排序并重新分配 advantage。

  2. 结果表:模型卡列出代码 Agent、通用 Agent、网络安全、视觉 Agent 四组基准,并将 Flash 与 MiMo-V2.6 Pro、MiMo-V2.5 Pro、Claude Opus 5、GPT-5.6 Sol、Claude Fable 5 并列。

  3. 可见评测条件:部分基准包含版本号,例如 DeepSWE v1.1、AutomationBench v1.0.6、GDPval-AA 2.1、Terminal Bench 4.0/2.1;其余版本、样本量、提示词、few-shot 设置、工具配置、评分脚本、硬件和重复次数均未注明。

  4. 结果性质:以下数字全部是模型卡中的厂商报告值;页面没有提供 Flash 的独立复测记录或逐项可复现的评测命令。

关键结果

按模型卡原表抄录全部列(- 保留为原文缺失标记):

类别基准(版本)MiMo-V2.6 ProMiMo-V2.6 FlashMiMo-V2.5 ProClaude Opus 5GPT-5.6 SolClaude Fable 5
Code AgentDeepSWE v1.171.967.919.074.073.070.0
Code AgentProgramBench26.526.012.537.025.033.0
Code AgentMiMo Code Bench63.261.240.468.659.3-
General AgentAutomationBench v1.0.653.152.316.050.345.846.2
General AgentToolathlon-Verified76.973.649.180.674.977.9
General AgentGDPval-AA 2.11673-1107170815881595
General AgentAgents’ Last Exam31.627.613.231.630.825.7
General AgentTerminal Bench 4.034.928.81.549.039.942.4
General AgentTerminal Bench 2.189.987.665.289.188.884.3
General AgentOSWorld-Verified82.080.8-83.483.086.0
General AgentJobBench62.061.225.065.745.457.4
CybersecurityCyberGym94.095.140.0---
CybersecurityMiMo Cyber Bench80.277.20.0---
CybersecurityExploitGym17.86.00.222.130.328.4
CybersecurityExploitBench47.925.316.670.078.578.0
CybersecuritySEC Bench Pro66.347.517.7-79.1-
Visual AgentMiMo VisualCoding72.371.5-70.073.469.1

表中 - 是原文的缺失标记,不应解释为 0。由于各列的评测条件未注明,不能据此确认不同模型使用了同一 harness、提示词或时间窗口。

原始数据

目标 checkpoint 与能力摘要

  • 精确仓库标识:XiaomiMiMo/MiMo-V2.6-Flash-RL;模型卡标题和部署命令均使用此标识。

  • 系列定位:MiMo-V2.6 系列中的 efficiency-balanced checkpoint。

  • 架构:稀疏 MoE;模型卡摘要写为总参数 309B、激活参数 15B。

  • 上下文:最大上下文 1M tokens;仓库 config.json 的 max_position_embeddings 为 1048576。

  • 模态:文本、图像、视频、音频;标签含 multimodal、vision-language、audio、video-understanding、agent、long-context。

  • 视觉编码器:681M 参数 MiMo ViT,28 层(24 SWA + 4 全注意力)。

  • 音频编码器:308M 参数 AudioTokenizer + 127M 音频 patch encoder。

  • 主干配置:48 层(39 SWA + 9 GA)、hidden size 4096、SWA Q/KV heads 64/8、GA Q/KV heads 64/4、sliding window 128、256 个 routed experts、每 token 激活 8 个 expert。

  • 推测解码:5 层 SWA MTP speculative decoder;模型卡称每次前向预测后续 7 个 token,部署示例另配置 EAGLE 草稿步骤。

参数摘要冲突

同一 Hugging Face 页面侧边栏另显示 Model size: 159B params,并列出 F32、BF16、F8_E4M3、U8 张量类型。模型卡正文的 309B total / 15B activated 是架构摘要,页面没有解释 159B 与其如何对应,也没有说明 159B 是否按某种权重格式、去除模块或统计口径计算。因此本文不强行换算或合并:

  • 厂商架构口径:309B 总参数、15B 激活参数;用于描述稀疏 MoE 计算结构。

  • Hugging Face 页面摘要口径:159B params;仅作为页面元数据记录,不能替代正文架构数字。

  • 复现建议:引用参数时同时注明口径,并以仓库当前 config.json、权重索引和实际加载日志进一步核对;不能把 159B 解释为 15B 激活参数,也不能把 Flash 与 Pro 合并。

结论与边界

  • 在官方表格中,Flash 在 CyberGym(95.1)和 Terminal Bench 2.1(87.6)等项目表现较高;在 ExploitGym(6.0)、ExploitBench(25.3)和 SEC Bench Pro(47.5)上明显低于同表的 MiMo-V2.6 Pro。以上是逐项结果,不构成总体排名。

  • 结果覆盖范围有限:GDPval-AA 2.1 的 Flash 值为空,且各基准的样本量、硬件、提示词、工具/harness 和评分细则未公开;不能据此推导延迟、吞吐、成本或真实业务成功率。

  • 模型卡给出了本地部署边界,但它不是性能实测:SGLang 示例依赖 trust-remote-code、TP/DP 和 MTP/EAGLE 配置;vLLM 示例注明稳定版可能滞后,并指向预构建镜像 vllm/vllm-openai:mimov25-cu129。实际兼容性应以当前框架版本、显存和权重格式验证。

  • 跨模型列(Claude、GPT 等)是厂商表格中的对照值,来源、时间和 harness 条件未注明;不能把它们当成同条件独立测量。

复现说明

  1. 下载或挂载精确仓库 XiaomiMiMo/MiMo-V2.6-Flash-RL,不要替换为 Pro、V2.5 或其他 Flash 版本。

  2. 按模型卡的 Transformers、SGLang 或 vLLM 示例部署;保留 trust_remote_code、多模态编码器和 reasoning/tool-call parser 配置,并记录框架、镜像、驱动、GPU、显存、并行度和权重格式。

  3. 以 temperature=1.0、top_p=0.95 作为模型卡给出的采样起点;逐项记录实际 max tokens、工具设置、提示词、样本量和评分脚本。模型卡未给出这些评测细节,复现者必须自行补齐,不能声称与官方数字同条件。

  4. 运行同版本基准并分别保存原始输出、评分结果和失败样本;对表中 - 保持“未报告”,不要改写为 0。

  5. 对参数争议同时记录模型卡的 309B/15B 架构摘要、Hugging Face 159B 页面摘要、config.json 和实际加载日志,注明统计口径后再比较。

能支持的判断

  • 长上下文、多模态输入、代码 Agent、通用 Agent、网络安全和视觉编码任务的官方能力定位;SGLang/vLLM 本地部署边界。

不能支持的判断

  • 未列出的任务、不同 harness 或不同解码参数下的准确率、延迟、吞吐、成本和生产稳定性;表格中的跨模型比较也不能替代同条件独立测试。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Hugging Face · Xiaomi MiMo Team · 原文发布日期 Unknown · 本站编辑日期 2026-09-22

打开原始来源

MiMo-V2.6-Flash

在 Tabbit 中比较 MiMo-V2.6-Flash

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Flash 深度测评:高吞吐自动化主力,长程规划的有条件升级

基于公开实证与技术基准对小米 MiMo-V2.6-Flash 的深度测评:解析 15B 激活 MoE 吞吐、基准局限、长程纠错悬崖、计费机制与工作负载选型。

定价 · 简体中文

MiMo-V2.6-Flash 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Flash 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、MoE 高吞吐架构与大规模任务预算测算。

模型对比 · 简体中文

MiMo-V2.6-Pro 对比 MiMo-V2.6-Flash:小米 MoE 模型选型深度评测

深度实测小米 MiMo-V2.6-Pro 与 Flash:1.02T 对比 309B MoE 架构、3.1 倍 API 费率差异、前缀缓存经济学、长程 Agent 基准与场景选型决策矩阵。

相关评测

MiMo-V2.6-Flash 官方基准:30 步强化学习与 Agent 结果厂商报告称,MiMo-V2.6-Flash 在 30 步、约 75 万条累计轨迹的 RL 训练后,DeepSWE v1.1 从 48.8 提升到 65.7;官方 Agent 基准表中,Flash 在 CyberGym 得分 95.1、Terminal Bench 2.1 得分 87.6、MiMo Visual Coding 得分 71.5。以上均为小米页面披露的结果,不是独立复测。BenchLM:MiMo-V2.6-Flash 与 Pro 的同系列成本和公开基准对比BenchLM 页面列出 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 的 12 条共享公开基准结果及三种固定 token 场景的估算成本:Flash 在 12 条结果中的 1 条 CyberGym 胜出,其余 11 条由 Pro 胜出;但两个模型在当前公开排名通道均未排名,页面明确不评总体质量胜者,因此这些结果不能改写为 Pro 或 Flash 的整体优胜结论。MiMo-V2.6-Flash 官方 X 发布线程:Flash 的基准定位与双模型策略该官方帖将 MiMo-V2.6-Flash 定位为与 Pro 并列的全模态模型,强调扩展强化学习、代码/通用 Agent/网络安全/视觉 Agent 能力和开放复现;附图给出 Flash 的逐项基准分,但没有公开样本量、完整 harness、硬件、提示词或解码参数,因此这些数字只能作为厂商基线。MiMo-V2.6-Flash:编译器与 GC 开发的 Reddit 一手反馈一位 Reddit 用户称,自己已将确切写作 “MiMo V2.6 flash” 的模型用于编译器/GC 开发,未遇到工作障碍,并计划继续使用;但没有提供任务、环境、提示词、参数、样本量或客观指标,因此只能作为个人可用性信号。MiMo-V2.6-Flash Web Search 工具调用工作流对 mimo-v2.6-flash,先在 MiMo Console 启用 Web Search Plugin,再通过 OpenAI Chat Completions 的 web_search 工具调用;需要实时信息时可用 force_search: true,用 max_keyword 控制单轮并发关键词数与潜在调用成本。MiMo-V2.6-Flash 深度思考配置与多轮工具调用工作流mimo-v2.6-flash 支持用 thinking.type 开关深度思考,默认开启;启用后不要自定义 temperature 或 top_p,并在多轮工具调用中完整回传历史 assistant 消息的 reasoning_content。MiMo-V2.6-Flash 结构化输出:JSON 模式配置与校验工作流官方文档将 mimo-v2.6-flash 列为 JSON mode 支持型号;调用时设置 response_format={"type": "json_object"},并在 system 或 user message 中明确要求仅返回 JSON、完整定义字段/层级/类型。该模式只保证 JSON 语法,不保证业务结构,生产环境仍应做 JSON Schema 校验。MiMo-V2.6-Flash 图像理解输入与多图工作流官方文档将 mimo-v2.6-flash 列为图像理解支持型号,可通过公开 URL 或 Base64 传入图片,并支持多图比较;文档没有提供 Flash 专属响应,因此不能把页面中的 Pro 示例输出、token 使用量或效果外推到 Flash。