Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

MiMo-V2.6-Flash · 社区来源 · 厂商自报

MiMo-V2.6-Flash 官方 X 发布线程:Flash 的基准定位与双模型策略

该官方帖将 MiMo-V2.6-Flash 定位为与 Pro 并列的全模态模型,强调扩展强化学习、代码/通用 Agent/网络安全/视觉 Agent 能力和开放复现;附图给出 Flash 的逐项基准分,但没有公开样本量、完整 harness、硬件、提示词或解码参数,因此这些数字只能作为厂商基线。

社区来源厂商自报编辑日期 2026-09-22

测试条件速查

来源具体观察
该官方帖将 MiMo-V2.6-Flash 定位为与 Pro 并列的全模态模型,强调扩展强化学习、代码/通用 Agent/网络安全/视觉 Agent 能力和开放复现;附图给出 Flash 的逐项基准分,但没有公开样本量、完整 harness、硬件、提示词或解码参数,因此这些数字只能作为厂商基线。
已公布条件
真实业务成功率、延迟、吞吐、成本、稳定性,以及不同工具链或推理参数下的表现;也不能把 Pro 专属主张归给 Flash。

关键数据与适用场景

一句话结论

该官方帖将 MiMo-V2.6-Flash 定位为与 Pro 并列的全模态模型,强调扩展强化学习、代码/通用 Agent/网络安全/视觉 Agent 能力和开放复现;附图给出 Flash 的逐项基准分,但没有公开样本量、完整 harness、硬件、提示词或解码参数,因此这些数字只能作为厂商基线。

适用场景

  • 适合判断的任务:代码 Agent、通用 Agent、网络安全 Agent 和视觉 Agent 的官方能力定位;判断 Flash 与 Pro 的产品分工和开源方向。

  • 不适合外推的任务:真实业务成功率、延迟、吞吐、成本、稳定性,以及不同工具链或推理参数下的表现;也不能把 Pro 专属主张归给 Flash。

  • 适用的模型版本:MiMo-V2.6-Flash。本帖未使用 MiMo-V2.6-Flash-RL 这一 checkpoint 名称。

  • 测试环境或客户端:Xiaomi MiMo 官方 X 帖及其附图;评测硬件、客户端、API 端点和 harness 未注明。

  • 推理档位和参数:未注明。

测评方法

可见测评材料只有原帖附图中的一张表(图注为 “Table 3 Comparison of MiMo-V2.6 with previous-generation and frontier models on agentic benchmarks”)。表格按 Code Agent、General Agent、Cybersecurity、Visual Agent 分组,横向列出 MiMo-V2.6 Pro、MiMo-V2.6 Flash、MiMo-V2.5 Pro、Claude Opus 5、GPT-5.6 Sol 和 Fable 5。

原帖文字称两个模型通过 scaled reinforcement learning 推进,并称更强的 coding、computer use、3D reasoning 和 creative capabilities;可见线程还称 Pro 与 Flash 的 API 定价均与 V2.5 保持不变,并将 Pro、Flash、技术报告、7K+ RL task environments、端到端 RL framework 和 composable mini-harnesses 开源。这些是厂商发布信息,不是评测方法的完整披露。

来源未注明:每项基准的样本量、任务抽样规则、评测日期、完整提示词、few-shot 设置、工具权限、解码参数、硬件、重复次数、评分脚本、置信区间和失败样本。

关键结果

下表只抄录附图中 MiMo-V2.6 Flash 一列;— 表示图中未提供数值。

类别BenchmarkMiMo-V2.6-Flash
Code AgentDeepSWE v1.167.9
Code AgentProgramBench26.0
Code AgentMiMo Code Bench61.2
General AgentAutomationBench v1.0.652.3
General AgentToolathlon-Verified73.6
General AgentGDPval-AA 2.1—
General AgentAgents’ Last Exam27.6
General AgentTerminal Bench 4.028.8
General AgentTerminal Bench 2.187.6
General AgentOSWorld-Verified80.8
General AgentJobBench61.2
CybersecurityCyberGym95.1
CybersecurityMiMo Cyber Bench77.2
CybersecurityExploitGym6.0
CybersecurityExploitBench25.3
CybersecuritySEC Bench Pro47.5
Visual AgentMiMo Visual Coding71.5

原始数据

  • 原帖定位:Introducing Xiaomi MiMo-V2.6 — Pro & Flash.;Two omnimodal models, advancing through scaled reinforcement learning。

  • 原帖能力表述:Stronger coding, computer use, 3D reasoning and creative capabilities。

  • 原帖开放主张:Open model weights, technical report, RL environments and training code。

  • 可见线程中的 Flash 相关表述:API pricing unchanged from V2.5, for both Pro and Flash;We’re open-sourcing Pro and Flash ... 7K+ RL task environments ... composable mini-harnesses。

  • 原帖附图:https://pbs.twimg.com/media/HSxK_3caUAAsfBl?format=jpg&name=medium。图中 Flash 列的 CyberGym 为 95.1、Terminal Bench 2.1 为 87.6、MiMo Visual Coding 为 71.5;同时完整列出了上表其余项目。

  • 明确的版本边界:原帖中 Pro performs on par with Claude Opus 5 and GPT-5.6 Sol across most agent benchmarks 以及 Pro scores 46 ... 均明确指向 Pro,不是 Flash 结果。

结论与边界

  • 厂商主张:Flash 被作为 Pro 之外的全模态模型发布,并以同一张 Agent 基准表展示其代码、通用 Agent、网络安全和视觉 Agent 分数;官方线程同时强调 API 定价不变和开放 RL 资源。

  • 独立测量:未提供。本页没有独立复测、第三方 harness 或个人体验数据。

  • 数据解释边界:表格是一次官方发布快照,不足以推出总体排名或跨任务平均能力。不同基准的分数定义也未统一说明。

  • 比较边界:附图中的对照模型和 Flash 可能没有使用同一时间、硬件、工具、提示词或 harness;不能把表格差异解释为严格的因果优势。

  • 模型边界:不得把 MiMo-V2-Flash、MiMo-V2.5-Pro、MiMo-V2.6-Pro 或 MiMo-V2.6-Pro-UltraSpeed 的数据改写成 Flash 数据;本页仅记录图中 MiMo-V2.6 Flash 列。

复现说明

  1. 打开原始 X 帖,确认作者为 @XiaomiMiMo,并查看原帖附图的 MiMo-V2.6 Flash 列。

  2. 按类别和基准名称逐项抄录分数;图中的 — 保持为“未提供”,不要改写为 0。

  3. 若要独立复测,需另行取得任务集版本、完整 harness、提示词、工具配置、解码参数、硬件、样本量和评分脚本;原帖本身不足以复现实验。

  4. 独立结果应与本文的厂商值分栏保存,并注明实际模型标识、客户端、运行时间和失败样本;不要用独立结果替换官方表格。

能支持的判断

  • 代码 Agent、通用 Agent、网络安全 Agent 和视觉 Agent 的官方能力定位;判断 Flash 与 Pro 的产品分工和开源方向。

不能支持的判断

  • 真实业务成功率、延迟、吞吐、成本、稳定性,以及不同工具链或推理参数下的表现;也不能把 Pro 专属主张归给 Flash。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

X(Twitter) · Xiaomi MiMo(@XiaomiMiMo,厂商官方账号) · 原文发布日期 2026-09-21 · 本站编辑日期 2026-09-22

打开原始来源

MiMo-V2.6-Flash

在 Tabbit 中比较 MiMo-V2.6-Flash

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Flash 深度测评:高吞吐自动化主力,长程规划的有条件升级

基于公开实证与技术基准对小米 MiMo-V2.6-Flash 的深度测评:解析 15B 激活 MoE 吞吐、基准局限、长程纠错悬崖、计费机制与工作负载选型。

定价 · 简体中文

MiMo-V2.6-Flash 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Flash 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、MoE 高吞吐架构与大规模任务预算测算。

模型对比 · 简体中文

MiMo-V2.6-Pro 对比 MiMo-V2.6-Flash:小米 MoE 模型选型深度评测

深度实测小米 MiMo-V2.6-Pro 与 Flash:1.02T 对比 309B MoE 架构、3.1 倍 API 费率差异、前缀缓存经济学、长程 Agent 基准与场景选型决策矩阵。

相关评测

MiMo-V2.6-Flash 官方基准:30 步强化学习与 Agent 结果厂商报告称,MiMo-V2.6-Flash 在 30 步、约 75 万条累计轨迹的 RL 训练后,DeepSWE v1.1 从 48.8 提升到 65.7;官方 Agent 基准表中,Flash 在 CyberGym 得分 95.1、Terminal Bench 2.1 得分 87.6、MiMo Visual Coding 得分 71.5。以上均为小米页面披露的结果,不是独立复测。MiMo-V2.6-Flash-RL Hugging Face 官方基准与部署边界官方模型卡将 XiaomiMiMo/MiMo-V2.6-Flash-RL 定义为 MiMo-V2.6 系列的效率平衡 checkpoint,并报告其在代码、通用 Agent、网络安全和视觉 Agent 基准上的结果;但评测硬件、样本量、完整 harness、提示词和解码设置未公开,结果应视为厂商报告,不能直接外推到所有任务或独立复现实验。BenchLM:MiMo-V2.6-Flash 与 Pro 的同系列成本和公开基准对比BenchLM 页面列出 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 的 12 条共享公开基准结果及三种固定 token 场景的估算成本:Flash 在 12 条结果中的 1 条 CyberGym 胜出,其余 11 条由 Pro 胜出;但两个模型在当前公开排名通道均未排名,页面明确不评总体质量胜者,因此这些结果不能改写为 Pro 或 Flash 的整体优胜结论。MiMo-V2.6-Flash:编译器与 GC 开发的 Reddit 一手反馈一位 Reddit 用户称,自己已将确切写作 “MiMo V2.6 flash” 的模型用于编译器/GC 开发,未遇到工作障碍,并计划继续使用;但没有提供任务、环境、提示词、参数、样本量或客观指标,因此只能作为个人可用性信号。MiMo-V2.6-Flash Web Search 工具调用工作流对 mimo-v2.6-flash,先在 MiMo Console 启用 Web Search Plugin,再通过 OpenAI Chat Completions 的 web_search 工具调用;需要实时信息时可用 force_search: true,用 max_keyword 控制单轮并发关键词数与潜在调用成本。MiMo-V2.6-Flash 深度思考配置与多轮工具调用工作流mimo-v2.6-flash 支持用 thinking.type 开关深度思考,默认开启;启用后不要自定义 temperature 或 top_p,并在多轮工具调用中完整回传历史 assistant 消息的 reasoning_content。MiMo-V2.6-Flash 结构化输出:JSON 模式配置与校验工作流官方文档将 mimo-v2.6-flash 列为 JSON mode 支持型号;调用时设置 response_format={"type": "json_object"},并在 system 或 user message 中明确要求仅返回 JSON、完整定义字段/层级/类型。该模式只保证 JSON 语法,不保证业务结构,生产环境仍应做 JSON Schema 校验。MiMo-V2.6-Flash 图像理解输入与多图工作流官方文档将 mimo-v2.6-flash 列为图像理解支持型号,可通过公开 URL 或 Base64 传入图片,并支持多图比较;文档没有提供 Flash 专属响应,因此不能把页面中的 Pro 示例输出、token 使用量或效果外推到 Flash。