Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

MiMo-V2.6-Flash · 媒体来源 · 厂商自报

MiMo-V2.6-Flash 官方基准:30 步强化学习与 Agent 结果

厂商报告称,MiMo-V2.6-Flash 在 30 步、约 75 万条累计轨迹的 RL 训练后,DeepSWE v1.1 从 48.8 提升到 65.7;官方 Agent 基准表中,Flash 在 CyberGym 得分 95.1、Terminal Bench 2.1 得分 87.6、MiMo Visual Coding 得分 71.5。以上均为小米页面披露的结果,不是独立复测。

媒体来源厂商自报编辑日期 2026-09-22

测试条件速查

来源具体观察
厂商报告称,MiMo-V2.6-Flash 在 30 步、约 75 万条累计轨迹的 RL 训练后,DeepSWE v1.1 从 48.8 提升到 65.7;官方 Agent 基准表中,Flash 在 CyberGym 得分 95.1、Terminal Bench 2.1 得分 87.6、MiMo Visual Coding 得分 71.5。以上均为小米页面披露的结果,不是独立复测。
已公布条件
不能据此推断所有真实业务、不同提示词、不同工具链或不同推理参数下的表现;页面未给出每项基准的样本量、完整提示词、解码设置、随机种子、硬件配置或单项 harness 映射。

关键数据与适用场景

一句话结论

厂商报告称,MiMo-V2.6-Flash 在 30 步、约 75 万条累计轨迹的 RL 训练后,DeepSWE v1.1 从 48.8 提升到 65.7;官方 Agent 基准表中,Flash 在 CyberGym 得分 95.1、Terminal Bench 2.1 得分 87.6、MiMo Visual Coding 得分 71.5。以上均为小米页面披露的结果,不是独立复测。

适用场景

  • 适合判断的任务:代码 Agent、通用 Agent、网络安全 Agent、视觉 Agent,以及长程软件工程任务的官方公开基线。

  • 不适合外推的任务:不能据此推断所有真实业务、不同提示词、不同工具链或不同推理参数下的表现;页面未给出每项基准的样本量、完整提示词、解码设置、随机种子、硬件配置或单项 harness 映射。

  • 适用的模型版本:MiMo-V2.6-Flash;API 模型名应使用小写 mimo-v2.6-flash。

  • 测试环境或客户端:小米 MiMo 官方发布页披露的 RL 训练与 Agent 基准;具体评测客户端、硬件、API 端点和运行配置未注明。

  • 推理档位和参数:未注明。

测评方法

官方页面称,MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 在不足 6 天内各完成 30 个训练步骤,累计约 750,000 条轨迹;训练成本分别约为 850,000 美元(Flash)和 2,620,000 美元(Pro)。页面同时报告训练任务平均通过率相对提升 25%(Flash)和 12%(Pro)。

训练规模与配置的可见信息:

  • 每次更新使用 1,568 个样本,支持 1M 上下文长度;每个训练步骤的 token 数为 3.5–3.7B。

  • 任务覆盖 Code、General、Visual、Cyber,并称通过多个 harness 进行多任务训练。

  • 页面列出的开源端到端 RL 框架组件为 verl、uni-agent 和 mini-swe-agent;另称提供可组合的轻量级 mini-harnesses,但没有给出各基准对应的 harness 名称或配置。

  • 为抑制专家负载漂移,训练中冻结 MoE Router;奖励可靠性措施包括奖励设计、对抗评测、异常检测和验证器交叉核验。

  • 训练支持多 Agent 混合任务,并使用统一轨迹表示、惩罚机制,以及控制面与数据面解耦。

关键结果

Flash 官方基准表

下表抄录原文图表中的可见数值。分数的量纲和百分比定义由各基准决定,原文未在发布页补充统一说明;— 表示图表未提供数值。

类别BenchmarkMiMo-V2.6-FlashMiMo-V2.6-ProMiMo-V2.5-ProClaude Opus 5GPT-5.6 SolFable 5
Code AgentDeepSWE v1.167.971.919.074.073.070.0
Code AgentProgramBench26.026.512.537.025.033.0
Code AgentMiMo Code Bench61.263.240.468.659.3—
General AgentAutomationBench v1.0.652.353.116.050.345.846.2
General AgentToolathlon-Verified73.676.949.180.674.977.9
General AgentGDPval-AA 2.1—16731107170815881595
General AgentAgents’ Last Exam27.631.613.231.630.825.7
General AgentTerminal Bench 4.028.834.91.549.039.942.4
General AgentTerminal Bench 2.187.689.965.289.188.884.3
General AgentOSWorld-Verified80.882.061.5†83.483.086.0
General AgentJobBench61.262.025.065.745.457.4
CybersecurityCyberGym95.194.040.0———
CybersecurityMiMo Cyber Bench77.280.20.0———
CybersecurityExploitGym6.017.80.222.130.328.4
CybersecurityExploitBench25.347.916.670.078.578.0
CybersecuritySEC Bench Pro47.566.317.7—79.1—
Visual AgentMiMo Visual Coding71.572.3—70.073.469.1

† 图表脚注说明:该 MiMo-V2.5 结果来自 MiMo-V2.5。原文没有说明 Flash 表中各项的测试样本量、评测日期、运行参数、置信区间或是否由同一 harness 执行。

RL 训练前后

模型训练步骤轨迹训练成本训练任务平均通过率相对提升DeepSWE v1.1(前 → 后)页面表述的提升
MiMo-V2.6-Flash30与 Pro 合计约 750,000约 850,000 美元25%48.8 → 65.7约 17 分
MiMo-V2.6-Pro30与 Flash 合计约 750,000约 2,620,000 美元12%58.4 → 72.6约 14 分

这里的“轨迹、成本、提升”均是厂商在发布页中的报告;原文没有给出 Flash 单独轨迹数,也没有提供独立评测记录。

原始数据

  • 页面称 MiMo-V2.6 系列包含两个原生全模态模型:Pro 与 Flash;本文只把 Flash 列作为目标模型数据。

  • 页面文字称,RL 后 Flash “comprehensively outperformed MiMo-V2.5-Pro”,但没有在文字中给出该判断的统计口径;可核对的逐项数值以图表为准。

  • DeepSWE v1.1 被页面描述为 out-of-sample long-range software engineering evaluation benchmark;Flash 的发布页数值为 48.8 → 65.7。

  • 图表比较对象明确为 MiMo-V2.6-Pro、MiMo-V2.5-Pro、Claude Opus 5、GPT-5.6 Sol 和 Fable 5;缺失值以 — 显示。

  • 训练环境开源说明中,页面还报告从 MiMo-V2.6-Distill-Qwen-9B 的 SFT baseline 出发,在 11 个 benchmark 上均有提升,并举出 SWE-bench Verified、MiMo Cyber Bench、Terminal Bench 2.1 和 MiMo Visual Coding 的数值。这是 Distill-Qwen-9B 训练资源示例,不是 MiMo-V2.6-Flash 的基准结果,不能混入上表。

结论与边界

  • 厂商主张:Flash 的公开表格显示其在 CyberGym、Terminal Bench 2.1、OSWorld-Verified 和 MiMo Visual Coding 等项目上取得较高分;RL 训练阶段的 DeepSWE v1.1 从 48.8 到 65.7。

  • 独立测量:未提供。本文没有把官方数字当作独立复测。

  • 版本边界:不要把 MiMo-V2-Flash、MiMo-V2.5-Pro、MiMo-V2.6-Pro 或 MiMo-V2.6-Pro-UltraSpeed 的数据改写为 Flash 数据。页面的 UltraSpeed 说明针对 Pro,最高 20 倍推理速度,不是 Flash 基准。

  • 比较边界:图表中的不同模型可能使用不同的评测实现或可用工具;发布页未披露统一 harness、样本、提示词、采样参数和成本口径,因此不能据此作严格的跨模型因果结论。

  • 文本与图表标签差异:正文提到 Claude Fable 5.1 和 GPT-6 Astra,基准图表列名则为 Fable 5、GPT-5.6 Sol 和 Claude Opus 5;本文按各处原样记录,不替厂商合并或校正名称。

  • 其他可见限制:页面没有报告每项测试的失败案例、方差、置信区间、硬件、上下文截断策略、工具版本或安全限制;“comprehensively outperformed”等总体表述也未给出汇总公式。

复现说明

  1. 打开原文并确认页面更新时间为 2026-09-22,阅读正文与基准图表。

  2. 使用小米公开的 mimo-v2.6-flash 模型 ID;不要替换成 Pro、V2.5-Pro、Pro UltraSpeed 或旧版 V2-Flash。

  3. 如需复核表中结果,应获取官方技术报告、评测代码、任务集版本、harness、提示词、采样参数、样本量和硬件配置;发布页本身不足以完整复现实验。

  4. 独立复测时,应单独记录实际 API/客户端、工具调用、成本和失败样本,并与本页厂商报告分栏,不得将复测结果回填为官方值。

能支持的判断

  • 代码 Agent、通用 Agent、网络安全 Agent、视觉 Agent,以及长程软件工程任务的官方公开基线。

不能支持的判断

  • 不能据此推断所有真实业务、不同提示词、不同工具链或不同推理参数下的表现;页面未给出每项基准的样本量、完整提示词、解码设置、随机种子、硬件配置或单项 harness 映射。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Xiaomi MiMo 官方文档 · 小米 MiMo(厂商官方) · 原文发布日期 2026-09-22 · 本站编辑日期 2026-09-22

打开原始来源

MiMo-V2.6-Flash

在 Tabbit 中比较 MiMo-V2.6-Flash

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Flash 深度测评:高吞吐自动化主力,长程规划的有条件升级

基于公开实证与技术基准对小米 MiMo-V2.6-Flash 的深度测评:解析 15B 激活 MoE 吞吐、基准局限、长程纠错悬崖、计费机制与工作负载选型。

定价 · 简体中文

MiMo-V2.6-Flash 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Flash 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、MoE 高吞吐架构与大规模任务预算测算。

模型对比 · 简体中文

MiMo-V2.6-Pro 对比 MiMo-V2.6-Flash:小米 MoE 模型选型深度评测

深度实测小米 MiMo-V2.6-Pro 与 Flash:1.02T 对比 309B MoE 架构、3.1 倍 API 费率差异、前缀缓存经济学、长程 Agent 基准与场景选型决策矩阵。

相关评测

MiMo-V2.6-Flash-RL Hugging Face 官方基准与部署边界官方模型卡将 XiaomiMiMo/MiMo-V2.6-Flash-RL 定义为 MiMo-V2.6 系列的效率平衡 checkpoint,并报告其在代码、通用 Agent、网络安全和视觉 Agent 基准上的结果;但评测硬件、样本量、完整 harness、提示词和解码设置未公开,结果应视为厂商报告,不能直接外推到所有任务或独立复现实验。BenchLM:MiMo-V2.6-Flash 与 Pro 的同系列成本和公开基准对比BenchLM 页面列出 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 的 12 条共享公开基准结果及三种固定 token 场景的估算成本:Flash 在 12 条结果中的 1 条 CyberGym 胜出,其余 11 条由 Pro 胜出;但两个模型在当前公开排名通道均未排名,页面明确不评总体质量胜者,因此这些结果不能改写为 Pro 或 Flash 的整体优胜结论。MiMo-V2.6-Flash 官方 X 发布线程:Flash 的基准定位与双模型策略该官方帖将 MiMo-V2.6-Flash 定位为与 Pro 并列的全模态模型,强调扩展强化学习、代码/通用 Agent/网络安全/视觉 Agent 能力和开放复现;附图给出 Flash 的逐项基准分,但没有公开样本量、完整 harness、硬件、提示词或解码参数,因此这些数字只能作为厂商基线。MiMo-V2.6-Flash:编译器与 GC 开发的 Reddit 一手反馈一位 Reddit 用户称,自己已将确切写作 “MiMo V2.6 flash” 的模型用于编译器/GC 开发,未遇到工作障碍,并计划继续使用;但没有提供任务、环境、提示词、参数、样本量或客观指标,因此只能作为个人可用性信号。MiMo-V2.6-Flash Web Search 工具调用工作流对 mimo-v2.6-flash,先在 MiMo Console 启用 Web Search Plugin,再通过 OpenAI Chat Completions 的 web_search 工具调用;需要实时信息时可用 force_search: true,用 max_keyword 控制单轮并发关键词数与潜在调用成本。MiMo-V2.6-Flash 深度思考配置与多轮工具调用工作流mimo-v2.6-flash 支持用 thinking.type 开关深度思考,默认开启;启用后不要自定义 temperature 或 top_p,并在多轮工具调用中完整回传历史 assistant 消息的 reasoning_content。MiMo-V2.6-Flash 结构化输出:JSON 模式配置与校验工作流官方文档将 mimo-v2.6-flash 列为 JSON mode 支持型号;调用时设置 response_format={"type": "json_object"},并在 system 或 user message 中明确要求仅返回 JSON、完整定义字段/层级/类型。该模式只保证 JSON 语法,不保证业务结构,生产环境仍应做 JSON Schema 校验。MiMo-V2.6-Flash 图像理解输入与多图工作流官方文档将 mimo-v2.6-flash 列为图像理解支持型号,可通过公开 URL 或 Base64 传入图片,并支持多图比较;文档没有提供 Flash 专属响应,因此不能把页面中的 Pro 示例输出、token 使用量或效果外推到 Flash。