MiMo-V2.6-Flash

MiMo-V2.6-Flash · 测评与证据

MiMo-V2.6-Flash,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

厂商报告称,MiMo-V2.6-Flash 在 30 步、约 75 万条累计轨迹的 RL 训练后,DeepSWE v1.1 从 48.8 提升到 65.7;官方 Agent 基准表中,Flash 在 CyberGym 得分 95.1、Terminal Bench 2.1 得分 87.6、MiMo Visual Coding 得分 71.5。以上均为小米页面披露的结果,不是独立复测。

Xiaomi MiMo 官方文档 · 查看证据

官方模型卡将 XiaomiMiMo/MiMo-V2.6-Flash-RL 定义为 MiMo-V2.6 系列的效率平衡 checkpoint,并报告其在代码、通用 Agent、网络安全和视觉 Agent 基准上的结果;但评测硬件、样本量、完整 harness、提示词和解码设置未公开,结果应视为厂商报告,不能直接外推到所有任务或独立复现实验。

Hugging Face · 查看证据

该官方帖将 MiMo-V2.6-Flash 定位为与 Pro 并列的全模态模型,强调扩展强化学习、代码/通用 Agent/网络安全/视觉 Agent 能力和开放复现;附图给出 Flash 的逐项基准分,但没有公开样本量、完整 harness、硬件、提示词或解码参数,因此这些数字只能作为厂商基线。

X(Twitter) · 查看证据

完整测评与相关内容

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Flash 深度测评:高吞吐自动化主力,长程规划的有条件升级

基于公开实证与技术基准对小米 MiMo-V2.6-Flash 的深度测评:解析 15B 激活 MoE 吞吐、基准局限、长程纠错悬崖、计费机制与工作负载选型。

定价 · 简体中文

MiMo-V2.6-Flash 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Flash 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、MoE 高吞吐架构与大规模任务预算测算。

精选证据

媒体 / 基准方厂商自报

MiMo-V2.6-Flash 官方基准:30 步强化学习与 Agent 结果

厂商报告称,MiMo-V2.6-Flash 在 30 步、约 75 万条累计轨迹的 RL 训练后,DeepSWE v1.1 从 48.8 提升到 65.7;官方 Agent 基准表中,Flash 在 CyberGym 得分 95.1、Terminal Bench 2.1 得分 87.6、MiMo Visual Coding 得分 71.5。以上均为小米页面披露的结果,不是独立复测。

来源Xiaomi MiMo 官方文档
原文日期2026-09-22
采集2026-09-22
来源具体观察
厂商报告称,MiMo-V2.6-Flash 在 30 步、约 75 万条累计轨迹的 RL 训练后,DeepSWE v1.1 从 48.8 提升到 65.7;官方 Agent 基准表中,Flash 在 CyberGym 得分 95.1、Terminal Bench 2.1 得分 87.6、MiMo Visual Coding 得分 71.5。以上均为小米页面披露的结果,不是独立复测。
已公布条件
不能据此推断所有真实业务、不同提示词、不同工具链或不同推理参数下的表现;页面未给出每项基准的样本量、完整提示词、解码设置、随机种子、硬件配置或单项 harness 映射。
Agent能力
媒体 / 基准方厂商自报

MiMo-V2.6-Flash-RL Hugging Face 官方基准与部署边界

官方模型卡将 XiaomiMiMo/MiMo-V2.6-Flash-RL 定义为 MiMo-V2.6 系列的效率平衡 checkpoint,并报告其在代码、通用 Agent、网络安全和视觉 Agent 基准上的结果;但评测硬件、样本量、完整 harness、提示词和解码设置未公开,结果应视为厂商报告,不能直接外推到所有任务或独立复现实验。

来源Hugging Face
原文日期未知
采集2026-09-22
来源具体观察
官方模型卡将 XiaomiMiMo/MiMo-V2.6-Flash-RL 定义为 MiMo-V2.6 系列的效率平衡 checkpoint,并报告其在代码、通用 Agent、网络安全和视觉 Agent 基准上的结果;但评测硬件、样本量、完整 harness、提示词和解码设置未公开,结果应视为厂商报告,不能直接外推到所有任务或独立复现实验。
已公布条件
未列出的任务、不同 harness 或不同解码参数下的准确率、延迟、吞吐、成本和生产稳定性;表格中的跨模型比较也不能替代同条件独立测试。
编程能力
社区厂商自报

MiMo-V2.6-Flash 官方 X 发布线程:Flash 的基准定位与双模型策略

该官方帖将 MiMo-V2.6-Flash 定位为与 Pro 并列的全模态模型,强调扩展强化学习、代码/通用 Agent/网络安全/视觉 Agent 能力和开放复现;附图给出 Flash 的逐项基准分,但没有公开样本量、完整 harness、硬件、提示词或解码参数,因此这些数字只能作为厂商基线。

来源X(Twitter)
原文日期2026-09-21
采集2026-09-22
来源具体观察
该官方帖将 MiMo-V2.6-Flash 定位为与 Pro 并列的全模态模型,强调扩展强化学习、代码/通用 Agent/网络安全/视觉 Agent 能力和开放复现;附图给出 Flash 的逐项基准分,但没有公开样本量、完整 harness、硬件、提示词或解码参数,因此这些数字只能作为厂商基线。
已公布条件
真实业务成功率、延迟、吞吐、成本、稳定性,以及不同工具链或推理参数下的表现;也不能把 Pro 专属主张归给 Flash。
能力
媒体 / 基准方编辑分析

BenchLM:MiMo-V2.6-Flash 与 Pro 的同系列成本和公开基准对比

BenchLM 页面列出 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 的 12 条共享公开基准结果及三种固定 token 场景的估算成本:Flash 在 12 条结果中的 1 条 CyberGym 胜出,其余 11 条由 Pro 胜出;但两个模型在当前公开排名通道均未排名,页面明确不评总体质量胜者,因此这些结果不能改写为 Pro 或 Flash 的整体优胜结论。

来源BenchLM.ai
原文日期2026-09-21
采集2026-09-22
来源具体观察
BenchLM 页面列出 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 的 12 条共享公开基准结果及三种固定 token 场景的估算成本:Flash 在 12 条结果中的 1 条 CyberGym 胜出,其余 11 条由 Pro 胜出;但两个模型在当前公开排名通道均未排名,页面明确不评总体质量胜者,因此这些结果不能改写为 Pro 或 Flash 的整体优胜结论。
已公布条件
整体质量排名、未列任务、真实业务成功率、延迟、吞吐、稳定性,以及不同编辑器、harness、推理努力或提示词下的表现。页面也未给出 BenchLM 独立运行的样本量、原始输出或置信区间。
成本能力

全部来源

全部来源

5 / 5
媒体 / 基准方厂商自报

MiMo-V2.6-Flash 官方基准:30 步强化学习与 Agent 结果

厂商报告称,MiMo-V2.6-Flash 在 30 步、约 75 万条累计轨迹的 RL 训练后,DeepSWE v1.1 从 48.8 提升到 65.7;官方 Agent 基准表中,Flash 在 CyberGym 得分 95.1、Terminal Bench 2.1 得分 87.6、MiMo Visual Coding 得分 71.5。以上均为小米页面披露的结果,不是独立复测。

来源Xiaomi MiMo 官方文档
原文日期2026-09-22
采集2026-09-22
来源具体观察
厂商报告称,MiMo-V2.6-Flash 在 30 步、约 75 万条累计轨迹的 RL 训练后,DeepSWE v1.1 从 48.8 提升到 65.7;官方 Agent 基准表中,Flash 在 CyberGym 得分 95.1、Terminal Bench 2.1 得分 87.6、MiMo Visual Coding 得分 71.5。以上均为小米页面披露的结果,不是独立复测。
已公布条件
不能据此推断所有真实业务、不同提示词、不同工具链或不同推理参数下的表现;页面未给出每项基准的样本量、完整提示词、解码设置、随机种子、硬件配置或单项 harness 映射。
Agent能力
媒体 / 基准方厂商自报

MiMo-V2.6-Flash-RL Hugging Face 官方基准与部署边界

官方模型卡将 XiaomiMiMo/MiMo-V2.6-Flash-RL 定义为 MiMo-V2.6 系列的效率平衡 checkpoint,并报告其在代码、通用 Agent、网络安全和视觉 Agent 基准上的结果;但评测硬件、样本量、完整 harness、提示词和解码设置未公开,结果应视为厂商报告,不能直接外推到所有任务或独立复现实验。

来源Hugging Face
原文日期未知
采集2026-09-22
来源具体观察
官方模型卡将 XiaomiMiMo/MiMo-V2.6-Flash-RL 定义为 MiMo-V2.6 系列的效率平衡 checkpoint,并报告其在代码、通用 Agent、网络安全和视觉 Agent 基准上的结果;但评测硬件、样本量、完整 harness、提示词和解码设置未公开,结果应视为厂商报告,不能直接外推到所有任务或独立复现实验。
已公布条件
未列出的任务、不同 harness 或不同解码参数下的准确率、延迟、吞吐、成本和生产稳定性;表格中的跨模型比较也不能替代同条件独立测试。
编程能力
社区厂商自报

MiMo-V2.6-Flash 官方 X 发布线程:Flash 的基准定位与双模型策略

该官方帖将 MiMo-V2.6-Flash 定位为与 Pro 并列的全模态模型,强调扩展强化学习、代码/通用 Agent/网络安全/视觉 Agent 能力和开放复现;附图给出 Flash 的逐项基准分,但没有公开样本量、完整 harness、硬件、提示词或解码参数,因此这些数字只能作为厂商基线。

来源X(Twitter)
原文日期2026-09-21
采集2026-09-22
来源具体观察
该官方帖将 MiMo-V2.6-Flash 定位为与 Pro 并列的全模态模型,强调扩展强化学习、代码/通用 Agent/网络安全/视觉 Agent 能力和开放复现;附图给出 Flash 的逐项基准分,但没有公开样本量、完整 harness、硬件、提示词或解码参数,因此这些数字只能作为厂商基线。
已公布条件
真实业务成功率、延迟、吞吐、成本、稳定性,以及不同工具链或推理参数下的表现;也不能把 Pro 专属主张归给 Flash。
能力
媒体 / 基准方编辑分析

BenchLM:MiMo-V2.6-Flash 与 Pro 的同系列成本和公开基准对比

BenchLM 页面列出 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 的 12 条共享公开基准结果及三种固定 token 场景的估算成本:Flash 在 12 条结果中的 1 条 CyberGym 胜出,其余 11 条由 Pro 胜出;但两个模型在当前公开排名通道均未排名,页面明确不评总体质量胜者,因此这些结果不能改写为 Pro 或 Flash 的整体优胜结论。

来源BenchLM.ai
原文日期2026-09-21
采集2026-09-22
来源具体观察
BenchLM 页面列出 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 的 12 条共享公开基准结果及三种固定 token 场景的估算成本:Flash 在 12 条结果中的 1 条 CyberGym 胜出,其余 11 条由 Pro 胜出;但两个模型在当前公开排名通道均未排名,页面明确不评总体质量胜者,因此这些结果不能改写为 Pro 或 Flash 的整体优胜结论。
已公布条件
整体质量排名、未列任务、真实业务成功率、延迟、吞吐、稳定性,以及不同编辑器、harness、推理努力或提示词下的表现。页面也未给出 BenchLM 独立运行的样本量、原始输出或置信区间。
成本能力
社区个人体验

MiMo-V2.6-Flash:编译器与 GC 开发的 Reddit 一手反馈

一位 Reddit 用户称,自己已将确切写作 “MiMo V2.6 flash” 的模型用于编译器/GC 开发,未遇到工作障碍,并计划继续使用;但没有提供任务、环境、提示词、参数、样本量或客观指标,因此只能作为个人可用性信号。

来源Reddit,r/opencode
原文日期2026-09-21
采集2026-09-22
来源具体观察
一位 Reddit 用户称,自己已将确切写作 “MiMo V2.6 flash” 的模型用于编译器/GC 开发,未遇到工作障碍,并计划继续使用;但没有提供任务、环境、提示词、参数、样本量或客观指标,因此只能作为个人可用性信号。
已公布条件
不能据此推断通用编程能力、编译器正确率、GC 性能、吞吐、成本或大规模稳定性,也不能外推到 Pro、DeepSeek 或其他 MiMo 版本。
能力

MiMo-V2.6-Flash

在 Tabbit 中比较 MiMo-V2.6-Flash

客户端中的模型、功能和权限以当前账户为准。