MiMo-V2.6-Flash · 媒体来源 · 编辑分析
BenchLM 页面列出 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 的 12 条共享公开基准结果及三种固定 token 场景的估算成本:Flash 在 12 条结果中的 1 条 CyberGym 胜出,其余 11 条由 Pro 胜出;但两个模型在当前公开排名通道均未排名,页面明确不评总体质量胜者,因此这些结果不能改写为 Pro 或 Flash 的整体优胜结论。
BenchLM 页面列出 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 的 12 条共享公开基准结果及三种固定 token 场景的估算成本:Flash 在 12 条结果中的 1 条 CyberGym 胜出,其余 11 条由 Pro 胜出;但两个模型在当前公开排名通道均未排名,页面明确不评总体质量胜者,因此这些结果不能改写为 Pro 或 Flash 的整体优胜结论。
适合判断的任务:在同一 BenchLM 页面快照中查看两款同系列模型的公开基准覆盖、逐项分数、上下文规格和固定 token 用量下的成本差异。
不适合外推的任务:整体质量排名、未列任务、真实业务成功率、延迟、吞吐、稳定性,以及不同编辑器、harness、推理努力或提示词下的表现。页面也未给出 BenchLM 独立运行的样本量、原始输出或置信区间。
适用的模型版本:页面只比较 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro;没有把 MiMo-V2.6-Flash-RL、旧版 MiMo、MiMo-V2.5-Pro 或其他型号混入本页数据。
测试环境或客户端:BenchLM.ai 比较页;基准行的共享来源均链接 Xiaomi MiMo-V2.6 technical report。具体 API 客户端、硬件、操作系统、运行器和 harness 未注明。
推理档位和参数:两款模型的页面规格均为 Reasoning;基准推理参数、提示词、采样设置和 effort 未注明。
BenchLM 的页面快照更新时间为 2026-09-21,数据生成日期为 2026-09-21;公开数据接口标示的方法版本为 bench-align-v5.5-2026-09-04。页面的比较规则如下:
模型卡顶层分数、公开排名、90% 区间和证据状态均显示不可用(—、Evidence status unavailable、90% interval unavailable);因此页面写明“至少一个模型未在当前公开排名通道评分”,并不命名总体质量胜者。
共有 12 条共享结果,Flash-only 和 Pro-only 均为 0;“like-for-like categories”为 0/8。这里的 12 按公开结果账本的行计,Terminal-Bench 2.1 在 Agentic 与 Coding 两个分类各出现一行。
Agentic、Coding、Knowledge 使用 BenchAlign lane;其余分类使用 provisional/weighted public rows。只有双方分数都基于 Supported evidence 或同一 weighted set 时才算 like-for-like;方向性或不可比较的行不产生胜者。
页面说明排名中的未排名分数只能保留在 lane 的尺度上,不能命名胜者;like-for-like 行相差不超过 0.5 分时按实务规则视为平手。本页八个分类均为 Not ranked / Not comparable。
12 条原始行均标注 Shared source,链接到同一份 https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf。这证明页面附有公开来源,不等于 BenchLM 在本页披露了独立复测过程。
页面使用三种固定 token mix,将“列出的标准 API rates”换算为单次估算成本;每个场景都显示“Fits in one request”。
| 场景 | Token 假设 | MiMo-V2.6-Flash | MiMo-V2.6-Pro | 页面读取 |
|---|---|---|---|---|
| Chat turn | 1K fresh input + 500 output | $0.00028 | $0.00087 | Flash 较低,listed-rates |
| Repository review | 50K fresh input + 3K output | $0.00784 | $0.02436 | Flash 较低 |
| Cache-heavy agent loop | 200K cached + 20K fresh input + 10K output | $0.00616 | $0.01812 | Flash 较低 |
页面规格区列出的缓存输入价为:Flash $0.0028 / 1M cached input tokens,Pro $0.0036 / 1M cached input tokens。比较正文没有单独展示 fresh-input/output 单价;由三组页面金额可算出与其一致的标准价:
Flash: 1K×$0.14/M + 500×$0.28/M = $0.00028
Pro: 1K×$0.435/M + 500×$0.87/M = $0.00087
Flash cache loop = 200K×$0.0028/M + 20K×$0.14/M + 10K×$0.28/M = $0.00616
Pro cache loop = 200K×$0.0036/M + 20K×$0.435/M + 10K×$0.87/M = $0.01812以上 fresh/output 单价是对页面已显示金额的算术反推,不是页面另行列出的价格,也不是独立价格核验。页面规定:缺少缓存输入价时,估算才回退到已公布的普通输入价;本页两款模型均列出了缓存输入价。
页面原始结果账本中的数值如下。百分比保留页面显示格式;“胜出”是页面逐行标签,不代表总体排名。
| 分类 | 基准 | MiMo-V2.6-Flash | MiMo-V2.6-Pro | 页面逐行标签 |
|---|---|---|---|---|
| Agentic | Toolathlon-Verified | 73.6% | 76.9% | Pro leads |
| Agentic | AutomationBench | 52.3% | 53.1% | Pro leads |
| Agentic | Agents’ Last Exam | 27.6% | 31.6% | Pro leads |
| Agentic | Terminal-Bench 4.0 | 28.80% | 34.90% | Pro leads |
| Agentic | Terminal-Bench 2.1 | 87.6% | 89.9% | Pro leads |
| Agentic | OSWorld-Verified | 80.8% | 82% | Pro leads |
| Agentic | JobBench | 61.2% | 62.0% | Pro leads |
| Agentic | CyberGym | 95.1% | 94.0% | Flash leads |
| Agentic | ExploitGym | 6.0% | 17.8% | Pro leads |
| Coding | DeepSWE | 67.9% | 71.9% | Pro leads |
| Coding | ProgramBench | 26.0% | 26.5% | Pro leads |
| Coding | Terminal-Bench 2.1 | 87.6% | 89.9% | Pro leads |
| 分类 | BenchLM lane | Flash | Pro | 页面状态 |
|---|---|---|---|---|
| Agentic | BenchAlign | Not ranked | Not ranked | Not comparable;9 vs 9 public rows |
| Coding | BenchAlign | Not ranked | Not ranked | Not comparable;3 vs 3 public rows |
| Reasoning | Provisional | Not ranked | Not ranked | Not comparable;0 vs 0 weighted rows |
| Multimodal | Provisional | Not ranked | Not ranked | Not comparable;0 vs 0 weighted rows |
| Knowledge | BenchAlign | Not ranked | Not ranked | Not comparable;0 vs 0 public rows |
| Multilingual | Provisional | Not ranked | Not ranked | Not comparable;0 vs 0 weighted rows |
| Instruction following | Provisional | Not ranked | Not ranked | Not comparable;0 vs 0 weighted rows |
| Math | Provisional | Not ranked | Not ranked | Not comparable;0 vs 0 weighted rows |
两款模型的规格差异(页面来源均显示为 Xiaomi MiMo-V2.6 launch):
| 规格 | MiMo-V2.6-Flash | MiMo-V2.6-Pro |
|---|---|---|
| 最大文档上下文 | 1M | 1M |
| API model ID | Not sourced | Not sourced |
| 缓存输入价 | $0.0028 / 1M | $0.0036 / 1M |
| 已文档化输入 | Not sourced | Not sourced |
| 已文档化输出 | Not sourced | Not sourced |
| Provider availability | Not sourced | Not sourced |
| Reasoning profile | Reasoning | Reasoning |
| Weight access | Open Weight | Open Weight |
| License | Open Weight | Open Weight |
| Release date | 2026-09-22 | 2026-09-22 |
页面注明 1M 是最大文档化上下文,实际输出 token 上限可能更低;Weight access 与 License 的页面值均为 Open Weight,不应据此补写具体许可证名称。
页面决策文本:至少一个模型未在当前公开排名通道评分,因此“不命名总体质量胜者”;分类行若基于 Estimated evidence 或不同基准集,只作方向性参考,也不命名胜者。
证据计数:12 Shared、MiMo-V2.6-Flash only 0、MiMo-V2.6-Pro only 0、Like-for-like categories 0 / 8。
共享证据形状:页面只绘制两个共同结果:OSWorld-Verified(Flash 80.8%、Pro 82%,normalized gap 1.2)和 AutomationBench(Flash 52.3%、Pro 53.1%,normalized gap 0.8);因匹配分类轴过少,不生成 radar。
来源属性:API 数据返回 attribution: Data from BenchLM.ai;每条原始基准行的 source label 为 Xiaomi MiMo-V2.6 technical report。
单页模型卡状态:两款模型的 score、publicRank、interval90、evidenceStatus 均为 null;页面可见文本分别为 —、Evidence status unavailable、90% interval unavailable。
页面更新边界:页面在 2026-09-21 更新,页面页脚同样写 Last updated September 21, 2026;本文采集日为 2026-09-22,属于该日期的动态排行榜快照。
成本:在页面给定的 1K/500、50K/3K、200K/20K/10K 三种 token 假设下,Flash 的估算金额均低于 Pro;这是按 listed-rates 的模型化成本,不是实际账单、吞吐或延迟测量。
逐项结果:12 条共享行中,Flash 只有 CyberGym(95.1% 对 94.0%)被页面标为领先;其余 11 条由 Pro 领先。Terminal-Bench 2.1 的重复行是分类账本设计,不应重复计为两个独立实验。
总体结论限制:BenchLM 明确不为该组合命名总体质量胜者;不要把逐行标签、成本优势或 12 行的简单计数改写为“Pro 整体更强”或“Flash 性价比整体更高”。
证据性质:公开表格的来源是 Xiaomi MiMo-V2.6 technical report,BenchLM 页未披露独立运行的样本量、提示词、硬件、解码参数、重复次数、失败样本、评分脚本或置信区间。故本文将其写作公开来源结果/BenchLM 页面整理,不称为已独立复测。
可比性限制:页面称 Agentic、Coding、Knowledge 使用 BenchAlign lane,其余使用 provisional/weighted rows;本页 0/8 like-for-like,八个分类均不可比较。分类分数缺失不表示 0 分。
成本限制:页面没有在正文单独列出 fresh/output 价格;本文反推的 $0.14/$0.28 与 $0.435/$0.87 只用于解释页面金额,不能替代官方价格页。缓存、输入输出 token 的实际计费规则和上下文截断也未在本页完整披露。
规格限制:API model ID、文档化输入/输出、provider availability 均未注明;1M 只表示最大文档上下文,输出上限可能更低。
版本边界:本文只记录 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro。不把旧版 MiMo、MiMo-V2.6-Flash-RL、MiMo-V2.5-Pro 或任何其他页面/模型的分数、价格和体验并入本页。
打开 https://benchlm.ai/compare/mimo-v2-6-flash-vs-mimo-v2-6-pro,确认页面更新时间、决策文本、12 条共享结果和“0/8 like-for-like categories”。
展开 Browse raw public benchmark evidence,按 Agentic/Coding 分类抄录 12 行;保留页面的百分号和 Terminal-Bench 2.1 的两次分类出现。
按页面三个固定 token mix 复算成本;缓存输入使用页面列出的 $0.0028/M(Flash)和 $0.0036/M(Pro)。fresh/output 单价若采用本文反推值,必须标注为从页面金额反推,不要写成页面直接披露。
如需独立复测,应另行记录精确模型 ID、API 或本地部署方式、客户端、硬件、harness、提示词、推理 effort、采样参数、样本量、评分脚本、失败样本和运行日期;BenchLM 页面本身没有提供这些字段。
不把本页公开来源表格当作 Flash 与 Pro 的总体排名,也不把页面的 listed-rates 估算当作实际生产成本或独立性能测量。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
BenchLM.ai · 未注明(页面署名为 BenchLM.ai 数据) · 原文发布日期 2026-09-21 · 本站编辑日期 2026-09-22
打开原始来源MiMo-V2.6-Flash
下载 Tabbit 客户端后检查模型可用性