Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

MiMo-V2.6-Flash · 媒体来源 · 编辑分析

BenchLM:MiMo-V2.6-Flash 与 Pro 的同系列成本和公开基准对比

BenchLM 页面列出 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 的 12 条共享公开基准结果及三种固定 token 场景的估算成本:Flash 在 12 条结果中的 1 条 CyberGym 胜出,其余 11 条由 Pro 胜出;但两个模型在当前公开排名通道均未排名,页面明确不评总体质量胜者,因此这些结果不能改写为 Pro 或 Flash 的整体优胜结论。

媒体来源编辑分析编辑日期 2026-09-22

测试条件速查

来源具体观察
BenchLM 页面列出 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 的 12 条共享公开基准结果及三种固定 token 场景的估算成本:Flash 在 12 条结果中的 1 条 CyberGym 胜出,其余 11 条由 Pro 胜出;但两个模型在当前公开排名通道均未排名,页面明确不评总体质量胜者,因此这些结果不能改写为 Pro 或 Flash 的整体优胜结论。
已公布条件
整体质量排名、未列任务、真实业务成功率、延迟、吞吐、稳定性,以及不同编辑器、harness、推理努力或提示词下的表现。页面也未给出 BenchLM 独立运行的样本量、原始输出或置信区间。

关键数据与适用场景

一句话结论

BenchLM 页面列出 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro 的 12 条共享公开基准结果及三种固定 token 场景的估算成本:Flash 在 12 条结果中的 1 条 CyberGym 胜出,其余 11 条由 Pro 胜出;但两个模型在当前公开排名通道均未排名,页面明确不评总体质量胜者,因此这些结果不能改写为 Pro 或 Flash 的整体优胜结论。

适用场景

  • 适合判断的任务:在同一 BenchLM 页面快照中查看两款同系列模型的公开基准覆盖、逐项分数、上下文规格和固定 token 用量下的成本差异。

  • 不适合外推的任务:整体质量排名、未列任务、真实业务成功率、延迟、吞吐、稳定性,以及不同编辑器、harness、推理努力或提示词下的表现。页面也未给出 BenchLM 独立运行的样本量、原始输出或置信区间。

  • 适用的模型版本:页面只比较 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro;没有把 MiMo-V2.6-Flash-RL、旧版 MiMo、MiMo-V2.5-Pro 或其他型号混入本页数据。

  • 测试环境或客户端:BenchLM.ai 比较页;基准行的共享来源均链接 Xiaomi MiMo-V2.6 technical report。具体 API 客户端、硬件、操作系统、运行器和 harness 未注明。

  • 推理档位和参数:两款模型的页面规格均为 Reasoning;基准推理参数、提示词、采样设置和 effort 未注明。

测评方法

BenchLM 的页面快照更新时间为 2026-09-21,数据生成日期为 2026-09-21;公开数据接口标示的方法版本为 bench-align-v5.5-2026-09-04。页面的比较规则如下:

  • 模型卡顶层分数、公开排名、90% 区间和证据状态均显示不可用(—、Evidence status unavailable、90% interval unavailable);因此页面写明“至少一个模型未在当前公开排名通道评分”,并不命名总体质量胜者。

  • 共有 12 条共享结果,Flash-only 和 Pro-only 均为 0;“like-for-like categories”为 0/8。这里的 12 按公开结果账本的行计,Terminal-Bench 2.1 在 Agentic 与 Coding 两个分类各出现一行。

  • Agentic、Coding、Knowledge 使用 BenchAlign lane;其余分类使用 provisional/weighted public rows。只有双方分数都基于 Supported evidence 或同一 weighted set 时才算 like-for-like;方向性或不可比较的行不产生胜者。

  • 页面说明排名中的未排名分数只能保留在 lane 的尺度上,不能命名胜者;like-for-like 行相差不超过 0.5 分时按实务规则视为平手。本页八个分类均为 Not ranked / Not comparable。

  • 12 条原始行均标注 Shared source,链接到同一份 https://huggingface.co/XiaomiMiMo/MiMo-V2.6-Pro-RL/blob/main/MiMo_V2_6_technical_report.pdf。这证明页面附有公开来源,不等于 BenchLM 在本页披露了独立复测过程。

关键结果

成本场景

页面使用三种固定 token mix,将“列出的标准 API rates”换算为单次估算成本;每个场景都显示“Fits in one request”。

场景Token 假设MiMo-V2.6-FlashMiMo-V2.6-Pro页面读取
Chat turn1K fresh input + 500 output$0.00028$0.00087Flash 较低,listed-rates
Repository review50K fresh input + 3K output$0.00784$0.02436Flash 较低
Cache-heavy agent loop200K cached + 20K fresh input + 10K output$0.00616$0.01812Flash 较低

页面规格区列出的缓存输入价为:Flash $0.0028 / 1M cached input tokens,Pro $0.0036 / 1M cached input tokens。比较正文没有单独展示 fresh-input/output 单价;由三组页面金额可算出与其一致的标准价:

Flash: 1K×$0.14/M + 500×$0.28/M = $0.00028
Pro:   1K×$0.435/M + 500×$0.87/M = $0.00087

Flash cache loop = 200K×$0.0028/M + 20K×$0.14/M + 10K×$0.28/M = $0.00616
Pro cache loop   = 200K×$0.0036/M + 20K×$0.435/M + 10K×$0.87/M = $0.01812

以上 fresh/output 单价是对页面已显示金额的算术反推,不是页面另行列出的价格,也不是独立价格核验。页面规定:缺少缓存输入价时,估算才回退到已公布的普通输入价;本页两款模型均列出了缓存输入价。

共享公开基准行

页面原始结果账本中的数值如下。百分比保留页面显示格式;“胜出”是页面逐行标签,不代表总体排名。

分类基准MiMo-V2.6-FlashMiMo-V2.6-Pro页面逐行标签
AgenticToolathlon-Verified73.6%76.9%Pro leads
AgenticAutomationBench52.3%53.1%Pro leads
AgenticAgents’ Last Exam27.6%31.6%Pro leads
AgenticTerminal-Bench 4.028.80%34.90%Pro leads
AgenticTerminal-Bench 2.187.6%89.9%Pro leads
AgenticOSWorld-Verified80.8%82%Pro leads
AgenticJobBench61.2%62.0%Pro leads
AgenticCyberGym95.1%94.0%Flash leads
AgenticExploitGym6.0%17.8%Pro leads
CodingDeepSWE67.9%71.9%Pro leads
CodingProgramBench26.0%26.5%Pro leads
CodingTerminal-Bench 2.187.6%89.9%Pro leads

分类聚合状态与规格

分类BenchLM laneFlashPro页面状态
AgenticBenchAlignNot rankedNot rankedNot comparable;9 vs 9 public rows
CodingBenchAlignNot rankedNot rankedNot comparable;3 vs 3 public rows
ReasoningProvisionalNot rankedNot rankedNot comparable;0 vs 0 weighted rows
MultimodalProvisionalNot rankedNot rankedNot comparable;0 vs 0 weighted rows
KnowledgeBenchAlignNot rankedNot rankedNot comparable;0 vs 0 public rows
MultilingualProvisionalNot rankedNot rankedNot comparable;0 vs 0 weighted rows
Instruction followingProvisionalNot rankedNot rankedNot comparable;0 vs 0 weighted rows
MathProvisionalNot rankedNot rankedNot comparable;0 vs 0 weighted rows

两款模型的规格差异(页面来源均显示为 Xiaomi MiMo-V2.6 launch):

规格MiMo-V2.6-FlashMiMo-V2.6-Pro
最大文档上下文1M1M
API model IDNot sourcedNot sourced
缓存输入价$0.0028 / 1M$0.0036 / 1M
已文档化输入Not sourcedNot sourced
已文档化输出Not sourcedNot sourced
Provider availabilityNot sourcedNot sourced
Reasoning profileReasoningReasoning
Weight accessOpen WeightOpen Weight
LicenseOpen WeightOpen Weight
Release date2026-09-222026-09-22

页面注明 1M 是最大文档化上下文,实际输出 token 上限可能更低;Weight access 与 License 的页面值均为 Open Weight,不应据此补写具体许可证名称。

原始数据

  • 页面决策文本:至少一个模型未在当前公开排名通道评分,因此“不命名总体质量胜者”;分类行若基于 Estimated evidence 或不同基准集,只作方向性参考,也不命名胜者。

  • 证据计数:12 Shared、MiMo-V2.6-Flash only 0、MiMo-V2.6-Pro only 0、Like-for-like categories 0 / 8。

  • 共享证据形状:页面只绘制两个共同结果:OSWorld-Verified(Flash 80.8%、Pro 82%,normalized gap 1.2)和 AutomationBench(Flash 52.3%、Pro 53.1%,normalized gap 0.8);因匹配分类轴过少,不生成 radar。

  • 来源属性:API 数据返回 attribution: Data from BenchLM.ai;每条原始基准行的 source label 为 Xiaomi MiMo-V2.6 technical report。

  • 单页模型卡状态:两款模型的 score、publicRank、interval90、evidenceStatus 均为 null;页面可见文本分别为 —、Evidence status unavailable、90% interval unavailable。

  • 页面更新边界:页面在 2026-09-21 更新,页面页脚同样写 Last updated September 21, 2026;本文采集日为 2026-09-22,属于该日期的动态排行榜快照。

结论与边界

  • 成本:在页面给定的 1K/500、50K/3K、200K/20K/10K 三种 token 假设下,Flash 的估算金额均低于 Pro;这是按 listed-rates 的模型化成本,不是实际账单、吞吐或延迟测量。

  • 逐项结果:12 条共享行中,Flash 只有 CyberGym(95.1% 对 94.0%)被页面标为领先;其余 11 条由 Pro 领先。Terminal-Bench 2.1 的重复行是分类账本设计,不应重复计为两个独立实验。

  • 总体结论限制:BenchLM 明确不为该组合命名总体质量胜者;不要把逐行标签、成本优势或 12 行的简单计数改写为“Pro 整体更强”或“Flash 性价比整体更高”。

  • 证据性质:公开表格的来源是 Xiaomi MiMo-V2.6 technical report,BenchLM 页未披露独立运行的样本量、提示词、硬件、解码参数、重复次数、失败样本、评分脚本或置信区间。故本文将其写作公开来源结果/BenchLM 页面整理,不称为已独立复测。

  • 可比性限制:页面称 Agentic、Coding、Knowledge 使用 BenchAlign lane,其余使用 provisional/weighted rows;本页 0/8 like-for-like,八个分类均不可比较。分类分数缺失不表示 0 分。

  • 成本限制:页面没有在正文单独列出 fresh/output 价格;本文反推的 $0.14/$0.28 与 $0.435/$0.87 只用于解释页面金额,不能替代官方价格页。缓存、输入输出 token 的实际计费规则和上下文截断也未在本页完整披露。

  • 规格限制:API model ID、文档化输入/输出、provider availability 均未注明;1M 只表示最大文档上下文,输出上限可能更低。

  • 版本边界:本文只记录 MiMo-V2.6-Flash 与 MiMo-V2.6-Pro。不把旧版 MiMo、MiMo-V2.6-Flash-RL、MiMo-V2.5-Pro 或任何其他页面/模型的分数、价格和体验并入本页。

复现说明

  1. 打开 https://benchlm.ai/compare/mimo-v2-6-flash-vs-mimo-v2-6-pro,确认页面更新时间、决策文本、12 条共享结果和“0/8 like-for-like categories”。

  2. 展开 Browse raw public benchmark evidence,按 Agentic/Coding 分类抄录 12 行;保留页面的百分号和 Terminal-Bench 2.1 的两次分类出现。

  3. 按页面三个固定 token mix 复算成本;缓存输入使用页面列出的 $0.0028/M(Flash)和 $0.0036/M(Pro)。fresh/output 单价若采用本文反推值,必须标注为从页面金额反推,不要写成页面直接披露。

  4. 如需独立复测,应另行记录精确模型 ID、API 或本地部署方式、客户端、硬件、harness、提示词、推理 effort、采样参数、样本量、评分脚本、失败样本和运行日期;BenchLM 页面本身没有提供这些字段。

  5. 不把本页公开来源表格当作 Flash 与 Pro 的总体排名,也不把页面的 listed-rates 估算当作实际生产成本或独立性能测量。

能支持的判断

  • 在同一 BenchLM 页面快照中查看两款同系列模型的公开基准覆盖、逐项分数、上下文规格和固定 token 用量下的成本差异。

不能支持的判断

  • 整体质量排名、未列任务、真实业务成功率、延迟、吞吐、稳定性,以及不同编辑器、harness、推理努力或提示词下的表现。页面也未给出 BenchLM 独立运行的样本量、原始输出或置信区间。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

BenchLM.ai · 未注明(页面署名为 BenchLM.ai 数据) · 原文发布日期 2026-09-21 · 本站编辑日期 2026-09-22

打开原始来源

MiMo-V2.6-Flash

在 Tabbit 中比较 MiMo-V2.6-Flash

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Flash 深度测评:高吞吐自动化主力,长程规划的有条件升级

基于公开实证与技术基准对小米 MiMo-V2.6-Flash 的深度测评:解析 15B 激活 MoE 吞吐、基准局限、长程纠错悬崖、计费机制与工作负载选型。

定价 · 简体中文

MiMo-V2.6-Flash 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Flash 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、MoE 高吞吐架构与大规模任务预算测算。

模型对比 · 简体中文

MiMo-V2.6-Pro 对比 MiMo-V2.6-Flash:小米 MoE 模型选型深度评测

深度实测小米 MiMo-V2.6-Pro 与 Flash:1.02T 对比 309B MoE 架构、3.1 倍 API 费率差异、前缀缓存经济学、长程 Agent 基准与场景选型决策矩阵。

相关评测

MiMo-V2.6-Flash 官方基准:30 步强化学习与 Agent 结果厂商报告称,MiMo-V2.6-Flash 在 30 步、约 75 万条累计轨迹的 RL 训练后,DeepSWE v1.1 从 48.8 提升到 65.7;官方 Agent 基准表中,Flash 在 CyberGym 得分 95.1、Terminal Bench 2.1 得分 87.6、MiMo Visual Coding 得分 71.5。以上均为小米页面披露的结果,不是独立复测。MiMo-V2.6-Flash-RL Hugging Face 官方基准与部署边界官方模型卡将 XiaomiMiMo/MiMo-V2.6-Flash-RL 定义为 MiMo-V2.6 系列的效率平衡 checkpoint,并报告其在代码、通用 Agent、网络安全和视觉 Agent 基准上的结果;但评测硬件、样本量、完整 harness、提示词和解码设置未公开,结果应视为厂商报告,不能直接外推到所有任务或独立复现实验。MiMo-V2.6-Flash 官方 X 发布线程:Flash 的基准定位与双模型策略该官方帖将 MiMo-V2.6-Flash 定位为与 Pro 并列的全模态模型,强调扩展强化学习、代码/通用 Agent/网络安全/视觉 Agent 能力和开放复现;附图给出 Flash 的逐项基准分,但没有公开样本量、完整 harness、硬件、提示词或解码参数,因此这些数字只能作为厂商基线。MiMo-V2.6-Flash:编译器与 GC 开发的 Reddit 一手反馈一位 Reddit 用户称,自己已将确切写作 “MiMo V2.6 flash” 的模型用于编译器/GC 开发,未遇到工作障碍,并计划继续使用;但没有提供任务、环境、提示词、参数、样本量或客观指标,因此只能作为个人可用性信号。MiMo-V2.6-Flash Web Search 工具调用工作流对 mimo-v2.6-flash,先在 MiMo Console 启用 Web Search Plugin,再通过 OpenAI Chat Completions 的 web_search 工具调用;需要实时信息时可用 force_search: true,用 max_keyword 控制单轮并发关键词数与潜在调用成本。MiMo-V2.6-Flash 深度思考配置与多轮工具调用工作流mimo-v2.6-flash 支持用 thinking.type 开关深度思考,默认开启;启用后不要自定义 temperature 或 top_p,并在多轮工具调用中完整回传历史 assistant 消息的 reasoning_content。MiMo-V2.6-Flash 结构化输出:JSON 模式配置与校验工作流官方文档将 mimo-v2.6-flash 列为 JSON mode 支持型号;调用时设置 response_format={"type": "json_object"},并在 system 或 user message 中明确要求仅返回 JSON、完整定义字段/层级/类型。该模式只保证 JSON 语法,不保证业务结构,生产环境仍应做 JSON Schema 校验。MiMo-V2.6-Flash 图像理解输入与多图工作流官方文档将 mimo-v2.6-flash 列为图像理解支持型号,可通过公开 URL 或 Base64 传入图片,并支持多图比较;文档没有提供 Flash 专属响应,因此不能把页面中的 Pro 示例输出、token 使用量或效果外推到 Flash。