Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

MiMo-V2.6-Pro · 媒体来源 · 厂商自报

小米 MiMo 官方发布:MiMo-V2.6-Pro 基准信号与原生全模态定位

小米官方把 MiMo-V2.6-Pro 定位为面向 Agent、代码、视觉与电脑操作的原生全模态开源模型,并自报 Artificial Analysis Intelligence Index 46 分及多项 RL/Agent 结果;这些数字仍是厂商发布口径,不能替代同一 harness 下的独立复测。

媒体来源厂商自报编辑日期 2026-09-22

测试条件速查

来源具体观察
小米官方把 MiMo-V2.6-Pro 定位为面向 Agent、代码、视觉与电脑操作的原生全模态开源模型,并自报 Artificial Analysis Intelligence Index 46 分及多项 RL/Agent 结果;这些数字仍是厂商发布口径,不能替代同一 harness 下的独立复测。
已公布条件
仅凭官方榜单决定生产上线;需要独立统计显著性、完整输入、随机种子和逐题日志的严谨对照;把案例演示或“可达到”描述当作稳定成功率。

关键数据与适用场景

一句话结论

小米官方把 MiMo-V2.6-Pro 定位为面向 Agent、代码、视觉与电脑操作的原生全模态开源模型,并自报 Artificial Analysis Intelligence Index 46 分及多项 RL/Agent 结果;这些数字仍是厂商发布口径,不能替代同一 harness 下的独立复测。

适用场景

  • 适合的任务:需要长程执行和工具调用的软件工程、漏洞复现、知识密集型工作、网页设计与开发;图像/视频/文本驱动的 3D 场景构建;Blender 建模;带视觉反馈的机器人控制;桌面办公和数据处理;材料研究、形式化证明,以及前端、PPT、视频和音乐创作。

  • 不适合的任务:仅凭官方榜单决定生产上线;需要独立统计显著性、完整输入、随机种子和逐题日志的严谨对照;把案例演示或“可达到”描述当作稳定成功率。

  • 适用的模型版本:mimo-v2.6-pro。官方同时列出 mimo-v2.6-flash;mimo-v2.6-pro-ultraspeed 是 API 中的高速模式标识,不应与基础 Pro 模型的测评结果混为一谈。

  • 适用的客户端、Agent 或 API:小米 MiMo API、MiMo Desktop,以及能够提供多模态输入、工具调用、浏览器/桌面或代码执行环境的 Agent harness。官方页面未给出一套可直接复用的完整工具 schema。

  • 推荐的推理档位和参数:官方发布页没有公开统一的 temperature、top-p、推理档位、token 上限、工具超时或随机种子;复测时应使用目标端点默认值并逐项记录,不能从本页推定推荐参数。

测试方法/工作流

这是一份厂商发布说明,不是独立重跑。按官方页面可核对的实验线索,建议按以下流程复现:

  1. 固定 API 模型 ID mimo-v2.6-pro、客户端版本、工具 schema、上下文上限、超时、采样参数和 harness;不要把 mimo-v2.6-pro-ultraspeed 的延迟表现并入基础模型结果。

  2. 在同一代码仓库和同一评分脚本上复跑 SWE-bench Verified、DeepSWE v1.1、Terminal Bench 2.1 等任务,同时保存逐题输出、通过率、工具调用次数、输入/输出 token、耗时和失败类型。

  3. 对官方所说的 Agent 能力,分别测代码、通用知识、视觉任务和 Cyber 任务;报告每个子集的样本量,而不是只报告“多数 Agent Benchmark 与某模型相当”。

  4. 对全模态能力做可复核任务:输入图像/视频/文本生成 3D 场景,执行 Blender 建模,使用多视角图像完成抓取与放置,完成桌面信息检索、编辑和数据处理;保存输入素材、工具轨迹、最终文件和人工验收结果。

  5. 对材料设计和 Lean 4 形式化等科研案例,记录检索来源、工具版本、每轮提示词、模型修改、编译/模拟日志和人工复核,不把官方案例描述转成未经验证的成功率。

  6. 与其他模型比较时,使用同一输入、同一工具、同一预算、同一评分规则;将厂商自报的 AA 分数、训练改进和成本单列,并标注“未独立复现”。

原始证据与数据

1. 官方定位与公开模型接口

  • 页面称 MiMo-V2.6 系列由 Pro 和 Flash 两个“原生全模态”模型组成,强调递归自我改进(RSI)和在可验证复杂任务上扩展强化学习(RL)。

  • 官方 API 说明要求使用全小写模型名:mimo-v2.6-pro、mimo-v2.6-flash 和 mimo-v2.6-pro-ultraspeed。

  • 页面将能力范围延伸到 3D 空间推理、多模态感知和 Computer Use Agent(CUA),并把自然语言编程扩展为面向交互世界构建的 “Vibe World”。这些是能力定位,不是统一基准分数。

2. 官方报告的基准与 RL 数据

指标或设置MiMo-V2.6-Pro 官方页面给出的信息证据边界
Artificial Analysis Intelligence Index(AA Composite Intelligence Index)46 分厂商发布页自报;页面称超过 Kimi K3 和 Qwen3.8 Max,但未在正文给出逐项输入、配置或独立核验日志
DeepSWE v1.1(长程软件工程、out-of-sample)58.4 → 72.6,约提升 14 分页面把它作为约 6 天、30 步 RL 训练后的变化;不能解释为仅替换模型带来的增益
RL 训练步数30 步页面称 Pro 与 Flash 各完成 30 步
累计轨迹约 750,000 条页面将两款模型合计描述为约 75 万条,没有给出 Pro/Flash 拆分
Pro RL 训练成本约 262 万美元厂商自报训练成本,不是单次推理成本或用户实际账单
Pro 训练任务平均 pass rate相对提升约 12%页面未给出任务清单、绝对基线、置信区间或逐任务结果
单次更新 batch size1,568 个样本官方训练设置描述;不等于推理时可用的上下文或 batch 配置
训练上下文长度支持 1M context这是训练设置描述,不能直接当作每个 API 端点的可用上下文承诺
每个训练 step 的 token 数约 3.5–3.7B官方训练设置描述

同一段官方说明还给出 Flash 的对照:DeepSWE v1.1 从 48.8 提升到 65.7(约 17 分),平均 pass rate 相对提升约 25%,训练成本约 85 万美元。该组数字用于解释官方 RL 叙述,不应当作为 Pro 的测评结果。

页面另称 MiMo-V2.6-Pro 在“多数 Agent Benchmarks”上与 Claude Opus 5 和 GPT-5.6 Sol 相当,但没有在正文列出这些 benchmark 的名称、分数、样本量或运行配置,故只能记录为官方定位,不能整理成可比的排行榜表格。

3. 全模态与 Agent 案例

  • 3D 开放世界:官方描述模型把图片、视频或文本需求拆为 3D 场景构建、交互逻辑编程和视觉验证等子任务,并依据渲染结果持续修正,最后生成可运行的交互世界。

  • Blender:官方称可根据文字或参考图进行物体和场景建模,生成可用于动画、3D 打印和游戏开发的资产。

  • 具身智能:官方称在仿真环境中接收多视角相机图像,通过视觉反馈闭环控制 Franka Panda 机械臂,完成抓取、颜色匹配和精确放置。

  • Computer Use Agent:官方称模型可以理解复杂 GUI,使用办公和生产力工具完成信息检索、编辑和数据处理,并依据视觉反馈检查结果、排查问题和调整后续动作。

  • 科研案例:官方展示了 PFAS 吸附目标的 MOF 材料设计与“干实验”筛选,以及 Li–Yorke “Period Three Implies Chaos”定理在 Lean 4 中的形式化。后者页面称最终生成超过 6,000 行 Lean 源码,并由 Lean kernel 验证、没有未证明占位符;这是官方案例陈述,不是公开盲测。

  • 内容创作:官方称在 Design Arena 上 Pro 与 Claude Opus 5、GPT-5.6 Sol 处于相当水平,并展示前端、PPT、视频、SVG、音乐等案例;正文没有提供 Design Arena 的分数和完整评测协议。

4. 开源资源与辅助基准

官方页面提供了权重、技术报告、RL 训练环境和代码的开源说明,并称包含 7k+ 高质量 RL 任务环境,覆盖软件工程、漏洞复现、知识密集型工作和网页设计开发四类 Agent 任务。

页面还报告从 MiMo-V2.6-Distill-Qwen-9B 的 SFT 基线开始,RL 在 11 个 benchmark 上均有改进,包括:SWE-bench Verified 61.1 → 66.2、MiMo Cyber Bench 31.3 → 47.0、Terminal Bench 2.1 37.1 → 52.8、MiMo Visual Coding 64.0 → 72.4。这些是 Distill-Qwen-9B 训练资源的辅助结果,不能当作 MiMo-V2.6-Pro 的直接得分。

适用边界

  • 厂商自报:AA 46 分、Agent benchmark 对标、DeepSWE 改进、训练成本、轨迹数、训练吞吐、Design Arena 定位及案例结果均来自 Xiaomi MiMo 发布页;本篇没有把它们表述为独立验证。

  • 缺少复现要件:正文没有公开每道题的输入、完整 system prompt、工具 schema、随机种子、评分脚本、失败样本、token/延迟日志和置信区间,因此不能从页面计算胜率、成本效率或统计显著性。

  • 训练增益的归因限制:DeepSWE 的 58.4→72.6 是 RL 训练前后官方流程中的变化,可能同时受数据、环境、grader、harness 和训练策略影响;不能归因于单一模型版本。

  • 上下文与 API 限制:1M context 是训练描述,不等于所有 API、Desktop 或 UltraSpeed 端点都开放 1M;实际端点应读取当前 API 文档并用超长输入验证。

  • 价格结论限制:页面称同等智能水平下 Pro 的价格约为海外模型的 1/20 至 1/60,但正文没有给出用于比较的完整价格表、模型集合、token 口径和时间窗口;该比例只能作为官方宣传口径。

  • 案例不等于稳定能力:3D、机器人、科研、形式化证明、视频和音乐案例缺乏统一样本与失败率;上线前应保留产物、日志和人工验收。

  • 版本边界:不要把 mimo-v2.6-pro-ultraspeed 的最高 20× 推理速度描述为 Pro 基础模型的质量提升,也不要把 Flash 或 Distill-Qwen-9B 的结果并入 Pro 分数。

来源摘录或观察

  • 页面明确写道,MiMo-V2.6-Pro 在 AA Composite Intelligence Index 中为 46 分,并声称超过 Kimi K3 与 Qwen3.8 Max;该句是本页最直接的公开排名证据。

  • 页面把 Pro 的 DeepSWE v1.1 结果写为 58.4 → 72.6,同时给出约 6 天、30 步 RL、约 262 万美元训练成本等背景;因此复核时应把“模型结果”和“训练流程结果”分开记录。

  • 页面以 “Vibe World” 概括从代码生成到交互世界构建的扩展,并列出 3D、Blender、机械臂和 CUA 案例;这些观察支持“原生全模态 + Agent 工作流”的产品定位,但不提供统一 pass rate。

  • 官方开源入口:https://huggingface.co/collections/XiaomiMiMo/mimo-v26。本篇的 benchmark 数字仍以发布页正文为准,未把该入口中可能更新的模型卡内容混入本来源。

能支持的判断

  • 需要长程执行和工具调用的软件工程、漏洞复现、知识密集型工作、网页设计与开发;图像/视频/文本驱动的 3D 场景构建;Blender 建模;带视觉反馈的机器人控制;桌面办公和数据处理;材料研究、形式化证明,以及前端、PPT、视频和音乐创作。

不能支持的判断

  • 仅凭官方榜单决定生产上线;需要独立统计显著性、完整输入、随机种子和逐题日志的严谨对照;把案例演示或“可达到”描述当作稳定成功率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Xiaomi MiMo Documentation · Xiaomi MiMo · 原文发布日期 2026-09-22 · 本站编辑日期 2026-09-22

打开原始来源

MiMo-V2.6-Pro

在 Tabbit 中比较 MiMo-V2.6-Pro

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Pro 测评:最聪明的开源模型,却让你等 18 秒

MiMo-V2.6-Pro 公开证据测评:真实任务成败实录、18 秒等待与思考账单、社区原声两极分化,以及按工作负载给出的选型裁决。

定价 · 简体中文

MiMo-V2.6-Pro 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Pro 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、思考 Token 增量、UltraSpeed 极速模式及实际任务预算测算。

替代品 · 简体中文

MiMo-V2.6-Pro 替代品:按任务和预算选模型

用完成任务的真实成本、agent 可靠性、开源权重和部署条件,横向评估五个 MiMo-V2.6-Pro 替代方案,价格核对时间为 2026 年 9 月 22 日。

模型对比 · 简体中文

MiMo-V2.6-Pro 对比 MiMo-V2.6-Flash:小米 MoE 模型选型深度评测

深度实测小米 MiMo-V2.6-Pro 与 Flash:1.02T 对比 309B MoE 架构、3.1 倍 API 费率差异、前缀缓存经济学、长程 Agent 基准与场景选型决策矩阵。

相关评测

MiMo-V2.6-Pro 官方技术报告:架构、规模化 RL 与评测条件这份官方报告把 MiMo-V2.6-Pro 定义为 1.02T 总参数、约 42B 激活参数的原生全模态稀疏 MoE,并用大批量、多环境、多 harness 和 groupwise grader 的 RL 训练获得较强 Agent 基准成绩;但表中大部分数字是厂商自报,公开信息仍不足以独立复现每个 benchmark。MiMo-V2.6-Pro 官方 X 发布线程:任务定位、公开基准与开源入口这条官方线程把 MiMo-V2.6-Pro 定位为公开构建的原生全模态 Agent 模型,重点覆盖代码、计算机使用、3D、设计、科研和工具工作流;线程中的榜单与案例能帮助筛选任务方向,但仍是厂商口径,不能替代同一 harness 下的独立复测。Arena Code Arena:MiMo-V2.6-Pro 的 WebDev AutoEval 记录Arena 的 Code Arena | WebDev 总榜已收录 mimo-v2.6-pro,显示 AutoEval 分数 1628(+18/-18),但没有公开投票数或名次,因此只能说明它进入了 WebDev 自动评测榜,不能把 1628 当作盲投排名。Reddit 实测:MiMo-V2.6-Pro 在 UI/UX 终端修改任务中陷入 grep 无限循环在一项真实网站 UI/UX 修改任务中,发帖人称 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 都在终端触发与 grep 相关的无限循环,约 30 分钟没有修复代码;同一修改交给 DeepSeek V4.1 Flash 后则持续推进并完整输出终端工作记录。小米 MiMo-V2.6-Pro 全模态输入与视觉任务工作流mimo-v2.6-pro 可通过 OpenAI Chat Completions API 读取公网 URL 或符合格式的 Base64 图像、视频和音频,但不能直接上传本地文件,媒体和文本总 Token 仍受 1M 上下文限制。小米 MiMo-V2.6-Pro 官方 API 接入与推理配置这份官方配置可直接用于通过 OpenAI 兼容协议接入 mimo-v2.6-pro,并按任务需要选择深度思考、流式输出和多轮工具调用。Hugging Face 官方 MiMo-V2.6-Pro-RL 本地部署与聊天模板配置官方模型卡已经给出 MiMo-V2.6-Pro-RL 的 SGLang 与 vLLM 服务命令,并在仓库 tokenizer 配置中定义了文本、图像、视频、音频、思考和工具调用的聊天模板;本地部署应使用 checkpoint 名称,不能把它与托管 API 的 mimo-v2.6-pro 当成同一个模型标识。小米 MiMo-V2.6-Pro 官方函数调用与多轮 Agent 工作流对 mimo-v2.6-pro,官方工作流是“模型返回完整 assistant(包括 reasoning_content 和 tool_calls)→ 客户端执行工具 → 追加 role: tool 结果 → 再请求模型”,直到本轮不再产生工具调用。