Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

MiMo-V2.6-Pro · 社区来源 · 厂商自报

MiMo-V2.6-Pro 官方 X 发布线程:任务定位、公开基准与开源入口

这条官方线程把 MiMo-V2.6-Pro 定位为公开构建的原生全模态 Agent 模型,重点覆盖代码、计算机使用、3D、设计、科研和工具工作流;线程中的榜单与案例能帮助筛选任务方向,但仍是厂商口径,不能替代同一 harness 下的独立复测。

社区来源厂商自报编辑日期 2026-09-22

测试条件速查

来源具体观察
这条官方线程把 MiMo-V2.6-Pro 定位为公开构建的原生全模态 Agent 模型,重点覆盖代码、计算机使用、3D、设计、科研和工具工作流;线程中的榜单与案例能帮助筛选任务方向,但仍是厂商口径,不能替代同一 harness 下的独立复测。
已公布条件
仅依据本线程宣称的“相当于”或价格比例做上线决策;需要逐题输入、完整工具 schema、随机种子、失败日志和统计显著性的严格比较;把一次官方案例当作稳定成功率。

关键数据与适用场景

一句话结论

这条官方线程把 MiMo-V2.6-Pro 定位为公开构建的原生全模态 Agent 模型,重点覆盖代码、计算机使用、3D、设计、科研和工具工作流;线程中的榜单与案例能帮助筛选任务方向,但仍是厂商口径,不能替代同一 harness 下的独立复测。

适用场景

  • 适合的任务:长程软件工程和工具调用;图像、视频或文本驱动的 3D 场景;Blender 建模;桌面搜索、编辑和数据处理;视觉反馈下的具身仿真;前端、演示文稿、SVG、视频和音乐创作;材料研究与 Lean 4 形式化证明。

  • 不适合的任务:仅依据本线程宣称的“相当于”或价格比例做上线决策;需要逐题输入、完整工具 schema、随机种子、失败日志和统计显著性的严格比较;把一次官方案例当作稳定成功率。

  • 适用的模型版本:mimo-v2.6-pro。线程同时提到 mimo-v2.6-flash;mimo-v2.6-pro-ultraspeed 是速度模式,不能把它的延迟指标并入基础 Pro 的质量测评。

  • 适用的客户端、Agent 或 API:MiMo API、MiMo Desktop,以及能够提供多模态输入、代码执行、浏览器/桌面控制或其他工具的 Agent harness。官方线程还给出 API、Desktop 和 Hugging Face 入口。

  • 推荐的推理档位和参数:官方没有在该线程或发布页给出统一的 temperature、top-p、推理档位、随机种子、工具超时或 token 配置;复测应锁定目标端点默认值并完整记录,不能从本来源推断推荐参数。

官方线程内容

1. 模型定位与价格信号

主帖介绍 Pro 与 Flash 两个原生全模态模型,称模型通过扩展强化学习推进能力,并把 Pro 描述为在多数 Agent 基准上可与 Claude Opus 5、GPT-5.6 Sol 对比。主帖还引用 Artificial Analysis Intelligence Index 的 46 分,称其为开源模型最高分。

可见后续帖补充了成本口径:Pro 与 Flash 的 API 价格沿用 V2.5;在官方认为“智能水平相当”的比较中,Pro 成本约为领先国际模型的 1/20–1/60。线程没有给出参与比较的完整模型集合、价格时间点、输入/输出 token 口径或 Artificial Analysis 的逐项运行配置,因此这里只记录为官方宣传和定位信号。

2. 可见官方后续展示的任务方向

方向线程中可见的官方描述适用边界
3D / Vibe World将文本、图片或视频变成可玩的 3D 世界,协调 Agent 构建场景、编写交互逻辑并迭代结果;可生成 Blender 对象和场景展示的是工作流能力,未给出统一成功率或任务样本量
计算机使用使用桌面工具搜索、编辑和处理数据,再检查结果并调整下一步动作需要匹配的桌面环境、工具权限和可观察的状态反馈
具身仿真通过视觉反馈在仿真中控制 Franka Panda 机械臂线程未公开控制频率、仿真器、成功标准或失败样本
材料研究与小米材料研究员合作,提出捕获 PFAS 的 MOF 材料,检索文献和专利,做计算筛选并找出湿实验候选这是官方案例,不等于盲测中的材料发现成功率
形式化数学协助把 Li–Yorke 的 “Period Three Implies Chaos” 主定理形式化到 Lean 4;官方称整合后超过 6,000 行代码且由 Lean kernel 验证线程未公开完整提示词、协作轨迹和人工修改比例
设计与多媒体组合代码、设计和工具使用,覆盖界面、幻灯片、SVG、视频和音乐;在 Design Arena 上声称与 Claude Opus 5、GPT-5.6 Sol 相当未提供 Design Arena 的分数、题目、评审协议或原始产物集合
开源与复现开放 Pro/Flash、MiMo-V2.6-Distill-Qwen-9B、技术报告、7K+ RL 任务环境、端到端 RL 框架和可组合 mini-harness“可复现”是发布承诺,实际复现仍需读取仓库、锁定版本并保存日志
可用性MiMo Desktop 与会员计划上线;Pro UltraSpeed 在 Desktop 与 API 提供,官方称最高可达 20× 更快;API 价格保持不变20× 是速度模式上限,不是基础 Pro 的普遍延迟保证

官方发布页中的可核对数据

X 主帖的“博客”链接指向 Xiaomi MiMo 官方发布页。该页面的完整比较附录给出以下 MiMo-V2.6-Pro 分数;页面说明 分数越高越好,其中标注 in-house 的项目为小米自有测试,GDPVal 2.1 (AA) 为 Artificial Analysis 报告的 Elo。

类别BenchmarkPro 分数公开口径
CodingDeepSWE v1.171.9独立名称的代码基准;页面未给出完整运行配置
CodingProgramBench26.5官方比较表
CodingMiMo Code Bench63.2in-house
GeneralGDPVal 2.1 (AA)1673Artificial Analysis Elo
GeneralToolathlon-verified76.9官方比较表
GeneralAutomation Bench v1.0.653.1官方比较表
GeneralAgents' Last Exam31.6官方比较表
GeneralTerminal Bench 4.034.9官方比较表
GeneralTerminal Bench 2.189.9官方比较表
GeneralOSWorld-Verified82.0官方比较表
GeneralJobBench62.0官方比较表
VisualMiMo Visual Coding72.3in-house
CyberCyberGym94.0官方比较表
CyberExploitGym17.8官方比较表
CyberExploitBench47.9官方比较表
CyberSEC Bench Pro66.3官方比较表
CyberMiMo Cyber Bench81.7in-house

官方发布页还给出训练过程背景:Pro 和 Flash 各完成 30 个 RL step,总计约 750k 条轨迹;Pro 训练成本约 262 万美元,训练任务平均 pass rate 的相对提升约 12%;在 DeepSWE v1.1 上,Pro 从 58.4 提升到约 72.6。这个前后变化属于官方 RL 训练流程结果,不能解释为一次“换模型”对照,也不能与上表最终分数混为同一实验。

测评解读与复现建议

能支持的判断

  1. 任务覆盖面较宽:官方同时给出代码、通用 Agent、视觉和 Cyber 类结果,且线程展示了 3D、桌面、科研、设计等工具工作流,因此 Pro 值得优先放入多工具、长程、多模态任务的候选池。

  2. 开源复现路径明确:线程公开指向技术报告、Hugging Face 和 RL 资源,适合复核训练设置、实现细节和模型权重,而不只是接受一句排行榜结论。

  3. 成本与速度是产品卖点:API 价格不变、UltraSpeed 最高 20× 的说法适合形成成本/延迟测试假设,但不能直接当作用户实际账单或 P95 延迟。

不能支持的判断

  • 不能仅凭“多数 Agent 基准相当”断言对所有 Agent 任务都达到 Claude Opus 5 或 GPT-5.6 Sol 的水平。

  • 不能从 Artificial Analysis 46 分反推出任意业务数据集上的准确率,也不能把官方榜单当作独立第三方测评。

  • 不能把科研案例、Design Arena 说法或多媒体演示转换为稳定成功率;线程没有公开失败案例、样本量和评审者一致性。

  • 不能把 mimo-v2.6-flash、mimo-v2.6-pro-ultraspeed 或 MiMo-V2.6-Distill-Qwen-9B 的结果并入基础 Pro 结论。

建议的最小复现流程

  1. 固定 mimo-v2.6-pro 端点、客户端版本、系统提示词、工具 schema、上下文上限、超时和采样参数;单独记录 UltraSpeed。

  2. 用同一仓库、同一 harness 和同一评分器重跑代码、Terminal、OSWorld、工具调用及视觉任务,并保存逐题输入、输出、工具轨迹、token、耗时和失败类型。

  3. 对 3D、Blender、桌面操作、材料设计和 Lean 4 分别建立任务集,保存源素材、最终文件、编译/模拟日志和人工验收结果。

  4. 与其他模型比较时保持相同预算、工具、上下文和重试规则;报告样本量、成功率、成本和 P50/P95 延迟,而不是只引用官方排名。

适用边界

  • 来源边界:本篇只使用指定 X 主帖、该帖可见的 6 条 Xiaomi MiMo 官方后续及主帖/后续直接链接的 Xiaomi MiMo 官方发布页;线程中可见的非官方引用帖未作为证据。

  • 官方主张边界:46/46.32、价格 1/20–1/60、20×、Design Arena 对标、案例结果和 benchmark 分数均是 Xiaomi MiMo 发布口径;本篇未声称独立验证。

  • 方法边界:X 线程没有给出完整测试提示词、任务采样、工具 schema、随机种子、评分脚本、失败样本或置信区间;官方发布页虽提供比较表和部分 RL 训练曲线,仍不足以重建全部测试。

  • 时间边界:价格、可用客户端、模型 ID 和链接以 2026-09-22 采集时可见内容为准,后续可能变化。

来源摘录或观察

  • X 主帖公开写明:MiMo-V2.6 包含 Pro 与 Flash,Pro 在多数 Agent 基准上与 Claude Opus 5、GPT-5.6 Sol 相当,并宣称 Artificial Analysis Intelligence Index 得分 46。

  • X 后续公开写明:API 定价沿用 V2.5;官方宣称 Pro 在相近智能水平下成本约为领先国际模型的 1/20–1/60。

  • X 后续把可见任务展开为 3D 世界、Blender、Franka Panda、桌面工具、PFAS-MOF、Lean 4、前端/演示/视频/音乐,并称 Design Arena 上与 Claude Opus 5、GPT-5.6 Sol 相当。

  • X 后续公开的开源清单包括 Pro/Flash、MiMo-V2.6-Distill-Qwen-9B、技术报告、7K+ RL 任务环境、端到端 RL 框架和 mini-harness。

  • 线程直接链接的官方发布页:https://mimo.xiaomi.com/mimo-v2-6;API、Desktop 和 Hugging Face 入口以该页面当前可见链接为准。

能支持的判断

  • 长程软件工程和工具调用;图像、视频或文本驱动的 3D 场景;Blender 建模;桌面搜索、编辑和数据处理;视觉反馈下的具身仿真;前端、演示文稿、SVG、视频和音乐创作;材料研究与 Lean 4 形式化证明。

不能支持的判断

  • 仅依据本线程宣称的“相当于”或价格比例做上线决策;需要逐题输入、完整工具 schema、随机种子、失败日志和统计显著性的严格比较;把一次官方案例当作稳定成功率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

X(Xiaomi MiMo 官方账号);X 线程中链接的 Xiaomi MiMo 官方发布页 · Xiaomi MiMo(@XiaomiMiMo) · 原文发布日期 2026-09-22 · 本站编辑日期 2026-09-22

打开原始来源

MiMo-V2.6-Pro

在 Tabbit 中比较 MiMo-V2.6-Pro

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Pro 测评:最聪明的开源模型,却让你等 18 秒

MiMo-V2.6-Pro 公开证据测评:真实任务成败实录、18 秒等待与思考账单、社区原声两极分化,以及按工作负载给出的选型裁决。

定价 · 简体中文

MiMo-V2.6-Pro 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Pro 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、思考 Token 增量、UltraSpeed 极速模式及实际任务预算测算。

替代品 · 简体中文

MiMo-V2.6-Pro 替代品:按任务和预算选模型

用完成任务的真实成本、agent 可靠性、开源权重和部署条件,横向评估五个 MiMo-V2.6-Pro 替代方案,价格核对时间为 2026 年 9 月 22 日。

模型对比 · 简体中文

MiMo-V2.6-Pro 对比 MiMo-V2.6-Flash:小米 MoE 模型选型深度评测

深度实测小米 MiMo-V2.6-Pro 与 Flash:1.02T 对比 309B MoE 架构、3.1 倍 API 费率差异、前缀缓存经济学、长程 Agent 基准与场景选型决策矩阵。

相关评测

小米 MiMo 官方发布:MiMo-V2.6-Pro 基准信号与原生全模态定位小米官方把 MiMo-V2.6-Pro 定位为面向 Agent、代码、视觉与电脑操作的原生全模态开源模型,并自报 Artificial Analysis Intelligence Index 46 分及多项 RL/Agent 结果;这些数字仍是厂商发布口径,不能替代同一 harness 下的独立复测。MiMo-V2.6-Pro 官方技术报告:架构、规模化 RL 与评测条件这份官方报告把 MiMo-V2.6-Pro 定义为 1.02T 总参数、约 42B 激活参数的原生全模态稀疏 MoE,并用大批量、多环境、多 harness 和 groupwise grader 的 RL 训练获得较强 Agent 基准成绩;但表中大部分数字是厂商自报,公开信息仍不足以独立复现每个 benchmark。Reddit 实测:MiMo-V2.6-Pro 在 UI/UX 终端修改任务中陷入 grep 无限循环在一项真实网站 UI/UX 修改任务中,发帖人称 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 都在终端触发与 grep 相关的无限循环,约 30 分钟没有修复代码;同一修改交给 DeepSeek V4.1 Flash 后则持续推进并完整输出终端工作记录。Arena Code Arena:MiMo-V2.6-Pro 的 WebDev AutoEval 记录Arena 的 Code Arena | WebDev 总榜已收录 mimo-v2.6-pro,显示 AutoEval 分数 1628(+18/-18),但没有公开投票数或名次,因此只能说明它进入了 WebDev 自动评测榜,不能把 1628 当作盲投排名。小米 MiMo-V2.6-Pro 官方 API 接入与推理配置这份官方配置可直接用于通过 OpenAI 兼容协议接入 mimo-v2.6-pro,并按任务需要选择深度思考、流式输出和多轮工具调用。Hugging Face 官方 MiMo-V2.6-Pro-RL 本地部署与聊天模板配置官方模型卡已经给出 MiMo-V2.6-Pro-RL 的 SGLang 与 vLLM 服务命令,并在仓库 tokenizer 配置中定义了文本、图像、视频、音频、思考和工具调用的聊天模板;本地部署应使用 checkpoint 名称,不能把它与托管 API 的 mimo-v2.6-pro 当成同一个模型标识。小米 MiMo-V2.6-Pro 全模态输入与视觉任务工作流mimo-v2.6-pro 可通过 OpenAI Chat Completions API 读取公网 URL 或符合格式的 Base64 图像、视频和音频,但不能直接上传本地文件,媒体和文本总 Token 仍受 1M 上下文限制。小米 MiMo-V2.6-Pro 官方函数调用与多轮 Agent 工作流对 mimo-v2.6-pro,官方工作流是“模型返回完整 assistant(包括 reasoning_content 和 tool_calls)→ 客户端执行工具 → 追加 role: tool 结果 → 再请求模型”,直到本轮不再产生工具调用。