Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

MiMo-V2.6-Pro · 媒体来源 · 平台遥测

Arena Code Arena:MiMo-V2.6-Pro 的 WebDev AutoEval 记录

Arena 的 Code Arena | WebDev 总榜已收录 mimo-v2.6-pro,显示 AutoEval 分数 1628(+18/-18),但没有公开投票数或名次,因此只能说明它进入了 WebDev 自动评测榜,不能把 1628 当作盲投排名。

媒体来源平台遥测编辑日期 2026-09-22

测试条件速查

来源具体观察
Arena 的 Code Arena | WebDev 总榜已收录 mimo-v2.6-pro,显示 AutoEval 分数 1628(+18/-18),但没有公开投票数或名次,因此只能说明它进入了 WebDev 自动评测榜,不能把 1628 当作盲投排名。
已公布条件
不能据此判断通用文本、视觉、多模态、长文写作或真实项目交付质量;也不能据此判断人类偏好。

关键数据与适用场景

一句话结论

Arena 的 Code Arena | WebDev 总榜已收录 mimo-v2.6-pro,显示 AutoEval 分数 1628(+18/-18),但没有公开投票数或名次,因此只能说明它进入了 WebDev 自动评测榜,不能把 1628 当作盲投排名。

适用场景

  • 适合的任务:前端 Web 开发,以及需要多步推理和工具调用的 Agentic Coding 工作流。

  • 不适合的任务:不能据此判断通用文本、视觉、多模态、长文写作或真实项目交付质量;也不能据此判断人类偏好。

  • 适用的模型版本:mimo-v2.6-pro,页面模型别名为 mimo-v2.6-pro。

  • 适用的客户端、Agent 或 API:Arena Code Arena 的 WebDev 评测环境;页面未公开具体 harness、工具 schema、系统提示词或 API 提供商配置。

  • 推荐的推理档位和参数:页面未公开推理档位、温度、采样参数或工具配置,不应自行补写。

测试方法

  1. 打开 Arena 官方 Code leaderboard:https://arena.ai/leaderboard/code。

  2. 使用页面默认的 Ranking、Overall、Models 视图,记录榜单标题、页面日期、总投票/会话统计和模型总数。

  3. 在模型表格中定位精确别名 mimo-v2.6-pro,不要把 mimo-v2.5-pro、mimo-v2-pro 或 mimo-v2-flash 合并到本条记录。

  4. 分别记录 Rank、Rank Spread、Score、Votes、价格和上下文;若字段显示 N/A,保留 N/A,不要用邻近模型或官方宣传数据替代。

原始证据与数据

榜单环境

字段Arena 页面原值
榜单`Code ArenaWebDev`
类别Overall
页面说明面向前端 Web 开发任务,包括需要多步推理和工具使用的 Agentic Coding 工作流
页面标注日期2026-09-12
总投票679,295 votes
模型数129 models
自动评测标记1 AutoEval

mimo-v2.6-pro 行

字段原值解释
Modelmimo-v2.6-proXiaomi · MIT
RankN/A没有公布可排序的名次
Rank SpreadN/A没有公布名次区间
Score1628该行标记为 AutoEval
Score Spread+18/-18页面显示的分数区间
VotesN/A不是公开盲投票数
Price $/M$0.43 / $0.87页面元数据,输入/输出价格顺序
Context1M页面元数据

这里的关键区别是:榜头同时显示 679,295 votes,但 mimo-v2.6-pro 自身的 Votes 为 N/A,并且该行 Rank 为 N/A、分数旁有 AutoEval 标记。因此不能写成“MiMo 在 Arena 盲测中排名第 X”,也不能把 1628 与有公开 Votes 的模型做严格胜负比较。

适用边界

  • 这是 Arena 官方页面上的独立评测记录,但页面没有说明该 AutoEval 的任务集、样本数、评测脚本、工具版本、推理档位或提供商路由;这些缺失项限制了复现和横向比较。

  • 榜单只覆盖 Code/WebDev 的 Overall 视图;该条记录不能外推到通用聊天、视觉理解或全模态能力。

  • 价格和上下文长度是榜单展示的模型元数据,不是本次 AutoEval 的质量结果,且可能随时间更新。

  • 同一页面中,其他模型的公开投票分数与 MiMo 的 AutoEval 分数属于不同证据类型;应在报告中分栏呈现。

  • 采集时核对了 Arena 官方 X 账号 @arena 及 from:arena MiMo 的最新搜索入口;X 时间线停留在加载状态并出现 ChunkLoadError/fetchError,未取得可核对的推文正文,因此没有把 X 搜索摘要或转述写入结论。

  • Arena 的 Text 页面在采集时未出现精确别名 mimo-v2.6-pro,Agent 页面只出现 Mimo V2.5 Pro;这两项不能作为 MiMo-V2.6-Pro 的 Text/Agent 成绩,也不应与本条 WebDev AutoEval 合并。

来源摘录或观察(仅做合规短引)

  • 榜单顶部提示:mimo-v2.6-pro's AutoEval score is now on Arena。

  • 模型行原始字段:mimo-v2.6-pro · Xiaomi · MIT · 1628 · +18/-18 · AutoEval · N/A · $0.43/$0.87 · 1M。

  • 页面说明明确将该榜单定义为前端 Web 开发任务,并包含需要多步推理和工具使用的 Agentic Coding 工作流。

能支持的判断

  • 前端 Web 开发,以及需要多步推理和工具调用的 Agentic Coding 工作流。

不能支持的判断

  • 不能据此判断通用文本、视觉、多模态、长文写作或真实项目交付质量;也不能据此判断人类偏好。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Arena(官方 leaderboard) · Arena · 原文发布日期 2026-09-12 · 本站编辑日期 2026-09-22

打开原始来源

MiMo-V2.6-Pro

在 Tabbit 中比较 MiMo-V2.6-Pro

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Pro 测评:最聪明的开源模型,却让你等 18 秒

MiMo-V2.6-Pro 公开证据测评:真实任务成败实录、18 秒等待与思考账单、社区原声两极分化,以及按工作负载给出的选型裁决。

定价 · 简体中文

MiMo-V2.6-Pro 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Pro 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、思考 Token 增量、UltraSpeed 极速模式及实际任务预算测算。

替代品 · 简体中文

MiMo-V2.6-Pro 替代品:按任务和预算选模型

用完成任务的真实成本、agent 可靠性、开源权重和部署条件,横向评估五个 MiMo-V2.6-Pro 替代方案,价格核对时间为 2026 年 9 月 22 日。

模型对比 · 简体中文

MiMo-V2.6-Pro 对比 MiMo-V2.6-Flash:小米 MoE 模型选型深度评测

深度实测小米 MiMo-V2.6-Pro 与 Flash:1.02T 对比 309B MoE 架构、3.1 倍 API 费率差异、前缀缓存经济学、长程 Agent 基准与场景选型决策矩阵。

相关评测

小米 MiMo 官方发布:MiMo-V2.6-Pro 基准信号与原生全模态定位小米官方把 MiMo-V2.6-Pro 定位为面向 Agent、代码、视觉与电脑操作的原生全模态开源模型,并自报 Artificial Analysis Intelligence Index 46 分及多项 RL/Agent 结果;这些数字仍是厂商发布口径,不能替代同一 harness 下的独立复测。MiMo-V2.6-Pro 官方技术报告:架构、规模化 RL 与评测条件这份官方报告把 MiMo-V2.6-Pro 定义为 1.02T 总参数、约 42B 激活参数的原生全模态稀疏 MoE,并用大批量、多环境、多 harness 和 groupwise grader 的 RL 训练获得较强 Agent 基准成绩;但表中大部分数字是厂商自报,公开信息仍不足以独立复现每个 benchmark。MiMo-V2.6-Pro 官方 X 发布线程:任务定位、公开基准与开源入口这条官方线程把 MiMo-V2.6-Pro 定位为公开构建的原生全模态 Agent 模型,重点覆盖代码、计算机使用、3D、设计、科研和工具工作流;线程中的榜单与案例能帮助筛选任务方向,但仍是厂商口径,不能替代同一 harness 下的独立复测。Reddit 实测:MiMo-V2.6-Pro 在 UI/UX 终端修改任务中陷入 grep 无限循环在一项真实网站 UI/UX 修改任务中,发帖人称 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 都在终端触发与 grep 相关的无限循环,约 30 分钟没有修复代码;同一修改交给 DeepSeek V4.1 Flash 后则持续推进并完整输出终端工作记录。小米 MiMo-V2.6-Pro 官方 API 接入与推理配置这份官方配置可直接用于通过 OpenAI 兼容协议接入 mimo-v2.6-pro,并按任务需要选择深度思考、流式输出和多轮工具调用。Hugging Face 官方 MiMo-V2.6-Pro-RL 本地部署与聊天模板配置官方模型卡已经给出 MiMo-V2.6-Pro-RL 的 SGLang 与 vLLM 服务命令,并在仓库 tokenizer 配置中定义了文本、图像、视频、音频、思考和工具调用的聊天模板;本地部署应使用 checkpoint 名称,不能把它与托管 API 的 mimo-v2.6-pro 当成同一个模型标识。小米 MiMo-V2.6-Pro 全模态输入与视觉任务工作流mimo-v2.6-pro 可通过 OpenAI Chat Completions API 读取公网 URL 或符合格式的 Base64 图像、视频和音频,但不能直接上传本地文件,媒体和文本总 Token 仍受 1M 上下文限制。小米 MiMo-V2.6-Pro 官方函数调用与多轮 Agent 工作流对 mimo-v2.6-pro,官方工作流是“模型返回完整 assistant(包括 reasoning_content 和 tool_calls)→ 客户端执行工具 → 追加 role: tool 结果 → 再请求模型”,直到本轮不再产生工具调用。