Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

MiMo-V2.6-Pro · 社区来源 · 个人体验

Reddit 实测:MiMo-V2.6-Pro 在 UI/UX 终端修改任务中陷入 grep 无限循环

在一项真实网站 UI/UX 修改任务中,发帖人称 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 都在终端触发与 grep 相关的无限循环,约 30 分钟没有修复代码;同一修改交给 DeepSeek V4.1 Flash 后则持续推进并完整输出终端工作记录。

社区来源个人体验编辑日期 2026-09-22

测试条件速查

来源具体观察
在一项真实网站 UI/UX 修改任务中,发帖人称 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 都在终端触发与 grep 相关的无限循环,约 30 分钟没有修复代码;同一修改交给 DeepSeek V4.1 Flash 后则持续推进并完整输出终端工作记录。
已公布条件
不能用于判断基准分数、价格、速度、代码质量或长程 Agent 能力,也不能替代受控复测。

关键数据与适用场景

一句话结论

在一项真实网站 UI/UX 修改任务中,发帖人称 MiMo-V2.6-Pro 与 MiMo-V2.6-Flash 都在终端触发与 grep 相关的无限循环,约 30 分钟没有修复代码;同一修改交给 DeepSeek V4.1 Flash 后则持续推进并完整输出终端工作记录。

适用场景

  • 适合的任务:本条素材仅能证明需要终端工具调用、代码修改和过程可观察性的前端维护任务存在失败风险;不能据此确认模型适合或不适合所有编码任务。

  • 不适合的任务:不能用于判断基准分数、价格、速度、代码质量或长程 Agent 能力,也不能替代受控复测。

  • 适用的模型版本:原帖明确写出 Mimo v2.6 Pro;同时测试了 Mimo v2.6 Flash,二者不可混为一谈。原帖未提及 MiMo-V2.6-Pro-RL 或 Ultraspeed。

  • 适用的客户端、Agent 或 API:正文只明确提到终端(terminal)和网站 UI/UX 修改;未公开具体客户端、Agent、Provider 或 API。

  • 推荐的推理档位和参数:未公开,不能推断。

测试方法

  1. 发帖人针对其正在运营的网站提出 UI/UX 更新需求。

  2. 将同一修改任务分别交给 MiMo v2.6 Flash 和 MiMo v2.6 Pro。

  3. 观察终端中的执行过程;发帖人报告两者在取得一些进展后进入与 grep 相关的无限循环。

  4. 等待约 30 分钟,发帖人仍无法确认任务在推进,代码也没有被修复。

  5. 将相同修改任务交给 DeepSeek V4.1 Flash 作对照;发帖人称其按预期推进,并把工作历史完整输出到终端。

原始证据与数据

  • 任务:更新正在运营的网站 UI/UX。

  • 模型样本:MiMo v2.6 Flash、MiMo v2.6 Pro;对照为 DeepSeek V4.1 Flash。

  • 工具/环境:终端;具体 Agent、Provider、操作系统、仓库、工具版本和参数均未披露。

  • 观察到的故障:MiMo 两个版本在取得部分进展后出现与 grep 相关的无限循环;约 30 分钟没有代码修复。

  • 对照结果:发帖人称 DeepSeek V4.1 Flash 忠实执行同一修改,并将工作历史完整输出到终端。

  • 可见产物:原帖没有提供代码 diff、运行日志、截图、仓库链接或可下载构建产物;“完整输出工作历史”是发帖人的描述,页面未展示该日志。

  • 公开样本量:同一发帖人的 1 个 UI/UX 修改任务,分别尝试多个模型;不是受控基准。

适用边界

  • 这是单个用户对单个前端维护任务的自述,不能外推为 MiMo-V2.6-Pro 的普遍能力结论。

  • 原帖没有公开完整提示词、代码库、复现步骤、Provider、模型参数、工具版本或日志,因此无法复现“grep 无限循环”。

  • MiMo-V2.6-Flash 的表现与 MiMo-V2.6-Pro 分开记录;本条的核心结论只覆盖原帖对 Pro 的直接描述。

  • DeepSeek V4.1 Flash 的成功也只是同一用户对照观察,不能视为独立测评结果。

来源摘录或观察(仅做合规短引)

“an infinite loop related to grep started occurring in the terminal.”

“for 30 minutes no code was fixed.”

“DS 4.1 Flash is still much better..”

能支持的判断

  • 本条素材仅能证明需要终端工具调用、代码修改和过程可观察性的前端维护任务存在失败风险;不能据此确认模型适合或不适合所有编码任务。

不能支持的判断

  • 不能用于判断基准分数、价格、速度、代码质量或长程 Agent 能力,也不能替代受控复测。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Reddit,r/CommandCode · u/choiyoh · 原文发布日期 2026-09-22 · 本站编辑日期 2026-09-22

打开原始来源

MiMo-V2.6-Pro

在 Tabbit 中比较 MiMo-V2.6-Pro

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

完整测评 · 简体中文

MiMo-V2.6-Pro 测评:最聪明的开源模型,却让你等 18 秒

MiMo-V2.6-Pro 公开证据测评:真实任务成败实录、18 秒等待与思考账单、社区原声两极分化,以及按工作负载给出的选型裁决。

定价 · 简体中文

MiMo-V2.6-Pro 定价解析:官方费率表、缓存杠杆与任务成本精算

一份关于 MiMo-V2.6-Pro 定价的实用采购决策指南:官方 API 费率、Prompt 缓存经济学、思考 Token 增量、UltraSpeed 极速模式及实际任务预算测算。

替代品 · 简体中文

MiMo-V2.6-Pro 替代品:按任务和预算选模型

用完成任务的真实成本、agent 可靠性、开源权重和部署条件,横向评估五个 MiMo-V2.6-Pro 替代方案,价格核对时间为 2026 年 9 月 22 日。

模型对比 · 简体中文

MiMo-V2.6-Pro 对比 MiMo-V2.6-Flash:小米 MoE 模型选型深度评测

深度实测小米 MiMo-V2.6-Pro 与 Flash:1.02T 对比 309B MoE 架构、3.1 倍 API 费率差异、前缀缓存经济学、长程 Agent 基准与场景选型决策矩阵。

相关评测

MiMo-V2.6-Pro 官方 X 发布线程:任务定位、公开基准与开源入口这条官方线程把 MiMo-V2.6-Pro 定位为公开构建的原生全模态 Agent 模型,重点覆盖代码、计算机使用、3D、设计、科研和工具工作流;线程中的榜单与案例能帮助筛选任务方向,但仍是厂商口径,不能替代同一 harness 下的独立复测。小米 MiMo 官方发布:MiMo-V2.6-Pro 基准信号与原生全模态定位小米官方把 MiMo-V2.6-Pro 定位为面向 Agent、代码、视觉与电脑操作的原生全模态开源模型,并自报 Artificial Analysis Intelligence Index 46 分及多项 RL/Agent 结果;这些数字仍是厂商发布口径,不能替代同一 harness 下的独立复测。MiMo-V2.6-Pro 官方技术报告:架构、规模化 RL 与评测条件这份官方报告把 MiMo-V2.6-Pro 定义为 1.02T 总参数、约 42B 激活参数的原生全模态稀疏 MoE,并用大批量、多环境、多 harness 和 groupwise grader 的 RL 训练获得较强 Agent 基准成绩;但表中大部分数字是厂商自报,公开信息仍不足以独立复现每个 benchmark。Arena Code Arena:MiMo-V2.6-Pro 的 WebDev AutoEval 记录Arena 的 Code Arena | WebDev 总榜已收录 mimo-v2.6-pro,显示 AutoEval 分数 1628(+18/-18),但没有公开投票数或名次,因此只能说明它进入了 WebDev 自动评测榜,不能把 1628 当作盲投排名。小米 MiMo-V2.6-Pro 官方 API 接入与推理配置这份官方配置可直接用于通过 OpenAI 兼容协议接入 mimo-v2.6-pro,并按任务需要选择深度思考、流式输出和多轮工具调用。Hugging Face 官方 MiMo-V2.6-Pro-RL 本地部署与聊天模板配置官方模型卡已经给出 MiMo-V2.6-Pro-RL 的 SGLang 与 vLLM 服务命令,并在仓库 tokenizer 配置中定义了文本、图像、视频、音频、思考和工具调用的聊天模板;本地部署应使用 checkpoint 名称,不能把它与托管 API 的 mimo-v2.6-pro 当成同一个模型标识。小米 MiMo-V2.6-Pro 全模态输入与视觉任务工作流mimo-v2.6-pro 可通过 OpenAI Chat Completions API 读取公网 URL 或符合格式的 Base64 图像、视频和音频,但不能直接上传本地文件,媒体和文本总 Token 仍受 1M 上下文限制。小米 MiMo-V2.6-Pro 官方函数调用与多轮 Agent 工作流对 mimo-v2.6-pro,官方工作流是“模型返回完整 assistant(包括 reasoning_content 和 tool_calls)→ 客户端执行工具 → 追加 role: tool 结果 → 再请求模型”,直到本轮不再产生工具调用。