Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

MiniMax M2.7 · 媒体来源 · 厂商自报

MiniMax M2.7 官方发布:SWE-Pro、VIBE-Pro 与 Agent 工作流基准

MiniMax 发布页报告 SWE-Pro 56.22%、SWE Multilingual 76.5、Multi-SWE-Bench 52.7,并给出自反馈工作流。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源厂商自报编辑日期 2026-09-20

测试条件速查

条件
模型/版本:MiniMax M2.7;发布页 2026-03。
条件
Harness/样本:三项 SWE 基准与官方工作流;完整提示和重复未知。
条件
日期:2026-09-20 重开页面。

关键数据与适用场景

一句话结论

官方结果显示 M2.7 在真实工程、端到端项目和 Office/Agent 任务上覆盖面很广:SWE-Pro 56.22%、VIBE-Pro 55.6%、Terminal Bench 2 57.0%、GDPval-AA 1495、MM Claw 62.7%,但完整 harness 仍未公开。

测试环境

  • 模型:MiniMax M2.7;官方 API/Agent 与内部 Agent harness。

  • 工程基准:SWE-Pro、VIBE-Pro、Terminal Bench 2、NL2Repo、SWE Multilingual、Multi SWE Bench。

  • 办公/Agent 基准:GDPval-AA、Toolathlon、MM Claw(40+ skills/复杂工作)、MLE Bench Lite(22 ML competitions)。

  • 配置:各基准由官方/内部 harness 执行;文章未给每个测试的完整输入、采样、重复次数、成本和置信区间。

输入/配置

官方案例包含生产日志/监控/部署时间线/trace/数据库/代码库的调试流程、Web/Android/iOS/模拟项目交付、Word/Excel/PPT 多轮编辑、研究报告与 TSMC 收入模型。部分结果来自内部复杂 skills、Agent Teams 和动态工具搜索。

结果数据

  • SWE-Pro:56.22%;SWE Multilingual:76.5;Multi SWE Bench:52.7。

  • VIBE-Pro:55.6%;Terminal Bench 2:57.0%;NL2Repo:39.8%。

  • GDPval-AA:ELO 1495,官方称为 open-source models 中最高;Toolathlon:46.3%。

  • MM Claw:62.7%,官方称接近 Sonnet 4.6;在 40+ 个每个超过 2,000 tokens 的复杂 skills 上,skill adherence 97%。

  • MLE Bench Lite:3 次 24 小时试验平均 medal rate 66.6%,最佳 9 gold/5 silver/1 bronze。

结论

M2.7 适合需要真实工程系统理解、端到端交付、工具/skills 编排的 Agent;但使用公开 API 时应把官方内部 harness 当作上限参考,重新测量裸模型或自有 scaffold 的效果。

局限

  • 这是厂商发布基准,完整 prompt、任务 split、harness、成本、失败样本和统计方差未公开。

  • 许多数字依赖 MiniMax 内部 Agent Teams、memory、skills 和动态工具搜索,不能直接归因于裸模型。

  • GDPval-AA、MM Claw、SWE-Pro 等指标性质不同,不应合成一个总分。

  • “reduced recovery time under three minutes”是官方内部多次案例,不是受控平均性能。

复现步骤

  1. 明确选择 API、开源权重、vLLM/SGLang 或自定义 Agent harness,并锁定版本。

  2. 选取编码 issue、端到端项目、Terminal、办公文档、工具调用和长程实验任务,提供相同工具与权限。

  3. 记录 prompt、skill/tool 定义、调用轨迹、patch、测试、成本、延迟和人工介入。

  4. 将结果按基准和 harness 分层,单独报告裸模型与 Agent 编排收益。

能支持的判断

  • 支持把三项数字作为官方任务条件下的方向性结果。

不能支持的判断

  • 不支持任意仓库修复率或当前 API 保证;任务选择和失败轨迹未完整公开。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

MiniMax News / Early Echoes of Self-Evolution · MiniMax · 原文发布日期 2026-03 · 本站编辑日期 2026-09-20

打开原始来源

MiniMax M2.7

在 Tabbit 中比较 MiniMax M2.7

下载 Tabbit 客户端后检查模型可用性

相关评测

BenchLM 对 MiniMax M2.7 的 18 项公开证据BenchLM 汇总 MiniMax M2.7 的 18 项公开证据,并提示日期、版本和 harness 不同;它是证据索引,不是统一分数。Reddit 用户对 MiniMax M2.7 的 1000 提示词与编码/工具体验Reddit 用户以约 1,000 个提示词分享编码和工具调用体验,适合发现解析失败;不是受控对照。MiniMax M2.7 的自反馈、记忆与 Agent 自优化工作流把小型修复拆成计划、实现、测试、反思四轮;只把可验证失败原因写入记忆,并比较下一轮是否减少同一测试失败。MiniMax M2.7 官方默认提示与 XML 工具调用模板在 MiniMax M2.7 公开默认身份提示基础上,为代码检查工具编写 XML 调用轮次;先解析参数再执行,并验证结果回答原问题。