Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

MiniMax M2.7 · 媒体来源 · 独立测量

BenchLM 对 MiniMax M2.7 的 18 项公开证据

BenchLM 汇总 MiniMax M2.7 的 18 项公开证据,并提示日期、版本和 harness 不同;它是证据索引,不是统一分数。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

条件
模型/版本:BenchLM 标记的 MiniMax M2.7;页面 2026-08-17。
条件
Harness/样本:18 项证据使用混合设置;不是一个测试集。
条件
日期:2026-09-20 重开页面。

关键数据与适用场景

一句话结论

BenchLM 的动态证据账本列出 M2.7 18 条来源可展示结果,SWE-Pro 56.2%、SWE-Rebench 51.9%、SWE Multilingual 76.5%、VIBE-Pro 55.6%、Toolathlon 46.3%,同时标记该模型已被 M3 superseded,适合做历史基线。

测试环境

  • 目录状态:页面标记 Open Weight、Non-Reasoning、200K context、Released 2026-03-18,并标为 Superseded。

  • 数据时间:2026-08-17;公开总分 63.06/100、#45/218,但该总分是 BenchLM 自定义聚合。

  • 证据:页面区分 Provider exact、Benchmark exact、Secondary exact,并提供原始链接。

  • 覆盖:Coding 9、Agentic 6、Knowledge 2、Math 1 等多类 benchmark;不是统一一次实验。

输入/配置

页面把 MiniMax 官方发布、SWE-Rebench、Vibe Code、React Native、Claw-Eval、Gert Labs、Epoch AI 等结果放在同一账本中;每行的模型版本、工具、采样和重复次数不完全相同。

结果数据

基准得分页面证据
SWE-Rebench51.9%Benchmark exact
SWE-bench Pro56.2%Provider exact,MiniMax 官方
SWE-bench Verified (mini-swe-agent v2)75.4%Secondary exact
SWE Multilingual76.5%Provider exact
Multi-SWE Bench52.7%Provider exact
VIBE-Pro55.6%Provider exact
Terminal-Bench 2.057.0%Provider exact
Toolathlon46.3%Provider exact
MLE-Bench Lite66.6%Provider exact
MM-ClawBench62.7%Provider exact
NL2Repo39.8%Provider exact

结论

账本支持 M2.7 作为工程/工具 Agent 的历史强基线,但“已过时”意味着部署前要比较 M3 或当前模型;在同一 benchmark/harness 下,不能直接使用动态榜单的自定义总分做选型。

局限

  • BenchLM 总分和排名受自定义权重、覆盖和动态模型目录影响。

  • Provider exact 仍是厂商报告;Benchmark exact 的不同 harness 不能无条件合并。

  • 页面记录的 SWE-bench Verified 75.4% 与 MiniMax 官方重点发布的 SWE-Pro 56.22% 不是同一测试,不能互换。

  • 页面当前数据会更新,必须保存采集日期、来源 URL 和模型是否 superseded。

复现步骤

  1. 从 BenchLM 每行打开原始 benchmark/官方来源,固定版本、split、harness 和参数。

  2. 至少复跑 SWE-Rebench、SWE-Pro、Terminal-Bench、Toolathlon 和 MM Claw 类任务。

  3. 分别记录 resolved/accuracy、工具调用、token、延迟、费用和失败样本。

  4. 与 M3/其他当前模型使用同一 harness 对照,并在报告中保留 M2.7 历史结果。

能支持的判断

  • 支持按来源日期追踪 18 项证据,并识别可能被新版本取代的结论。

不能支持的判断

  • 不支持综合排名、平均成功率或当前能力结论;任务、版本、提示和样本异质。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

BenchLM · BenchLM · 原文发布日期 2026-08-17 · 本站编辑日期 2026-09-20

打开原始来源

MiniMax M2.7

在 Tabbit 中比较 MiniMax M2.7

下载 Tabbit 客户端后检查模型可用性

相关评测

MiniMax M2.7 官方发布:SWE-Pro、VIBE-Pro 与 Agent 工作流基准MiniMax 发布页报告 SWE-Pro 56.22%、SWE Multilingual 76.5、Multi-SWE-Bench 52.7,并给出自反馈工作流。Reddit 用户对 MiniMax M2.7 的 1000 提示词与编码/工具体验Reddit 用户以约 1,000 个提示词分享编码和工具调用体验,适合发现解析失败;不是受控对照。MiniMax M2.7 的自反馈、记忆与 Agent 自优化工作流把小型修复拆成计划、实现、测试、反思四轮;只把可验证失败原因写入记忆,并比较下一轮是否减少同一测试失败。MiniMax M2.7 官方默认提示与 XML 工具调用模板在 MiniMax M2.7 公开默认身份提示基础上,为代码检查工具编写 XML 调用轮次;先解析参数再执行,并验证结果回答原问题。