Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体MiniMax M2.7

BenchLM 对 MiniMax M2.7 的 18 项公开证据

原始来源

BenchLM

作者BenchLM

原文日期2026-08-17

Tabbit 整理2026-08-19

查看原文

一句话结论

BenchLM 的动态证据账本列出 M2.7 18 条来源可展示结果,SWE-Pro 56.2%、SWE-Rebench 51.9%、SWE Multilingual 76.5%、VIBE-Pro 55.6%、Toolathlon 46.3%,同时标记该模型已被 M3 superseded,适合做历史基线。

测试环境

  • 目录状态:页面标记 Open Weight、Non-Reasoning、200K context、Released 2026-03-18,并标为 Superseded。

  • 数据时间:2026-08-17;公开总分 63.06/100、#45/218,但该总分是 BenchLM 自定义聚合。

  • 证据:页面区分 Provider exact、Benchmark exact、Secondary exact,并提供原始链接。

  • 覆盖:Coding 9、Agentic 6、Knowledge 2、Math 1 等多类 benchmark;不是统一一次实验。

输入/配置

页面把 MiniMax 官方发布、SWE-Rebench、Vibe Code、React Native、Claw-Eval、Gert Labs、Epoch AI 等结果放在同一账本中;每行的模型版本、工具、采样和重复次数不完全相同。

结果数据

基准得分页面证据
SWE-Rebench51.9%Benchmark exact
SWE-bench Pro56.2%Provider exact,MiniMax 官方
SWE-bench Verified (mini-swe-agent v2)75.4%Secondary exact
SWE Multilingual76.5%Provider exact
Multi-SWE Bench52.7%Provider exact
VIBE-Pro55.6%Provider exact
Terminal-Bench 2.057.0%Provider exact
Toolathlon46.3%Provider exact
MLE-Bench Lite66.6%Provider exact
MM-ClawBench62.7%Provider exact
NL2Repo39.8%Provider exact

结论

账本支持 M2.7 作为工程/工具 Agent 的历史强基线,但“已过时”意味着部署前要比较 M3 或当前模型;在同一 benchmark/harness 下,不能直接使用动态榜单的自定义总分做选型。

局限

  • BenchLM 总分和排名受自定义权重、覆盖和动态模型目录影响。

  • Provider exact 仍是厂商报告;Benchmark exact 的不同 harness 不能无条件合并。

  • 页面记录的 SWE-bench Verified 75.4% 与 MiniMax 官方重点发布的 SWE-Pro 56.22% 不是同一测试,不能互换。

  • 页面当前数据会更新,必须保存采集日期、来源 URL 和模型是否 superseded。

复现步骤

  1. 从 BenchLM 每行打开原始 benchmark/官方来源,固定版本、split、harness 和参数。

  2. 至少复跑 SWE-Rebench、SWE-Pro、Terminal-Bench、Toolathlon 和 MM Claw 类任务。

  3. 分别记录 resolved/accuracy、工具调用、token、延迟、费用和失败样本。

  4. 与 M3/其他当前模型使用同一 harness 对照,并在报告中保留 M2.7 历史结果。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

MiniMax M2.7

在 Tabbit 中使用并对比模型

MiniMax M2.7

相关测评

媒体MiniMax News / Early Echoes of Self-Evolution2026-03

MiniMax M2.7 官方发布:SWE-Pro、VIBE-Pro 与 Agent 工作流基准

社区Reddit / r/MiniMaxAI2026-03

Reddit 用户对 MiniMax M2.7 的 1000 提示词与编码/工具体验

MiniMax M2.7

相关提示词

社区GitHub / MiniMax-AI/MiniMax-M2.72026-03

MiniMax M2.7 官方默认提示与 XML 工具调用模板

媒体MiniMax 官方新闻 / MiniMax M2.7: Early Echoes of Self-Evolution2026-03

MiniMax M2.7 的自反馈、记忆与 Agent 自优化工作流