Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

MiniMax M3 · 媒体来源 · 厂商自报

MiniMax M3 官方发布:编码基准、长上下文与真实长任务案例

MiniMax 官方材料报告编码基准、长上下文和长时程 Agent 案例;完整 prompt、硬件、样本数和失败轨迹未公开,因此只能支持厂商定位,不能支持独立复现或生产成功率。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源厂商自报编辑日期 2026-09-20

测试条件速查

来源
MiniMax 官方发布材料;厂商自报
任务
编码基准、长上下文、长时程 Agent 案例
配置
完整 prompt、硬件、样本数和失败轨迹未公开
日期
发布日期与采集日期分开;当前状态需重开

关键数据与适用场景

测试环境

  • 模型:MiniMax M3,约 428B 总参数、约 23B 激活参数的 MoE;MiniMax Sparse Attention(MSA)支持最高 1M context;原生图像/视频输入和 computer use。

  • 公开基准:SWE-Bench Pro、Terminal-Bench 2.1、SWE-fficiency、KernelBench Hard、MCP Atlas、PostTrainBench。

  • 长任务案例:论文复现、NVIDIA Hopper FP8 GEMM 优化、让模型自主后训练四个基础模型。

  • 评测方式:官方内部基础设施,部分任务使用 Claude Code/Terminus 2 等 harness;官方说明 SWE-Bench Verified 运行 4 次取平均,其他指标使用相应 sandbox 和超时。

输入/配置

  • 官方基准基于 M3 的 coding/Agent 配置;Terminal-Bench 2.1 使用 8C16G sandbox、2 小时超时、128K 最大输出、Terminus 2 scaffolding。

  • 论文复现:把论文、代码和实验日志放在长任务上下文,模型自主运行近 12 小时。

  • CUDA 优化:提供任务描述、benchmark 脚本和不能直接运行的 Triton skeleton,没有参考高性能实现;模型通过 benchmark 反馈迭代。

结果数据

基准/案例官方结果
SWE-Bench Pro59.0%
Terminal-Bench 2.166.0%
SWE-fficiency34.8%
KernelBench Hard28.8%
MCP Atlas74.2%
PostTrainBench0.37(Opus 4.7: 0.42;GPT-5.5: 0.39)
  • 论文复现:近 12 小时、18 个 commits、23 张实验图,完成核心实验并复现主要趋势。

  • CUDA FP8 GEMM:约 24 小时、147 次 benchmark 提交、1,959 次工具调用;峰值利用率 7.6%→71.3%,相对初版 9.4×。

  • 官方称 MSA 在 1M context 下每 token 计算量约为上一代的 1/20,prefill 加速超过 9×、decode 超过 15×;这是架构/服务侧数据,不是用户端通用吞吐承诺。

结论

M3 的证据最集中在长时程编码、工具反馈迭代和多模态 Agent,而不是简单单轮聊天。官方案例显示它能在明确 benchmark 反馈下持续探索较长时间;基准分数处于可用的前沿区间,但不能脱离 harness 和内部评测口径解读。

局限

  • 全部为厂商自报,部分对照分数来自官方榜单或不同 harness;官方未公开所有原始轨迹、失败样本和随机种子。

  • 论文复现和 CUDA 优化是精选案例,不能代表普通仓库的成功率。

  • 1M context 和 MSA 加速数据不等于每个 API provider 都提供相同上下文、延迟或价格。

复现步骤

  1. 对公开代码任务固定 sandbox、工具、超时、输出上限和 harness,至少运行三次。

  2. 单独复现实验型长任务:记录每次提交、基准分、工具调用、token、墙钟时间和人工介入。

  3. 把模型能力、harness 编排和硬件/服务吞吐分开报告;不要用精选案例替代任务集统计。

  4. 对需要图像/视频输入的任务核验实际 API 端点是否提供原生多模态和相同计费。

原始证据与数据

  • 官方发布页明确列出上述 5 项编码/Agent 基准和 PostTrainBench 对照值。

  • 官方发布页公开了 12 小时论文复现与 24 小时 CUDA 优化的时间、提交数、工具调用和结果变化。

  • 官方评测方法说明了 SWE-Bench Verified、Terminal-Bench 2.1 和 NL2Repo 的主要 harness/sandbox 口径。

来源摘录或观察(仅做合规短引)

  • 官方定位是把“frontier coding、1M context、native multimodality”放在同一模型中;实际选型仍要回到具体工具链和反馈闭环。

能支持的判断

  • 支持引用官方基准和长任务案例说明产品定位。

不能支持的判断

  • 不支持独立复现、通用成功率或 Tabbit 端到端可用性。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

MiniMax 官方博客 · MiniMax · 原文发布日期 2026-06-01 · 本站编辑日期 2026-09-20

打开原始来源

MiniMax M3

在 Tabbit 中比较 MiniMax M3

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

MiniMax M3:1M 上下文、编码能力与配额现实

基于官方、独立评测与社区原页,说明 MiniMax M3 相比 M2.7 的变化、API/Token Plan 获取方式、成本边界与 Tabbit 未实测限制。

相关评测

Reddit:真实项目基准——MiniMax-M3、MiMo 2.5 Pro 与 Kimi K2.6Reddit 的 brownfield Next.js 原子任务比较涉及 API bug 修复和 API 实现;M3、MiMo 2.5 Pro 与 K2.6 都被观察到完成任务,但速度/成本排序来自单项目体验,日期、重复次数和完整 harness 未公开。Reddit:MiniMax-M3 的长程编程、速度与配额体验Reddit 用户在 Claude Code/OpenCode 类 harness 中讨论 M3 的长程编程、上下文保持、速度和配额;任务数、provider 快照和统一日志未公开,采集记录为 2026-08-18。X:FutureX 实时预测榜单——MiniMax-M3 基座 Agent 第七名作者公布其长程预测 Agent 在 FutureX 榜单中的结果:Kimi K3 基座第 1、DeepSeek V4 Pro 基座第 3、MiniMax M3 基座第 7。FutureX 由 ByteDance Seed 联合 Stanford、Princeton、复旦出品,题目是尚未发生的真实事件,先提交预测、事件落地后按真实结果评分。作者强调,同一套框架只是替换三个模型作为“大脑”。Google 补充:Artificial Analysis 对 MiniMax-M3 的公开指标该 Google 补充指向 Artificial Analysis 的 MiniMax-M3 公开指标;质量、速度和成本必须按页面版本与时间窗口分别读取,provider、档位、样本和未公开字段不能补造。MiniMax M3:Reddit:MiniMax-M3 在 Claude Code 长任务中的路由与编排围绕“Reddit:MiniMax-M3 在 Claude Code 长任务中的路由与编排”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。MiniMax M3:Reddit:M3 Agent 提示工作流中的缓存、上下文与计费验证围绕“Reddit:M3 Agent 提示工作流中的缓存、上下文与计费验证”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。MiniMax M3:Google 补充:MiniMax 官方 M3 与 Claude Code / OpenCode 集成提示围绕“Google 补充:MiniMax 官方 M3 与 Claude Code / OpenCode 集成提示”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。MiniMax M3:MiniMax 官方 M3 长程 Agent 工作流:论文复现与 Producer/Verifier 自校验围绕“MiniMax 官方 M3 长程 Agent 工作流:论文复现与 Producer/Verifier 自校验”整理任务边界、必需输入和运行环境;完整步骤、变量与限制见详情。