Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体MiniMax M3

MiniMax M3 官方发布:编码基准、长上下文与真实长任务案例

原始来源

MiniMax 官方博客

作者MiniMax

原文日期2026-06-01

Tabbit 整理2026-08-19

查看原文

测试环境

  • 模型:MiniMax M3,约 428B 总参数、约 23B 激活参数的 MoE;MiniMax Sparse Attention(MSA)支持最高 1M context;原生图像/视频输入和 computer use。

  • 公开基准:SWE-Bench Pro、Terminal-Bench 2.1、SWE-fficiency、KernelBench Hard、MCP Atlas、PostTrainBench。

  • 长任务案例:论文复现、NVIDIA Hopper FP8 GEMM 优化、让模型自主后训练四个基础模型。

  • 评测方式:官方内部基础设施,部分任务使用 Claude Code/Terminus 2 等 harness;官方说明 SWE-Bench Verified 运行 4 次取平均,其他指标使用相应 sandbox 和超时。

输入/配置

  • 官方基准基于 M3 的 coding/Agent 配置;Terminal-Bench 2.1 使用 8C16G sandbox、2 小时超时、128K 最大输出、Terminus 2 scaffolding。

  • 论文复现:把论文、代码和实验日志放在长任务上下文,模型自主运行近 12 小时。

  • CUDA 优化:提供任务描述、benchmark 脚本和不能直接运行的 Triton skeleton,没有参考高性能实现;模型通过 benchmark 反馈迭代。

结果数据

基准/案例官方结果
SWE-Bench Pro59.0%
Terminal-Bench 2.166.0%
SWE-fficiency34.8%
KernelBench Hard28.8%
MCP Atlas74.2%
PostTrainBench0.37(Opus 4.7: 0.42;GPT-5.5: 0.39)
  • 论文复现:近 12 小时、18 个 commits、23 张实验图,完成核心实验并复现主要趋势。

  • CUDA FP8 GEMM:约 24 小时、147 次 benchmark 提交、1,959 次工具调用;峰值利用率 7.6%→71.3%,相对初版 9.4×。

  • 官方称 MSA 在 1M context 下每 token 计算量约为上一代的 1/20,prefill 加速超过 9×、decode 超过 15×;这是架构/服务侧数据,不是用户端通用吞吐承诺。

结论

M3 的证据最集中在长时程编码、工具反馈迭代和多模态 Agent,而不是简单单轮聊天。官方案例显示它能在明确 benchmark 反馈下持续探索较长时间;基准分数处于可用的前沿区间,但不能脱离 harness 和内部评测口径解读。

局限

  • 全部为厂商自报,部分对照分数来自官方榜单或不同 harness;官方未公开所有原始轨迹、失败样本和随机种子。

  • 论文复现和 CUDA 优化是精选案例,不能代表普通仓库的成功率。

  • 1M context 和 MSA 加速数据不等于每个 API provider 都提供相同上下文、延迟或价格。

复现步骤

  1. 对公开代码任务固定 sandbox、工具、超时、输出上限和 harness,至少运行三次。

  2. 单独复现实验型长任务:记录每次提交、基准分、工具调用、token、墙钟时间和人工介入。

  3. 把模型能力、harness 编排和硬件/服务吞吐分开报告;不要用精选案例替代任务集统计。

  4. 对需要图像/视频输入的任务核验实际 API 端点是否提供原生多模态和相同计费。

原始证据与数据

  • 官方发布页明确列出上述 5 项编码/Agent 基准和 PostTrainBench 对照值。

  • 官方发布页公开了 12 小时论文复现与 24 小时 CUDA 优化的时间、提交数、工具调用和结果变化。

  • 官方评测方法说明了 SWE-Bench Verified、Terminal-Bench 2.1 和 NL2Repo 的主要 harness/sandbox 口径。

来源摘录或观察(仅做合规短引)

  • 官方定位是把“frontier coding、1M context、native multimodality”放在同一模型中;实际选型仍要回到具体工具链和反馈闭环。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

MiniMax M3

在 Tabbit 中使用并对比模型

MiniMax M3

相关测评

社区Reddit,r/MiniMaxAI

Reddit:真实项目基准——MiniMax-M3、MiMo 2.5 Pro 与 Kimi K2.6

社区Reddit,r/MiniMaxAI

Reddit:MiniMax-M3 的长程编程、速度与配额体验

社区Reddit,r/MiniMaxAI

Reddit:MiniMax-M3 与 M2.7 的对比及配额争议

媒体Artificial Analysis;通过 Google 搜索结果进入

Google 补充:Artificial Analysis 对 MiniMax-M3 的公开指标

MiniMax M3

相关提示词

媒体MiniMax API Docs,Token Plan → M-series Usage Tips

MiniMax 官方:M 系列提示词最佳实践

社区X2026-07-24

X:MiniMax-M3 的最少提示与项目边界经验

社区Reddit,r/ClaudeCode

Reddit:MiniMax-M3 在 Claude Code 长任务中的路由与编排

社区Reddit,r/MiniMaxAI

Reddit:M3 Agent 提示工作流中的缓存、上下文与计费验证