MiniMax M3 模型测评导航
汇总 MiniMax M3 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。
媒体
2 条已核对来源的资料Google 补充:Artificial Analysis 对 MiniMax-M3 的公开指标
Google 结果显示 Artificial Analysis 的 MiniMax-M3 页面用于比较模型质量、价格、输出速度和延迟。Google 摘要给出 Intelligence Index 约 45,Coding Index 约 58.6;不同结果卡片也显示过 55 的旧/不同时间快照,因此分数必须连同页面时间一起理解。
MiniMax M3 官方发布:编码基准、长上下文与真实长任务案例
模型:MiniMax M3,约 428B 总参数、约 23B 激活参数的 MoE;MiniMax Sparse Attention(MSA)支持最高 1M context;原生图像/视频输入和 computer use。
社区
6 条已核对来源的资料Reddit:真实项目基准——MiniMax-M3、MiMo 2.5 Pro 与 Kimi K2.6
作者不信任厂商公开基准,因此在一个真实的 brownfield 项目上设计了几个原子任务,比较 MiniMax-M3、MiMo 和 Kimi K2.6。作者称三者都完成了任务,但速度和成本不同;帖子 TL;DR 为 MiMo 略胜。该结果更接近日常开发任务体验,不是严格的公开基准。
Reddit:MiniMax-M3 的长程编程、速度与配额体验
原帖只提出一个判断:M3 价格低但能力强。评论区给出了相互矛盾、但更有操作价值的真实体验:M3 便宜、适合作为大多数工作的 workhorse,但速度偏慢,遇到复杂问题可能卡住;有人认为它在长 agent 运行中比 M2.7 更稳定,也有人认为输出质量不稳定、复杂项目仍需要 Opus 等前沿模型兜底。
Reddit:MiniMax-M3 与 M2.7 的对比及配额争议
原作者长期使用 M2.7,认为其质量/成本比优秀;试用 M3 后主要失望于新的额度限制,而不是模型本身。评论区出现两类相反反馈:一类认为 M3 更聪明、长 agent 更稳定;另一类认为 M3 慢、输出质量不稳定、额度消耗过快。该帖子适合作为“模型能力”和“套餐有效吞吐”需要分开评价的反例。
Reddit:MiniMax-M3 Token Plan 的缓存与有效吞吐实测
这篇帖子不是对 M3 智力的测评,而是对 Token Plan 在 agentic coding 场景下“有效吞吐”的实测。作者通过 OpenCode、OpenRouter BYOK 和缓存命中率观察到:其理解中的 PAYG 缓存折扣没有体现在 Token Plan 上,重复读取上下文会快速消耗额度。评论区给出一个 90% 重复上下文假设下的数量级估算:有效新工作量可能从 0.895B 降到 0.17B,或从 0.17B 降到 0.032B,取决于预算口径。
X:DRACO 100 任务——四次 MiniMax-M3 加一次综合运行
作者称,四次 MiniMax-M3 research run 加第五次 M3 synthesizer 在 100 任务 DRACO benchmark 上得到 68.1 分;Fable 5 得到 65.3 分。M3 的 100 任务运行成本为 37 美元,Fable 的约 250 美元比较成本为建模值。作者的核心观点是:多个便宜副本可以带来有用的多样性。
X:FutureX 实时预测榜单——MiniMax-M3 基座 Agent 第七名
作者公布其长程预测 Agent 在 FutureX 榜单中的结果:Kimi K3 基座第 1、DeepSeek V4 Pro 基座第 3、MiniMax M3 基座第 7。FutureX 由 ByteDance Seed 联合 Stanford、Princeton、复旦出品,题目是尚未发生的真实事件,先提交预测、事件落地后按真实结果评分。作者强调,同一套框架只是替换三个模型作为“大脑”。
MiniMax M3
在 Tabbit 中使用并对比模型
汇总 MiniMax M3 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。