MiniMax M3

MiniMax M3 模型测评导航

汇总 MiniMax M3 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。

8 条已核对来源的资料官方 · 媒体 · 社区

媒体

2 条已核对来源的资料

社区

6 条已核对来源的资料
社区Reddit,r/MiniMaxAI

Reddit:真实项目基准——MiniMax-M3、MiMo 2.5 Pro 与 Kimi K2.6

作者不信任厂商公开基准,因此在一个真实的 brownfield 项目上设计了几个原子任务,比较 MiniMax-M3、MiMo 和 Kimi K2.6。作者称三者都完成了任务,但速度和成本不同;帖子 TL;DR 为 MiMo 略胜。该结果更接近日常开发任务体验,不是严格的公开基准。

社区Reddit,r/MiniMaxAI

Reddit:MiniMax-M3 的长程编程、速度与配额体验

原帖只提出一个判断:M3 价格低但能力强。评论区给出了相互矛盾、但更有操作价值的真实体验:M3 便宜、适合作为大多数工作的 workhorse,但速度偏慢,遇到复杂问题可能卡住;有人认为它在长 agent 运行中比 M2.7 更稳定,也有人认为输出质量不稳定、复杂项目仍需要 Opus 等前沿模型兜底。

社区Reddit,r/MiniMaxAI

Reddit:MiniMax-M3 与 M2.7 的对比及配额争议

原作者长期使用 M2.7,认为其质量/成本比优秀;试用 M3 后主要失望于新的额度限制,而不是模型本身。评论区出现两类相反反馈:一类认为 M3 更聪明、长 agent 更稳定;另一类认为 M3 慢、输出质量不稳定、额度消耗过快。该帖子适合作为“模型能力”和“套餐有效吞吐”需要分开评价的反例。

社区Reddit,r/MiniMaxAI

Reddit:MiniMax-M3 Token Plan 的缓存与有效吞吐实测

这篇帖子不是对 M3 智力的测评,而是对 Token Plan 在 agentic coding 场景下“有效吞吐”的实测。作者通过 OpenCode、OpenRouter BYOK 和缓存命中率观察到:其理解中的 PAYG 缓存折扣没有体现在 Token Plan 上,重复读取上下文会快速消耗额度。评论区给出一个 90% 重复上下文假设下的数量级估算:有效新工作量可能从 0.895B 降到 0.17B,或从 0.17B 降到 0.032B,取决于预算口径。

社区X

X:DRACO 100 任务——四次 MiniMax-M3 加一次综合运行

作者称,四次 MiniMax-M3 research run 加第五次 M3 synthesizer 在 100 任务 DRACO benchmark 上得到 68.1 分;Fable 5 得到 65.3 分。M3 的 100 任务运行成本为 37 美元,Fable 的约 250 美元比较成本为建模值。作者的核心观点是:多个便宜副本可以带来有用的多样性。

社区X

X:FutureX 实时预测榜单——MiniMax-M3 基座 Agent 第七名

作者公布其长程预测 Agent 在 FutureX 榜单中的结果:Kimi K3 基座第 1、DeepSeek V4 Pro 基座第 3、MiniMax M3 基座第 7。FutureX 由 ByteDance Seed 联合 Stanford、Princeton、复旦出品,题目是尚未发生的真实事件,先提交预测、事件落地后按真实结果评分。作者强调,同一套框架只是替换三个模型作为“大脑”。

MiniMax M3

在 Tabbit 中使用并对比模型

汇总 MiniMax M3 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。