MiniMax M3 · 社区来源 · 个人体验
作者称,四次 MiniMax-M3 research run 加第五次 M3 synthesizer 在 100 任务 DRACO benchmark 上得到 68.1 分;Fable 5 得到 65.3 分。M3 的 100 任务运行成本为 37 美元,Fable 的约 250 美元比较成本为建模值。作者的核心观点是:多个便宜副本可以带来有用的多样性。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
作者称,四次 MiniMax-M3 research run 加第五次 M3 synthesizer 在 100 任务 DRACO benchmark 上得到 68.1 分;Fable 5 得到 65.3 分。M3 的 100 任务运行成本为 37 美元,Fable 的约 250 美元比较成本为建模值。作者的核心观点是:多个便宜副本可以带来有用的多样性。
在该实验设置中,多次廉价运行加综合器的组合超过了单个 Fable 5 的分数。
不能把 68.1 归因于单次 M3;结果来自“四次 research + 第五次 synthesizer”的系统。
成本优势约为 37/250 = 14.8%,但 Fable 成本是 modeled,不是同口径账单。
这条结果支持评估“多次采样/多模型编排”,而不只是单模型单次回答。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
原帖没有公开完整任务、评分细则、每次运行输出或 Fable 的实际账单。应把它视为一个关于“多次运行是否值得”的实验线索,而不是可复现的完整 benchmark 报告。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
X · @jperla(Joseph Perla) · 原文发布日期 2026-08-11 · 本站编辑日期 2026-09-20
打开原始来源MiniMax M3
下载 Tabbit 客户端后检查模型可用性