Reddit 的 brownfield Next.js 原子任务比较涉及 API bug 修复和 API 实现;M3、MiMo 2.5 Pro 与 K2.6 都被观察到完成任务,但速度/成本排序来自单项目体验,日期、重复次数和完整 harness 未公开。
Reddit,r/MiniMaxAI · 查看证据MiniMax M3 · 测评与证据
MiniMax M3,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
Reddit 用户在 Claude Code/OpenCode 类 harness 中讨论 M3 的长程编程、上下文保持、速度和配额;任务数、provider 快照和统一日志未公开,采集记录为 2026-08-18。
Reddit,r/MiniMaxAI · 查看证据该 Google 补充指向 Artificial Analysis 的 MiniMax-M3 公开指标;质量、速度和成本必须按页面版本与时间窗口分别读取,provider、档位、样本和未公开字段不能补造。
Artificial Analysis;通过 Google 搜索结果进入 · 查看证据完整测评与相关内容
精选证据
Reddit:真实项目基准——MiniMax-M3、MiMo 2.5 Pro 与 Kimi K2.6
Reddit 的 brownfield Next.js 原子任务比较涉及 API bug 修复和 API 实现;M3、MiMo 2.5 Pro 与 K2.6 都被观察到完成任务,但速度/成本排序来自单项目体验,日期、重复次数和完整 harness 未公开。
待验证:本次未能重新核实原文。
- 模型与任务
- MiniMax-M3、MiMo 2.5 Pro、Kimi K2.6;brownfield Next.js 原子任务
- 客户端/配置
- 作者自建项目;完整 harness、参数和重复次数未公开
- 样本
- API bug 修复和 API 实现等若干任务
Reddit:MiniMax-M3 的长程编程、速度与配额体验
Reddit 用户在 Claude Code/OpenCode 类 harness 中讨论 M3 的长程编程、上下文保持、速度和配额;任务数、provider 快照和统一日志未公开,采集记录为 2026-08-18。
待验证:本次未能重新核实原文。
- 客户端
- Claude Code/OpenCode 社区 harness;provider 与套餐影响额度
- 任务
- 长程编程、上下文保持、速度与额度体验
- 样本
- 个人/评论者体验;任务数和统一日志未公开
Google 补充:Artificial Analysis 对 MiniMax-M3 的公开指标
该 Google 补充指向 Artificial Analysis 的 MiniMax-M3 公开指标;质量、速度和成本必须按页面版本与时间窗口分别读取,provider、档位、样本和未公开字段不能补造。
待验证:本次未能重新核实原文。
- 平台
- Artificial Analysis 公开指标;provider 与 harness 按页面
- 版本/档位
- 版本、推理档位和时间窗口需重开确认
- 指标
- 质量、速度、成本只记录公开值,未知项不补造
MiniMax M3 官方发布:编码基准、长上下文与真实长任务案例
MiniMax 官方材料报告编码基准、长上下文和长时程 Agent 案例;完整 prompt、硬件、样本数和失败轨迹未公开,因此只能支持厂商定位,不能支持独立复现或生产成功率。
待验证:本次未能重新核实原文。
- 来源
- MiniMax 官方发布材料;厂商自报
- 任务
- 编码基准、长上下文、长时程 Agent 案例
- 配置
- 完整 prompt、硬件、样本数和失败轨迹未公开
全部来源
全部来源
Reddit:真实项目基准——MiniMax-M3、MiMo 2.5 Pro 与 Kimi K2.6
Reddit 的 brownfield Next.js 原子任务比较涉及 API bug 修复和 API 实现;M3、MiMo 2.5 Pro 与 K2.6 都被观察到完成任务,但速度/成本排序来自单项目体验,日期、重复次数和完整 harness 未公开。
待验证:本次未能重新核实原文。
- 模型与任务
- MiniMax-M3、MiMo 2.5 Pro、Kimi K2.6;brownfield Next.js 原子任务
- 客户端/配置
- 作者自建项目;完整 harness、参数和重复次数未公开
- 样本
- API bug 修复和 API 实现等若干任务
Reddit:MiniMax-M3 的长程编程、速度与配额体验
Reddit 用户在 Claude Code/OpenCode 类 harness 中讨论 M3 的长程编程、上下文保持、速度和配额;任务数、provider 快照和统一日志未公开,采集记录为 2026-08-18。
待验证:本次未能重新核实原文。
- 客户端
- Claude Code/OpenCode 社区 harness;provider 与套餐影响额度
- 任务
- 长程编程、上下文保持、速度与额度体验
- 样本
- 个人/评论者体验;任务数和统一日志未公开
Google 补充:Artificial Analysis 对 MiniMax-M3 的公开指标
该 Google 补充指向 Artificial Analysis 的 MiniMax-M3 公开指标;质量、速度和成本必须按页面版本与时间窗口分别读取,provider、档位、样本和未公开字段不能补造。
待验证:本次未能重新核实原文。
- 平台
- Artificial Analysis 公开指标;provider 与 harness 按页面
- 版本/档位
- 版本、推理档位和时间窗口需重开确认
- 指标
- 质量、速度、成本只记录公开值,未知项不补造
MiniMax M3 官方发布:编码基准、长上下文与真实长任务案例
MiniMax 官方材料报告编码基准、长上下文和长时程 Agent 案例;完整 prompt、硬件、样本数和失败轨迹未公开,因此只能支持厂商定位,不能支持独立复现或生产成功率。
待验证:本次未能重新核实原文。
- 来源
- MiniMax 官方发布材料;厂商自报
- 任务
- 编码基准、长上下文、长时程 Agent 案例
- 配置
- 完整 prompt、硬件、样本数和失败轨迹未公开
Reddit:MiniMax-M3 与 M2.7 的对比及配额争议
原作者长期使用 M2.7,认为其质量/成本比优秀;试用 M3 后主要失望于新的额度限制,而不是模型本身。评论区出现两类相反反馈:一类认为 M3 更聪明、长 agent 更稳定;另一类认为 M3 慢、输出质量不稳定、额度消耗过快。该帖子适合作为“模型能力”和“套餐有效吞吐”需要分开评价的反例。
待验证:本次未能重新核实原文。
- 模型/版本
- 模型为 MiniMax-M3;来源标题:Reddit:MiniMax-M3 与 M2.7 的对比及配额争议。精确快照按原始来源。
- 任务/harness
- 用户对 M3 的评价分化:有人认为它比 M2.7 更聪明、更稳定,也有人认为它慢、输出不稳定且消耗额度;讨论区分了模型质量和套餐限制。完整任务集、provider、参数和评审流程未完全公开。
- 样本/日期
- 来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
Reddit:MiniMax-M3 Token Plan 的缓存与有效吞吐实测
这篇帖子不是对 M3 智力的测评,而是对 Token Plan 在 agentic coding 场景下“有效吞吐”的实测。作者通过 OpenCode、OpenRouter BYOK 和缓存命中率观察到:其理解中的 PAYG 缓存折扣没有体现在 Token Plan 上,重复读取上下文会快速消耗额度。评论区给出一个 90% 重复上下文假设下的数量级估算:有效新工作量可能从 0.895B 降到 0.17B,或从 0.17B 降到 0.032B,取决于预算口径。
待验证:本次未能重新核实原文。
- 模型/版本
- 模型为 MiniMax-M3;来源标题:Reddit:MiniMax-M3 Token Plan 的缓存与有效吞吐实测。精确快照按原始来源。
- 任务/harness
- The Token Plan post estimates repeated-context effective work could fall from about 0.895B to 0.17B or from 0.17B to 0.032B, depending on the budget interpretation. 完整任务集、provider、参数和评审流程未完全公开。
- 样本/日期
- 来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
X:DRACO 100 任务——四次 MiniMax-M3 加一次综合运行
作者称,四次 MiniMax-M3 research run 加第五次 M3 synthesizer 在 100 任务 DRACO benchmark 上得到 68.1 分;Fable 5 得到 65.3 分。M3 的 100 任务运行成本为 37 美元,Fable 的约 250 美元比较成本为建模值。作者的核心观点是:多个便宜副本可以带来有用的多样性。
待验证:本次未能重新核实原文。
- 模型/版本
- 模型为 MiniMax-M3;来源标题:X:DRACO 100 任务——四次 MiniMax-M3 加一次综合运行。精确快照按原始来源。
- 任务/harness
- The DRACO report claims four M3 research runs plus one M3 synthesizer scored 68.1 on 100 tasks versus Fable 5 at 65.3, with M3 cost $37 and Fable cost about $250 modeled. 完整任务集、provider、参数和评审流程未完全公开。
- 样本/日期
- 来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
X:FutureX 实时预测榜单——MiniMax-M3 基座 Agent 第七名
作者公布其长程预测 Agent 在 FutureX 榜单中的结果:Kimi K3 基座第 1、DeepSeek V4 Pro 基座第 3、MiniMax M3 基座第 7。FutureX 由 ByteDance Seed 联合 Stanford、Princeton、复旦出品,题目是尚未发生的真实事件,先提交预测、事件落地后按真实结果评分。作者强调,同一套框架只是替换三个模型作为“大脑”。
待验证:本次未能重新核实原文。
- 模型/版本
- 模型为 MiniMax-M3;来源标题:X:FutureX 实时预测榜单——MiniMax-M3 基座 Agent 第七名。精确快照按原始来源。
- 任务/harness
- The FutureX report places the M3-based forecasting Agent seventh, behind Kimi K3 first and DeepSeek V4 Pro third, using the same framework with only the model brain changed. 完整任务集、provider、参数和评审流程未完全公开。
- 样本/日期
- 来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。