作者不信任厂商公开基准,因此在一个真实的 brownfield 项目上设计了几个原子任务,比较 MiniMax-M3、MiMo 和 Kimi K2.6。作者称三者都完成了任务,但速度和成本不同;帖子 TL;DR 为 MiMo 略胜。该结果更接近日常开发任务体验,不是严格的公开基准。
同一真实项目、同一类任务比单看厂商宣传更有参考价值。
M3 的优势并非在所有单次编码任务上都成立;任务类型、速度、成本和上下文保持能力会改变排序。
评论中原作者补充:测试是 Next.js 项目上的原子任务,例如修复 API bug 或实现新 API,目的是服务自己的日常工作流。
评论者补充了另一种体验:M3 在上下文保持上胜过 K2.6,而 K2.6 的单轮响应更快;如果需要模型记住 20 多轮工具调用,M3 更有吸引力。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
帖子中的图表以图片形式发布,当前页面正文没有给出完整的逐项分数、耗时和成本表。因此本文不把“MiMo 略胜”扩写成精确排名,也不把评论中的个人体验当作普遍结论。
MiniMax M3