作者公布其长程预测 Agent 在 FutureX 榜单中的结果:Kimi K3 基座第 1、DeepSeek V4 Pro 基座第 3、MiniMax M3 基座第 7。FutureX 由 ByteDance Seed 联合 Stanford、Princeton、复旦出品,题目是尚未发生的真实事件,先提交预测、事件落地后按真实结果评分。作者强调,同一套框架只是替换三个模型作为“大脑”。
M3 在该特定预测 Agent 与 harness 中进入前十,说明它具备参与长程检索、证据整合和概率预测的能力。
这是“模型 + harness + 检索/裁决机制”的系统结果,不是裸模型分数。
原作者在回复中明确说:榜单分数测量的是整个 harness 系统能力;要比较模型本身,需要控制 harness 变量并做稳定可复现的对比实验。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
该结果是作者团队的 Agent 结果,未公开 MiniMax-M3 单独运行分数、完整任务集和对照 harness。不能据此推出 M3 在所有预测任务中排名第七。
MiniMax M3