官方展示的 M2.7 自优化循环把失败轨迹、计划、脚手架修改、评测、对比和保留/回滚串起来,可复用于长程 Agent,但必须把自动改动限制在沙箱并由测试门禁决定是否保留。
适合的任务:长程编码、实验/训练流水线、日志分析、技能/工具 harness 迭代、可重复评测驱动的 Agent。
不适合的任务:生产系统直接自改代码或参数;没有可回滚版本、固定 eval 和人工批准时不要启用。
适用的模型版本:MiniMax M2.7;官方案例使用内部 harness,公开 API 不保证自动拥有同等 memory/skills/Agent Teams。
适用的客户端、Agent 或 API:MiniMax Agent/API、自定义 OpenClaw/代码 Agent、可运行沙箱和版本控制系统。
推荐的推理档位和参数:官方 blog 未公开完整采样配置;自托管起点参考 temperature=1.0/top_p=.95/top_k=40,按 eval 扫描。
你是一个受沙箱约束的工程优化代理。
每轮严格执行:
1. 读取上一轮的短期记忆、失败轨迹和当前评测结果。
2. 只提出一个可审计的改动假设,并列出预期影响和回滚条件。
3. 修改隔离的 scaffold/skills/memory 文件,不修改生产凭证、数据或测试基线。
4. 运行预注册的评测集与 smoke tests。
5. 将“改动、测试、指标、错误、是否保留”写入本轮 memory Markdown。
6. 只有当主指标提升且无回归时保留改动,否则自动回滚。
7. 达到轮数/预算/连续无改进阈值就停止并输出报告。
输出字段:
- hypothesis
- changed_files
- evaluation_command
- before_after_metrics
- regressions
- keep_or_revert
- next_step固定 benchmark、测试集、随机种子、指标和最大迭代轮数,建立 baseline。
运行“分析失败轨迹 → 计划变化 → 修改 scaffold → 评测 → 对比 → 保留/回滚”循环。
每轮生成短期记忆 Markdown 和 self-critique;把文件纳入版本控制但禁止修改原始评测集。
运行 smoke tests、单元测试、权限扫描和工具调用回归;任何回归立即回滚。
报告各轮指标和成本,不把内部“30% 提升”外推为公开模型普遍提升。
MiniMax 描述 M2.7 在内部让模型更新 memory、构建技能并改善学习 harness;一个编程 scaffold 自主循环超过 100 轮,内部 eval 提升 30%。
官方公开的三组件是 short-term memory、self-feedback、self-optimization;每轮生成短期记忆 Markdown,并根据历轮记忆/反馈继续优化。
官方 ML Bench Lite 探索使用 22 个竞赛、3 次试验、每次 24 小时;最佳运行 9 金、5 银、1 铜,三次平均 medal rate 66.6%。
官方研究 Agent 流程覆盖文献复习、实验 spec、数据管道、实验启动/监控、日志读取、调试、指标分析、代码修复、MR 和 smoke test,并称内部流程可处理 30%–50%。
所有“30%”“66.6%”“30%–50%”是 MiniMax 内部/官方案例,未公开完整数据集、harness、方差和人工参与细节。
自优化对象是 harness/skills/memory,不等同于重新训练模型权重;不能把它宣传为模型自动学习的普遍能力。
公开 API 不自动提供内部 Agent Teams、memory、动态工具搜索或训练环境;需要自行实现并进行安全审计。
任何自动保留/回滚策略都需防止评测泄漏、指标投机、恶意工具调用和数据污染。
官方将核心循环概括为“analyze failure trajectories → plan changes → modify scaffold code → run evaluations → compare results → decide to keep or revert changes”(合规短引,11 个短语词以内)。
MiniMax M2.7