Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
提示词
媒体MiniMax M2.7

MiniMax M2.7 的自反馈、记忆与 Agent 自优化工作流

原始来源

MiniMax 官方新闻 / MiniMax M2.7: Early Echoes of Self-Evolution

作者MiniMax

原文日期2026-03

Tabbit 整理2026-08-19

查看原文

一句话结论

官方展示的 M2.7 自优化循环把失败轨迹、计划、脚手架修改、评测、对比和保留/回滚串起来,可复用于长程 Agent,但必须把自动改动限制在沙箱并由测试门禁决定是否保留。

适用场景

  • 适合的任务:长程编码、实验/训练流水线、日志分析、技能/工具 harness 迭代、可重复评测驱动的 Agent。

  • 不适合的任务:生产系统直接自改代码或参数;没有可回滚版本、固定 eval 和人工批准时不要启用。

  • 适用的模型版本:MiniMax M2.7;官方案例使用内部 harness,公开 API 不保证自动拥有同等 memory/skills/Agent Teams。

  • 适用的客户端、Agent 或 API:MiniMax Agent/API、自定义 OpenClaw/代码 Agent、可运行沙箱和版本控制系统。

  • 推荐的推理档位和参数:官方 blog 未公开完整采样配置;自托管起点参考 temperature=1.0/top_p=.95/top_k=40,按 eval 扫描。

可直接使用的内容

你是一个受沙箱约束的工程优化代理。

每轮严格执行:
1. 读取上一轮的短期记忆、失败轨迹和当前评测结果。
2. 只提出一个可审计的改动假设,并列出预期影响和回滚条件。
3. 修改隔离的 scaffold/skills/memory 文件,不修改生产凭证、数据或测试基线。
4. 运行预注册的评测集与 smoke tests。
5. 将“改动、测试、指标、错误、是否保留”写入本轮 memory Markdown。
6. 只有当主指标提升且无回归时保留改动,否则自动回滚。
7. 达到轮数/预算/连续无改进阈值就停止并输出报告。

输出字段:
- hypothesis
- changed_files
- evaluation_command
- before_after_metrics
- regressions
- keep_or_revert
- next_step

测试/工作流步骤

  1. 固定 benchmark、测试集、随机种子、指标和最大迭代轮数,建立 baseline。

  2. 运行“分析失败轨迹 → 计划变化 → 修改 scaffold → 评测 → 对比 → 保留/回滚”循环。

  3. 每轮生成短期记忆 Markdown 和 self-critique;把文件纳入版本控制但禁止修改原始评测集。

  4. 运行 smoke tests、单元测试、权限扫描和工具调用回归;任何回归立即回滚。

  5. 报告各轮指标和成本,不把内部“30% 提升”外推为公开模型普遍提升。

原始证据与数据

  • MiniMax 描述 M2.7 在内部让模型更新 memory、构建技能并改善学习 harness;一个编程 scaffold 自主循环超过 100 轮,内部 eval 提升 30%。

  • 官方公开的三组件是 short-term memory、self-feedback、self-optimization;每轮生成短期记忆 Markdown,并根据历轮记忆/反馈继续优化。

  • 官方 ML Bench Lite 探索使用 22 个竞赛、3 次试验、每次 24 小时;最佳运行 9 金、5 银、1 铜,三次平均 medal rate 66.6%。

  • 官方研究 Agent 流程覆盖文献复习、实验 spec、数据管道、实验启动/监控、日志读取、调试、指标分析、代码修复、MR 和 smoke test,并称内部流程可处理 30%–50%。

适用边界

  • 所有“30%”“66.6%”“30%–50%”是 MiniMax 内部/官方案例,未公开完整数据集、harness、方差和人工参与细节。

  • 自优化对象是 harness/skills/memory,不等同于重新训练模型权重;不能把它宣传为模型自动学习的普遍能力。

  • 公开 API 不自动提供内部 Agent Teams、memory、动态工具搜索或训练环境;需要自行实现并进行安全审计。

  • 任何自动保留/回滚策略都需防止评测泄漏、指标投机、恶意工具调用和数据污染。

来源摘录或观察(仅做合规短引)

官方将核心循环概括为“analyze failure trajectories → plan changes → modify scaffold code → run evaluations → compare results → decide to keep or revert changes”(合规短引,11 个短语词以内)。

Tabbit 小编提醒

提示词内容来自公开资料与 Tabbit 编辑整理。引用前请查看原文授权与适用范围。

MiniMax M2.7

在 Tabbit 中使用

MiniMax M2.7

相关提示词

社区GitHub / MiniMax-AI/MiniMax-M2.72026-03

MiniMax M2.7 官方默认提示与 XML 工具调用模板

MiniMax M2.7

相关测评

媒体MiniMax News / Early Echoes of Self-Evolution2026-03

MiniMax M2.7 官方发布:SWE-Pro、VIBE-Pro 与 Agent 工作流基准

媒体BenchLM2026-08-17

BenchLM 对 MiniMax M2.7 的 18 项公开证据

社区Reddit / r/MiniMaxAI2026-03

Reddit 用户对 MiniMax M2.7 的 1000 提示词与编码/工具体验