Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
提示词与工作流

MiniMax M2.7 · workflow

MiniMax M2.7 的自反馈、记忆与 Agent 自优化工作流

把小型修复拆成计划、实现、测试、反思四轮;只把可验证失败原因写入记忆,并比较下一轮是否减少同一测试失败。

来源待核验可运行代码仓库、测试命令、版本化记忆文件和隔离分支;不要把凭据写入记忆。

前置条件与输入

  • Issue 或复现步骤
  • 仓库快照
  • 测试命令
  • 记忆写入规则
  • 前后轮对比指标

前置条件

可运行代码仓库、测试命令、版本化记忆文件和隔离分支;不要把凭据写入记忆。。

任务步骤

  1. 准备Issue 或复现步骤并固定其余输入。

  2. 按“MiniMax M2.7 的自反馈、记忆与 Agent 自优化工作流”的公开格式发送一次真实请求,保存请求、事件和返回。

  3. 对照验收规则判断,不把模型自述当作工具已执行。

任务结果

得到一条可复查记录,使输入、参数、工具返回和最终回答对齐。

输出与验收

检查响应状态、格式、关键字段与任务结果;保留原始错误。

失败修正

缩小到单工具、单轮和最小 schema,再逐项恢复字段;服务错误检查 endpoint、权限、模型名和超时。

来源与边界

本指南是 MiniMax 官方新闻 / MiniMax M2.7: Early Echoes of Self-Evolution 的公开说明,仅用于该任务试验,不保证其他后端行为。

查看来源研究笔记

一句话结论

官方展示的 M2.7 自优化循环把失败轨迹、计划、脚手架修改、评测、对比和保留/回滚串起来,可复用于长程 Agent,但必须把自动改动限制在沙箱并由测试门禁决定是否保留。

适用场景

  • 适合的任务:长程编码、实验/训练流水线、日志分析、技能/工具 harness 迭代、可重复评测驱动的 Agent。

  • 不适合的任务:生产系统直接自改代码或参数;没有可回滚版本、固定 eval 和人工批准时不要启用。

  • 适用的模型版本:MiniMax M2.7;官方案例使用内部 harness,公开 API 不保证自动拥有同等 memory/skills/Agent Teams。

  • 适用的客户端、Agent 或 API:MiniMax Agent/API、自定义 OpenClaw/代码 Agent、可运行沙箱和版本控制系统。

  • 推荐的推理档位和参数:官方 blog 未公开完整采样配置;自托管起点参考 temperature=1.0/top_p=.95/top_k=40,按 eval 扫描。

可直接使用的内容

你是一个受沙箱约束的工程优化代理。

每轮严格执行:
1. 读取上一轮的短期记忆、失败轨迹和当前评测结果。
2. 只提出一个可审计的改动假设,并列出预期影响和回滚条件。
3. 修改隔离的 scaffold/skills/memory 文件,不修改生产凭证、数据或测试基线。
4. 运行预注册的评测集与 smoke tests。
5. 将“改动、测试、指标、错误、是否保留”写入本轮 memory Markdown。
6. 只有当主指标提升且无回归时保留改动,否则自动回滚。
7. 达到轮数/预算/连续无改进阈值就停止并输出报告。

输出字段:
- hypothesis
- changed_files
- evaluation_command
- before_after_metrics
- regressions
- keep_or_revert
- next_step

测试/工作流步骤

  1. 固定 benchmark、测试集、随机种子、指标和最大迭代轮数,建立 baseline。

  2. 运行“分析失败轨迹 → 计划变化 → 修改 scaffold → 评测 → 对比 → 保留/回滚”循环。

  3. 每轮生成短期记忆 Markdown 和 self-critique;把文件纳入版本控制但禁止修改原始评测集。

  4. 运行 smoke tests、单元测试、权限扫描和工具调用回归;任何回归立即回滚。

  5. 报告各轮指标和成本,不把内部“30% 提升”外推为公开模型普遍提升。

原始证据与数据

  • MiniMax 描述 M2.7 在内部让模型更新 memory、构建技能并改善学习 harness;一个编程 scaffold 自主循环超过 100 轮,内部 eval 提升 30%。

  • 官方公开的三组件是 short-term memory、self-feedback、self-optimization;每轮生成短期记忆 Markdown,并根据历轮记忆/反馈继续优化。

  • 官方 ML Bench Lite 探索使用 22 个竞赛、3 次试验、每次 24 小时;最佳运行 9 金、5 银、1 铜,三次平均 medal rate 66.6%。

  • 官方研究 Agent 流程覆盖文献复习、实验 spec、数据管道、实验启动/监控、日志读取、调试、指标分析、代码修复、MR 和 smoke test,并称内部流程可处理 30%–50%。

适用边界

  • 所有“30%”“66.6%”“30%–50%”是 MiniMax 内部/官方案例,未公开完整数据集、harness、方差和人工参与细节。

  • 自优化对象是 harness/skills/memory,不等同于重新训练模型权重;不能把它宣传为模型自动学习的普遍能力。

  • 公开 API 不自动提供内部 Agent Teams、memory、动态工具搜索或训练环境;需要自行实现并进行安全审计。

  • 任何自动保留/回滚策略都需防止评测泄漏、指标投机、恶意工具调用和数据污染。

来源摘录或观察(仅做合规短引)

官方将核心循环概括为“analyze failure trajectories → plan changes → modify scaffold code → run evaluations → compare results → decide to keep or revert changes”(合规短引,11 个短语词以内)。

来源与日期

MiniMax 官方新闻 / MiniMax M2.7: Early Echoes of Self-Evolution · 原文日期: 2026-03 · 编辑日期: 2026-09-20

阅读原始来源
变量检查

无必填变量

相关提示词

MiniMax M2.7 官方默认提示与 XML 工具调用模板

相关测评

MiniMax M2.7 官方发布:SWE-Pro、VIBE-Pro 与 Agent 工作流基准BenchLM 对 MiniMax M2.7 的 18 项公开证据Reddit 用户对 MiniMax M2.7 的 1000 提示词与编码/工具体验

MiniMax M2.7

在 Tabbit 中使用 MiniMax M2.7

请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。