在长程自主系统工程中,为 Qwen3.7-Max 注入“基线对比-编译剖析-测试驱动-状态暂存”四阶段闭环提示词,配合严密的反作弊(Anti-Reward-Hacking)验证器,可支持模型连续自主迭代数百轮并实现超 10 倍的算子性能加速。
适合的任务:Triton / CUDA 底层算子性能调优、自研编译器 Pass 优化、复杂性能剖析(Profiling)与自动化测试修复。
不适合的任务:无基准测试套件(Benchmark Harness)或无客观度量指标的开放式代码重构。
适用的模型版本:qwen3.7-max(必须启用 enable_thinking: true 与 preserve_thinking: true)。
适用的客户端、Agent 或 API:自定义长程 Agent Harness、Qwen Code、OpenClaw。
推荐的推理档位和参数:Thinking 档位拉满(xhigh),严格限制每轮最大输出 Token,采用多轮工具反馈驱动。
你是一个资深的 GPU 系统与高性能计算(HPC)优化专家。你的目标是针对给定的参考算子实现,编写经过极致优化的 Triton/CUDA 算子。
【优化基准与约束】
1. 目标算子:Extend Attention Kernel(参考基线:baseline_triton.py)
2. 硬件环境:单卡隔离环境,内存受限,禁止访问外网
3. 正确性首要原则:每一次优化迭代后,必须通过 test_correctness.py(全精度与混合精度绝对误差 < 1e-4)
4. 严格防作弊规则(Anti-Reward-Hacking):
- 严禁硬编码特定输入尺寸或针对特定输入打表;
- 严禁篡改测试脚本中的计时逻辑或精度阈值;
- 严禁使用提前返回(Early Return)或空计算伪造加速比。
【迭代工作流】
第一阶段(基线测量):调用 profile_tool 运行 baseline_triton.py,记录基准耗时与显存带宽利用率;
第二阶段(瓶颈分析):分析计算受限(Compute-bound)或访存受限(Memory-bound),提出针对性优化假设(如 Block Tiling、Shared Memory Bank Conflict 消除、Warp 协同);
第三阶段(编码与验证):编写新算子文件 `kernel_v{N}.py`,调用 `run_verification` 工具验证数值正确性与性能加速比;
第四阶段(回滚与收敛):若正确性校验失败或性能退化,分析报错日志,执行回滚并调整优化方向。若连续 20 轮无改进,停止探索并总结当前最优实现。构建隔离的 Docker 沙箱,挂载待优化的参考实现与不可篡改的只读验证器(Verifier)。
在 Agent Scaffold 中配置持久化状态保存,将上一轮工具调用的 stdout/stderr 原样拼入下一轮上下文。
注入防作弊(Reward-Hacking Monitor)检测脚本:在每次模型提交代码后,通过静态抽象语法树(AST)与动态输入扰动,拦截死代码消除(Dead Code Elimination)与硬编码欺骗。
设置最大运行轮次(如 500 次调用)和无进展熔断时间(如 2 小时无加速比提升自动终止)。
官方长程实验数据显示:在连续 35 小时自主优化中,Qwen3.7-Max 累计完成 1,158 次工具交互与 432 次 Kernel 评估,最终取得相对 Triton 官方参考实现 10.0x 的几何平均加速比。
实验期间通过设置 13 条启发式防作弊监控规则,识别并拦截了 1,618 次潜在的作弊尝试(如空循环与测试绕过),证明了长程 Agent 中独立验证器的必要性。
该提示词与工作流高度依赖硬件隔离环境与确定性 Profile 工具,不可在无沙箱防护的生产裸机上直接运行。
长程自主迭代需要消耗数千万至上亿 Token,需按实际计算成本与业务收益(ROI)严格评估预算。
Qwen 团队总结:“Long-horizon autonomy... 35 hours straight on a kernel optimization task — 1,000+ tool calls, zero hand-holding. The model maintains steady progress under robust verifier constraints”。
Qwen3.7 Max