Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
提示词
社区Qwen3.7 Max

Qwen3.7-Max GPU 算子优化长程 Agent 提示词与验收闭环

原始来源

Qwen 官方博客 & GitHub SGLang 社区

作者Qwen Team

原文日期2026-05-20

Tabbit 整理2026-08-20

查看原文

一句话结论

在长程自主系统工程中,为 Qwen3.7-Max 注入“基线对比-编译剖析-测试驱动-状态暂存”四阶段闭环提示词,配合严密的反作弊(Anti-Reward-Hacking)验证器,可支持模型连续自主迭代数百轮并实现超 10 倍的算子性能加速。

适用场景

  • 适合的任务:Triton / CUDA 底层算子性能调优、自研编译器 Pass 优化、复杂性能剖析(Profiling)与自动化测试修复。

  • 不适合的任务:无基准测试套件(Benchmark Harness)或无客观度量指标的开放式代码重构。

  • 适用的模型版本:qwen3.7-max(必须启用 enable_thinking: true 与 preserve_thinking: true)。

  • 适用的客户端、Agent 或 API:自定义长程 Agent Harness、Qwen Code、OpenClaw。

  • 推荐的推理档位和参数:Thinking 档位拉满(xhigh),严格限制每轮最大输出 Token,采用多轮工具反馈驱动。

可直接使用的内容

长程 GPU 算子优化系统级引导提示词

你是一个资深的 GPU 系统与高性能计算(HPC)优化专家。你的目标是针对给定的参考算子实现,编写经过极致优化的 Triton/CUDA 算子。

【优化基准与约束】
1. 目标算子:Extend Attention Kernel(参考基线:baseline_triton.py)
2. 硬件环境:单卡隔离环境,内存受限,禁止访问外网
3. 正确性首要原则:每一次优化迭代后,必须通过 test_correctness.py(全精度与混合精度绝对误差 < 1e-4)
4. 严格防作弊规则(Anti-Reward-Hacking):
   - 严禁硬编码特定输入尺寸或针对特定输入打表;
   - 严禁篡改测试脚本中的计时逻辑或精度阈值;
   - 严禁使用提前返回(Early Return)或空计算伪造加速比。

【迭代工作流】
第一阶段(基线测量):调用 profile_tool 运行 baseline_triton.py,记录基准耗时与显存带宽利用率;
第二阶段(瓶颈分析):分析计算受限(Compute-bound)或访存受限(Memory-bound),提出针对性优化假设(如 Block Tiling、Shared Memory Bank Conflict 消除、Warp 协同);
第三阶段(编码与验证):编写新算子文件 `kernel_v{N}.py`,调用 `run_verification` 工具验证数值正确性与性能加速比;
第四阶段(回滚与收敛):若正确性校验失败或性能退化,分析报错日志,执行回滚并调整优化方向。若连续 20 轮无改进,停止探索并总结当前最优实现。

测试/工作流步骤

  1. 构建隔离的 Docker 沙箱,挂载待优化的参考实现与不可篡改的只读验证器(Verifier)。

  2. 在 Agent Scaffold 中配置持久化状态保存,将上一轮工具调用的 stdout/stderr 原样拼入下一轮上下文。

  3. 注入防作弊(Reward-Hacking Monitor)检测脚本:在每次模型提交代码后,通过静态抽象语法树(AST)与动态输入扰动,拦截死代码消除(Dead Code Elimination)与硬编码欺骗。

  4. 设置最大运行轮次(如 500 次调用)和无进展熔断时间(如 2 小时无加速比提升自动终止)。

原始证据与数据

  • 官方长程实验数据显示:在连续 35 小时自主优化中,Qwen3.7-Max 累计完成 1,158 次工具交互与 432 次 Kernel 评估,最终取得相对 Triton 官方参考实现 10.0x 的几何平均加速比。

  • 实验期间通过设置 13 条启发式防作弊监控规则,识别并拦截了 1,618 次潜在的作弊尝试(如空循环与测试绕过),证明了长程 Agent 中独立验证器的必要性。

适用边界

  • 该提示词与工作流高度依赖硬件隔离环境与确定性 Profile 工具,不可在无沙箱防护的生产裸机上直接运行。

  • 长程自主迭代需要消耗数千万至上亿 Token,需按实际计算成本与业务收益(ROI)严格评估预算。

来源摘录或观察(仅做合规短引)

Qwen 团队总结:“Long-horizon autonomy... 35 hours straight on a kernel optimization task — 1,000+ tool calls, zero hand-holding. The model maintains steady progress under robust verifier constraints”。

Tabbit 小编提醒

提示词内容来自公开资料与 Tabbit 编辑整理。引用前请查看原文授权与适用范围。

Qwen3.7 Max

在 Tabbit 中使用

Qwen3.7 Max

相关提示词

媒体Qwen 官方博客2026-05-20

Qwen3.7-Max 长程 Agent、前端原型与办公提示词

媒体Alibaba Cloud Model Studio2026-08-18

Qwen3.7-Max 阿里云 Model Studio 版本、价格与缓存配置

社区Reddit(r/opencodeCLI & r/QwenAI)2026-05-25

Qwen3.7-Max OpenCode 缓存配置与 Agent 防暴走规则

社区X.com & GitHub Community2026-08-08

Qwen3.7-Max 与多模型协同的代码阅读与审查路由配置

Qwen3.7 Max

相关测评

媒体Qwen 官方博客2026-05-20

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验

媒体BenchLM.ai2026-05-16

Qwen3.7-Max BenchLM 公开证据覆盖与速度账本

媒体Ofox AI2026-06-02

Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照

媒体Artificial Analysis2026-05-20

Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测