Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
提示词与工作流

Qwen3.7 Max · workflow

Qwen3.7-Max GPU 算子优化长程 Agent 提示词与验收闭环

Qwen 团队的 GPU 算子案例把性能假设、编译测试、基准回归和长程进度记录连成闭环,硬件与验证器是关键边界。

来源已核对;未实测Qwen3.7 Max client or API; pin the live model ID, provider, tools, permissions, and snapshot before execution.

前置条件与输入

  • task goal
  • source or reference material
  • runtime constraints
  • acceptance criteria

完整可复制模板

编辑改写:任务模板

Tabbit 编辑改写;非来源原文
为 {{KERNEL_TARGET}} 记录 {{BASELINE_METRICS}}、{{HARDWARE_TARGET}} 和 {{CORRECTNESS_ORACLE}},按 {{OPTIMIZATION_STAGES}} 修改并保存 {{BENCHMARK_LOG}};只有 {{NUMERICAL_TOLERANCE}} 和 {{SPEEDUP_GATE}} 同时通过才合并。

请把每个变量写入验收记录,并逐项回写实际结果。

运行前仍需替换: {{KERNEL_TARGET}}, {{BASELINE_METRICS}}, {{HARDWARE_TARGET}}, {{CORRECTNESS_ORACLE}}, {{OPTIMIZATION_STAGES}}, {{BENCHMARK_LOG}}, {{NUMERICAL_TOLERANCE}}, {{SPEEDUP_GATE}}

为 {{KERNEL_TARGET}} 记录 {{BASELINE_METRICS}}、{{HARDWARE_TARGET}} 和 {{CORRECTNESS_ORACLE}},按 {{OPTIMIZATION_STAGES}} 修改并保存 {{BENCHMARK_LOG}};只有 {{NUMERICAL_TOLERANCE}} 和 {{SPEEDUP_GATE}} 同时通过才合并。

查看来源研究笔记

一句话结论

在长程自主系统工程中,为 Qwen3.7-Max 注入“基线对比-编译剖析-测试驱动-状态暂存”四阶段闭环提示词,配合严密的反作弊(Anti-Reward-Hacking)验证器,可支持模型连续自主迭代数百轮并实现超 10 倍的算子性能加速。

适用场景

  • 适合的任务:Triton / CUDA 底层算子性能调优、自研编译器 Pass 优化、复杂性能剖析(Profiling)与自动化测试修复。

  • 不适合的任务:无基准测试套件(Benchmark Harness)或无客观度量指标的开放式代码重构。

  • 适用的模型版本:qwen3.7-max(必须启用 enable_thinking: true 与 preserve_thinking: true)。

  • 适用的客户端、Agent 或 API:自定义长程 Agent Harness、Qwen Code、OpenClaw。

  • 推荐的推理档位和参数:Thinking 档位拉满(xhigh),严格限制每轮最大输出 Token,采用多轮工具反馈驱动。

可直接使用的内容

长程 GPU 算子优化系统级引导提示词

你是一个资深的 GPU 系统与高性能计算(HPC)优化专家。你的目标是针对给定的参考算子实现,编写经过极致优化的 Triton/CUDA 算子。

【优化基准与约束】
1. 目标算子:Extend Attention Kernel(参考基线:baseline_triton.py)
2. 硬件环境:单卡隔离环境,内存受限,禁止访问外网
3. 正确性首要原则:每一次优化迭代后,必须通过 test_correctness.py(全精度与混合精度绝对误差 < 1e-4)
4. 严格防作弊规则(Anti-Reward-Hacking):
   - 严禁硬编码特定输入尺寸或针对特定输入打表;
   - 严禁篡改测试脚本中的计时逻辑或精度阈值;
   - 严禁使用提前返回(Early Return)或空计算伪造加速比。

【迭代工作流】
第一阶段(基线测量):调用 profile_tool 运行 baseline_triton.py,记录基准耗时与显存带宽利用率;
第二阶段(瓶颈分析):分析计算受限(Compute-bound)或访存受限(Memory-bound),提出针对性优化假设(如 Block Tiling、Shared Memory Bank Conflict 消除、Warp 协同);
第三阶段(编码与验证):编写新算子文件 `kernel_v{N}.py`,调用 `run_verification` 工具验证数值正确性与性能加速比;
第四阶段(回滚与收敛):若正确性校验失败或性能退化,分析报错日志,执行回滚并调整优化方向。若连续 20 轮无改进,停止探索并总结当前最优实现。

测试/工作流步骤

  1. 构建隔离的 Docker 沙箱,挂载待优化的参考实现与不可篡改的只读验证器(Verifier)。

  2. 在 Agent Scaffold 中配置持久化状态保存,将上一轮工具调用的 stdout/stderr 原样拼入下一轮上下文。

  3. 注入防作弊(Reward-Hacking Monitor)检测脚本:在每次模型提交代码后,通过静态抽象语法树(AST)与动态输入扰动,拦截死代码消除(Dead Code Elimination)与硬编码欺骗。

  4. 设置最大运行轮次(如 500 次调用)和无进展熔断时间(如 2 小时无加速比提升自动终止)。

原始证据与数据

  • 官方长程实验数据显示:在连续 35 小时自主优化中,Qwen3.7-Max 累计完成 1,158 次工具交互与 432 次 Kernel 评估,最终取得相对 Triton 官方参考实现 10.0x 的几何平均加速比。

  • 实验期间通过设置 13 条启发式防作弊监控规则,识别并拦截了 1,618 次潜在的作弊尝试(如空循环与测试绕过),证明了长程 Agent 中独立验证器的必要性。

适用边界

  • 该提示词与工作流高度依赖硬件隔离环境与确定性 Profile 工具,不可在无沙箱防护的生产裸机上直接运行。

  • 长程自主迭代需要消耗数千万至上亿 Token,需按实际计算成本与业务收益(ROI)严格评估预算。

来源摘录或观察(仅做合规短引)

Qwen 团队总结:“Long-horizon autonomy... 35 hours straight on a kernel optimization task — 1,000+ tool calls, zero hand-holding. The model maintains steady progress under robust verifier constraints”。

来源与日期

Qwen 官方博客 & GitHub SGLang 社区 · 原文日期: 2026-05-20 · 编辑日期: 2026-09-20

阅读原始来源
变量检查

仍需替换: 8

{{KERNEL_TARGET}}{{BASELINE_METRICS}}{{HARDWARE_TARGET}}{{CORRECTNESS_ORACLE}}{{OPTIMIZATION_STAGES}}{{BENCHMARK_LOG}}{{NUMERICAL_TOLERANCE}}{{SPEEDUP_GATE}}

相关提示词

Qwen3.7-Max 长程 Agent、前端原型与办公提示词Qwen3.7-Max 与多模型协同的代码阅读与审查路由配置Qwen3.7-Max Three.js 电子魔方与 3D 物理交互原型提示词Qwen3.7-Max OpenCode 缓存配置与 Agent 防暴走规则

相关测评

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验Qwen3.7-Max BenchLM 公开证据覆盖与速度账本Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测

模型深度阅读

总览 · 简体中文

Qwen3.7 Max:模型定位、获取方式与适用边界

从官方快照、百万级上下文、Agent 场景、价格口径和实际风险,快速判断 Qwen3.7 Max 是否适合你的工作流。

Qwen3.7 Max

在 Tabbit 中使用 Qwen3.7 Max

请在上方所列环境中运行本指南。下载不会自动传入模板,也不代表账户已开放该模型。