官方结果显示 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上很强,但分数来自不同 harness,最有说服力的复现路径是固定任务、工具和验证器后自行测 cost-per-success。
模型:Qwen3.7-Max,与 Opus-4.6 Max、K2.6 Thinking、GLM-5.1 Thinking、DeepSeek V4 Pro Max、Qwen3.6-Plus 对照。
Agent 框架:Claude Code、OpenClaw、Qwen Code 及自定义工具框架;官方强调任务、harness、verifier 解耦以测试跨框架泛化。
Terminal-Bench 2.0-Terminus:Harbor/Terminus-2,5 小时 timeout,12 CPU/24GB RAM,temperature 1.0、top_p 0.95、top_k 20、max_tokens 80K、256K context,5 runs 平均。
SWE 系列:内部 Agent scaffold(bash + file-edit tools),temperature 1.0、top_p 0.95、200K context。
SkillsBench:OpenCode,78 tasks,排除 9 个外部 API 依赖任务,5 runs 平均。
Kernel Bench L3:50 个问题,单个隔离 Docker、1 张 H100 80GB,限制网络,最多 500 tool calls;连续 100 次无改进后 early stop。
官方页面公开了 benchmark 名称、部分 harness、超时和采样设置,但没有公开每项任务的完整 prompt、随机种子、全部失败轨迹或可下载运行包。35 小时 kernel 案例使用平头哥真武 M890 PPU 和自研评估脚本,不能当成通用硬件测试。
| 基准 | Qwen3.7-Max |
|---|---|
| Terminal Bench 2.0-Terminus | 69.7 |
| SWE-Verified | 80.4 |
| SWE-Pro | 60.6 |
| SWE-Multilingual | 78.3 |
| NL2repo | 47.2 |
| SciCode | 53.5 |
| QwenWebDev | 1568 |
| QwenSVG | 1608 |
| Qwenclaw | 64.3 |
| CoWorkBench | 67.2 |
| ClawEval | 65.2 |
| Skillsbench | 59.2 |
| BFCL-V4 | 75.0 |
| MCP-Mark | 60.8 |
| MCP-Atlas | 76.4 |
| SpreadSheetBench-v1 | 87.0 |
| Kernel Bench L3 | 1.98x / 96% |
| 基准 | Qwen3.7-Max |
|---|---|
| GPQA Diamond | 92.4 |
| HLE | 41.4 |
| LiveCodeBench | 91.6 |
| HMMT 2026 Feb | 97.1 |
| IMOAnswerBench | 90.0 |
| Apex | 44.5 |
| MMLU-Pro | 89.6 |
| IFBench | 79.1 |
| MRCR-v2 128K | 90.4 |
| WMT24++ | 85.8 |
| MAXIFE | 89.2 |
| PolyMATH | 86.5 |
Extend Attention kernel 实验:约 35 小时、432 次 kernel evaluation、1,158 次工具调用;相对 Triton 参考实现几何平均加速比 10.0x。
对照:GLM-5.1 7.3x、Kimi K2.6 5.0x、DeepSeek V4 Pro 3.3x、Qwen3.6-Plus 1.1x;官方页面没有给出相同硬件/工具全部细节。
Reward-hacking 监控:超过 80 小时 RL 实验、累计万次调用,新增 13 条启发式规则并识别 1,618 个作弊案例。
YC-Bench 模拟经营:Qwen3.7-Max 营收 2.08M 美元、完成 237 项任务;这是官方模拟环境,不是现实企业 ROI。
编码与工具调用是官方证据最密集的优势面:SWE-Verified 80.4、MCP-Atlas 76.4、Skillsbench 59.2、Kernel Bench L3 1.98x/96%。
MRCR-v2 128K 为 90.4,配合 1M 级上下文定位,适合长文档/长程 Agent 的候选测试,但不能把单个检索分数外推到所有文档结构。
35 小时实验支持“在特定工具和验证器下能保持长程进展”,不等于所有 Agent harness 都能无人值守运行 35 小时。
多 benchmark 表格展示了能力广度,但不同任务的裁判、工具和采样配置不同,应按任务类型拆分比较。
官方发布数据存在供应商选择、内部 benchmark 和自报结果偏差;没有独立盲测。
QwenWebDev、QwenClaw、CoWorkBench、YC-Bench 等内部 benchmark 的任务和评审细节不完整,不能独立重算。
部分分数由不同 harness、judge 或环境产生;跨表横向排序不严谨。
35 小时 kernel、RL 监控和企业模拟环境高度特定,不能直接当作生产 SLA、投资回报或安全保证。
选一个公开任务集,固定 Qwen3.7-Max dated snapshot、temperature、top_p、推理开关、工具版本、context 和 timeout。
对 Agent 任务保存任务、harness、verifier 三者版本;记录每轮工具调用、失败、重试、tokens、墙钟时间和成本。
对 Terminal/SWE 先重复 5 runs,再报告均值、方差、首轮通过率和人工纠正次数。
对长程任务设置无改进停止阈值,分开报告“完成率”和“持续运行时间”,避免只宣传最长运行时长。
选至少一个非 Qwen judge 或独立代码检查器复核结果,并比较 cost-per-success 而非单一 benchmark。
官方把模型概括为 “The Agent Frontier”,但页面同时给出了各 benchmark 的 harness 和限制,复现时应保留这些条件。
Qwen3.7 Max