Artificial Analysis 独立实测显示 Qwen3.7-Max 智能指数达 47 分(排名前 23%),以 206.4 tok/s 输出速度位列第 9,单任务成本 $0.54 显著低于 Opus 5 与 GPT-5.6 Sol,但生成 100M Token 的倾向体现出较明显的长思维冗余。
评测基准体系:Artificial Analysis Intelligence Index v4.1.1。
包含子集:GDPval-AA v2、tau^3-Banking(𝜏³-Banking)、Terminal-Bench v2.1、SciCode、Humanity's Last Exam (HLE)、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR 共 9 项受控评测。
推理环境:基于 Alibaba Cloud Model Studio 官方推理端点,默认 10k 输入 token 负载实测。
比较池:全球 182 款同类推理与专有模型横向对比。
评测模式:启用完整 Reasoning / Thinking 模式。
输入/输出模态:纯文本(Text-only),单次请求最大上下文支持 1M tokens。
计费基准:输入 $2.50 / 1M tokens,输出 $7.50 / 1M tokens,上下文缓存折扣 80%。
总计消耗:在完成全部 Intelligence Index 评测中,累计产生 100M Output Tokens,总测试开销 $1,063.86。
| 维度 | 实测数值 | 横向排名 / 分位 | 同类基准中位数 |
|---|---|---|---|
| 综合智能指数 (Intelligence Index) | 47 分 | #42 / 182 | 35 分 |
| 输出生成速度 (Output Speed) | 206.4 tok/s | #9 / 182 | 76 tok/s |
| 首 Token 延迟 (TTFT) | 2.27s | 优于中位数 | 2.79s |
| 单任务加权成本 (Cost per Task) | $0.54 | #52 / 182 | - |
| 评测生成 Token 总量 (Verbosity) | 100M tokens | #56 / 182(偏冗长) | 72M tokens |
| 模型 | 推理档位 | 单任务成本 (USD) | 智能指数 (Intelligence Index) |
|---|---|---|---|
| GPT-5.6 Luna | max | $0.05 | 52 |
| DeepSeek V4 Pro (0813) | max | $0.25 | 53 |
| Gemini 3.7 Flash | high | $0.40 | 56 |
| Qwen3.7-Max | reasoning | $0.54 | 47 |
| GLM-5.3 | max | $0.68 | 60 |
| Grok 4.6 | high | $0.84 | 61 |
| Kimi K3 | max | $0.84 | 60 |
| GPT-5.6 Sol | max | $1.23 | 61 |
| Claude Opus 5 | max | $2.34 | 63 |
| Claude Fable 5 | fallback | $3.14 | 62 |
| 模型 | 输出速度 (tok/s) |
|---|---|
| Gemini 3.7 Flash (high) | 365 |
| Qwen3.7-Max | 206 |
| GPT-5.6 Luna (max) | 149 |
| Nemotron 3 Ultra | 126 |
| GLM-5.3 (max) | 93 |
| DeepSeek V4 Pro (0813) | 80 |
| Claude Fable 5 | 75 |
| Claude Opus 5 (max) | 59 |
| Kimi K3 (max) | 39 |
速度与吞吐优势突出:Qwen3.7-Max 在保持 47 分智能水平的同时,达到 206.4 tok/s 输出速率,比 Claude Opus 5(59 tok/s)快 3.5 倍,比 Kimi K3(39 tok/s)快 5.3 倍,非常适合交互型代码 Agent。
成本效费比具备竞争力:单任务 $0.54 的成本仅为 Claude Opus 5($2.34)的 23%,在需要高频调用推理能力的企业 IT 与代码重构场景下成本优势明显。
思维冗余度偏高:100M Token 的评测产出明显高于 72M 的行业中位数,说明模型在复杂逻辑推演时倾向于展开极长思维链(Long-thought),需配合合理的 max_tokens 预算。
仅支持纯文本输入,不支持视觉与截图输入(Multimodal Image Drop),无法直接用于前端 UI 截图审查。
随着 Qwen3.8-Max(56 分)的推出,官方已将 Qwen3.7-Max 列为 Deprecated 归档追踪状态,长远生产部署应评估向 3.8 版本的平滑迁移。
使用 Alibaba Model Studio 官方端点调用 qwen3.7-max-2026-05-20 快照,开启 enable_thinking: true。
运行标准 10k token 输入基线请求,记录 TTFT(期望在 2.0s~2.5s 区间)与流式输出 tok/s。
统计长程推理任务的思考 Token 占比(Thinking vs Final Answer),计算单任务真实完成成本。
Artificial Analysis 评测摘要总结:“Qwen3.7 Max is amongst the leading models in intelligence... It's also notably fast, however somewhat verbose. At 206 tokens per second, Qwen3.7 Max is notably fast”。
Qwen3.7 Max