在 Arena.ai 双盲对抗排位中,Qwen3.7-Max 位列全球纯文本总榜 #13、阿里巴巴实验室居全球 #6,并在数学 (#7)、专家领域 (#9)、软件与 IT (#9) 及代码生成 (#10) 等专业子榜稳居全球前十。
评测平台:Arena.ai(基于真实用户匿名盲测对抗机制,Elo 动态评分系统)。
样本范围:全球数百万次真实开发者与用户的 Prompt 对抗打分,消除基准过拟合与 Prompt 泄漏偏差。
参与版本:Qwen3.7-Max Preview(文本竞技场)。
评测模式:开放域用户真实交互提示词,覆盖编程、数学、长文写作、复杂多轮对话及系统指令遵循。
对比池:包含 OpenAI GPT 系列、Anthropic Claude 系列、Google Gemini 系列及各大顶尖开源衍生模型。
| 榜单分类 (Category) | 官方排位 (Rank) | 梯队定位 |
|---|---|---|
| 纯文本总榜 (Text Arena Overall) | #13 | 全球第一梯队旗舰模型 |
| 数学推理 (Math) | #7 | 显著超越同代普通大模型 |
| 专家领域 (Expert) | #9 | 高难度专业学术与专业咨询前十 |
| 软件与 IT (Software & IT) | #9 | 企业系统架构与 IT 运维前十 |
| 代码生成 (Coding) | #10 | 核心编程与 Bug 修复前十 |
| 实验室综合排名 (Lab Rank) | #6 | 阿里巴巴居全球前六大 AI 实验室 |
数学 (#7):仅次于头部极致推理模型(如 OpenAI o-series / GPT-5.x reasoning 旗舰、DeepSeek R 系列),在通用大模型中处于顶尖水准。
软件与 IT (#9):与 ITBench-AA 榜单表现相互印证,表明其在处理真实系统运维、网络策略与云原生基础设施诊断时具备扎实的上下文理解能力。
编码 (#10):在真实盲测中稳定位列全球前十,说明其编程生成质量获得了广大真实开发者的直接肯定。
盲测数据有效排除了学术基准过拟合的质疑:Qwen3.7-Max 在由全球真实用户主导的 Arena 盲测中展现出全面的高水准,特别是在数学与 IT 运维任务中具备突出竞争力。
数学与 IT 领域的突出排位(#7 与 #9)与后续企业 SRE、量化金融代码审查等垂直场景的高口碑高度契合。
Arena 早期打分主要基于 Preview 快照版本,随着各厂商模型的密集迭代,榜单排名存在动态变化。
盲测更侧重单轮或短多轮的直观感知质量,对需要工具调用的长程自动化 Agent(如 1,000 步以上的 CLI 迁移任务)覆盖相对有限。
登录 Arena.ai / LMSYS 平台,在 Direct Chat 或 Side-by-Side 模式中选择 qwen3.7-max。
构造覆盖数学证明、算法实现与复杂系统配置诊断的多轮对抗提示词。
统计模型在匿名比对下的胜率(Win Rate)与 Elo 积分变化。
Arena.ai 官方通报:“In Text Arena, Qwen3.7 Max Preview ranks #13 overall. Alibaba is now the #6 lab in this arena: #7 Math, #9 Expert, #9 Software & IT, #10 Coding”。
Qwen3.7 Max