Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Qwen3.7 Max · 社区来源 · 个人体验

Qwen3.7-Max Arena.ai 盲测榜单与专业领域排位

ArenaAI 社区盲测把 Qwen3.7 Max 放入纯文本和专业领域排名;结果随快照和投票池变化,不能替代固定任务评测。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源个人体验编辑日期 2026-09-20

测试条件速查

来源具体观察
2026-05-18 X/Arena 贴文,样本描述为大量真实用户 prompt 对抗投票,覆盖文本、数学和专业领域。
已公布条件
帖子未公开完整投票样本、快照、提示、评审脚本或重复方案,且早期 preview 排名会动态变化。

关键数据与适用场景

一句话结论

在 Arena.ai 双盲对抗排位中,Qwen3.7-Max 位列全球纯文本总榜 #13、阿里巴巴实验室居全球 #6,并在数学 (#7)、专家领域 (#9)、软件与 IT (#9) 及代码生成 (#10) 等专业子榜稳居全球前十。

测试环境

  • 评测平台:Arena.ai(基于真实用户匿名盲测对抗机制,Elo 动态评分系统)。

  • 样本范围:全球数百万次真实开发者与用户的 Prompt 对抗打分,消除基准过拟合与 Prompt 泄漏偏差。

  • 参与版本:Qwen3.7-Max Preview(文本竞技场)。

输入/配置

  • 评测模式:开放域用户真实交互提示词,覆盖编程、数学、长文写作、复杂多轮对话及系统指令遵循。

  • 对比池:包含 OpenAI GPT 系列、Anthropic Claude 系列、Google Gemini 系列及各大顶尖开源衍生模型。

结果数据

1. 纯文本竞技场 (Text Arena) 综合与细分榜单排名

榜单分类 (Category)官方排位 (Rank)梯队定位
纯文本总榜 (Text Arena Overall)#13全球第一梯队旗舰模型
数学推理 (Math)#7显著超越同代普通大模型
专家领域 (Expert)#9高难度专业学术与专业咨询前十
软件与 IT (Software & IT)#9企业系统架构与 IT 运维前十
代码生成 (Coding)#10核心编程与 Bug 修复前十
实验室综合排名 (Lab Rank)#6阿里巴巴居全球前六大 AI 实验室

2. 跨模型排名梯队对照

  • 数学 (#7):仅次于头部极致推理模型(如 OpenAI o-series / GPT-5.x reasoning 旗舰、DeepSeek R 系列),在通用大模型中处于顶尖水准。

  • 软件与 IT (#9):与 ITBench-AA 榜单表现相互印证,表明其在处理真实系统运维、网络策略与云原生基础设施诊断时具备扎实的上下文理解能力。

  • 编码 (#10):在真实盲测中稳定位列全球前十,说明其编程生成质量获得了广大真实开发者的直接肯定。

结论

  • 盲测数据有效排除了学术基准过拟合的质疑:Qwen3.7-Max 在由全球真实用户主导的 Arena 盲测中展现出全面的高水准,特别是在数学与 IT 运维任务中具备突出竞争力。

  • 数学与 IT 领域的突出排位(#7 与 #9)与后续企业 SRE、量化金融代码审查等垂直场景的高口碑高度契合。

局限

  • Arena 早期打分主要基于 Preview 快照版本,随着各厂商模型的密集迭代,榜单排名存在动态变化。

  • 盲测更侧重单轮或短多轮的直观感知质量,对需要工具调用的长程自动化 Agent(如 1,000 步以上的 CLI 迁移任务)覆盖相对有限。

复现步骤

  1. 登录 Arena.ai / LMSYS 平台,在 Direct Chat 或 Side-by-Side 模式中选择 qwen3.7-max。

  2. 构造覆盖数学证明、算法实现与复杂系统配置诊断的多轮对抗提示词。

  3. 统计模型在匿名比对下的胜率(Win Rate)与 Elo 积分变化。

来源摘录或观察(仅做合规短引)

Arena.ai 官方通报:“In Text Arena, Qwen3.7 Max Preview ranks #13 overall. Alibaba is now the #6 lab in this arena: #7 Math, #9 Expert, #9 Software & IT, #10 Coding”。

能支持的判断

  • ArenaAI 社区盲测把 Qwen3.7 Max 放入纯文本和专业领域排名;结果随快照和投票池变化,不能替代固定任务评测。

不能支持的判断

  • Arena 分数受匿名路由、投票者构成、对手集合和快照时间影响;页面未提供固定任务、工具或成本对照,因此不能据此预测生产 Agent 的成功率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Arena.ai(LMSYS Chatbot Arena) · Arena.ai Team / Qwen Team · 原文发布日期 2026-05-18 · 本站编辑日期 2026-09-20

打开原始来源

Qwen3.7 Max

在 Tabbit 中比较 Qwen3.7 Max

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Qwen3.7 Max:模型定位、获取方式与适用边界

从官方快照、百万级上下文、Agent 场景、价格口径和实际风险,快速判断 Qwen3.7 Max 是否适合你的工作流。

相关评测

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验Qwen 官方报告 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上的结果,并展示 35 小时 GPU 优化实验;各项分数依赖不同 harness。Qwen3.7-Max BenchLM 公开证据覆盖与速度账本BenchLM 的 Qwen3.7 Max 账本记录 71.6/100、公开排名 #16/218、证据验证排名 #13/104 以及 204 tok/s 和 14.07 秒首 token;其聚合口径不统一。Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照Ofox 用相同提示、每项 5 次运行中位数和 senior reviewer 比较 Qwen3.7 Max/Plus;Max 在文本与长程迁移有小幅优势,Plus 约便宜 5 倍且支持视觉。Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测Artificial Analysis 把 Qwen3.7 Max 放入 182 模型池,按推理档位比较智能指数、单任务成本和输出速度;长思维 token 与档位会显著改变成本。Qwen3.7-Max Three.js 电子魔方与 3D 物理交互原型提示词阿里云公开 Three.js 案例把视觉参考、交互规则和物理验收写成电子魔方原型任务,适合做浏览器端视觉原型的编辑改写。Qwen3.7-Max GPU 算子优化长程 Agent 提示词与验收闭环Qwen 团队的 GPU 算子案例把性能假设、编译测试、基准回归和长程进度记录连成闭环,硬件与验证器是关键边界。Qwen3.7-Max 长程 Agent、前端原型与办公提示词Qwen 官方长程案例把前端、办公和多步 Agent 任务拆成可验证阶段,并强调工具、超时和最终验收要分开记录。Qwen3.7-Max 阿里云 Model Studio 版本、价格与缓存配置Model Studio 页面把 Qwen3.7 Max 的快照、百万上下文、缓存计费和区域限流分开列出,适合先固定版本与成本口径。