Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Qwen3.7 Max · 媒体来源 · 独立测量

Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测

Artificial Analysis 把 Qwen3.7 Max 放入 182 模型池,按推理档位比较智能指数、单任务成本和输出速度;长思维 token 与档位会显著改变成本。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

来源具体观察
页面以 2026-05-20 release、2026-08 数据和 182 模型比较池为口径,输入来自官方 API。
已公布条件
页面报告按 Intelligence Index 加权的 cost-per-task 与 tokens/s;具体 prompt、重复次数和快照需结合方法页复核。

关键数据与适用场景

一句话结论

Artificial Analysis 独立实测显示 Qwen3.7-Max 智能指数达 47 分(排名前 23%),以 206.4 tok/s 输出速度位列第 9,单任务成本 $0.54 显著低于 Opus 5 与 GPT-5.6 Sol,但生成 100M Token 的倾向体现出较明显的长思维冗余。

测试环境

  • 评测基准体系:Artificial Analysis Intelligence Index v4.1.1。

  • 包含子集:GDPval-AA v2、tau^3-Banking(𝜏³-Banking)、Terminal-Bench v2.1、SciCode、Humanity's Last Exam (HLE)、GPQA Diamond、CritPt、AA-Omniscience、AA-LCR 共 9 项受控评测。

  • 推理环境:基于 Alibaba Cloud Model Studio 官方推理端点,默认 10k 输入 token 负载实测。

  • 比较池:全球 182 款同类推理与专有模型横向对比。

输入/配置

  • 评测模式:启用完整 Reasoning / Thinking 模式。

  • 输入/输出模态:纯文本(Text-only),单次请求最大上下文支持 1M tokens。

  • 计费基准:输入 $2.50 / 1M tokens,输出 $7.50 / 1M tokens,上下文缓存折扣 80%。

  • 总计消耗:在完成全部 Intelligence Index 评测中,累计产生 100M Output Tokens,总测试开销 $1,063.86。

结果数据

核心能力与性能排名

维度实测数值横向排名 / 分位同类基准中位数
综合智能指数 (Intelligence Index)47 分#42 / 18235 分
输出生成速度 (Output Speed)206.4 tok/s#9 / 18276 tok/s
首 Token 延迟 (TTFT)2.27s优于中位数2.79s
单任务加权成本 (Cost per Task)$0.54#52 / 182-
评测生成 Token 总量 (Verbosity)100M tokens#56 / 182(偏冗长)72M tokens

跨模型单任务加权成本对照 (Cost per Task)

模型推理档位单任务成本 (USD)智能指数 (Intelligence Index)
GPT-5.6 Lunamax$0.0552
DeepSeek V4 Pro (0813)max$0.2553
Gemini 3.7 Flashhigh$0.4056
Qwen3.7-Maxreasoning$0.5447
GLM-5.3max$0.6860
Grok 4.6high$0.8461
Kimi K3max$0.8460
GPT-5.6 Solmax$1.2361
Claude Opus 5max$2.3463
Claude Fable 5fallback$3.1462

跨模型输出速度对照 (Output Tokens / sec)

模型输出速度 (tok/s)
Gemini 3.7 Flash (high)365
Qwen3.7-Max206
GPT-5.6 Luna (max)149
Nemotron 3 Ultra126
GLM-5.3 (max)93
DeepSeek V4 Pro (0813)80
Claude Fable 575
Claude Opus 5 (max)59
Kimi K3 (max)39

结论

  • 速度与吞吐优势突出:Qwen3.7-Max 在保持 47 分智能水平的同时,达到 206.4 tok/s 输出速率,比 Claude Opus 5(59 tok/s)快 3.5 倍,比 Kimi K3(39 tok/s)快 5.3 倍,非常适合交互型代码 Agent。

  • 成本效费比具备竞争力:单任务 $0.54 的成本仅为 Claude Opus 5($2.34)的 23%,在需要高频调用推理能力的企业 IT 与代码重构场景下成本优势明显。

  • 思维冗余度偏高:100M Token 的评测产出明显高于 72M 的行业中位数,说明模型在复杂逻辑推演时倾向于展开极长思维链(Long-thought),需配合合理的 max_tokens 预算。

局限

  • 仅支持纯文本输入,不支持视觉与截图输入(Multimodal Image Drop),无法直接用于前端 UI 截图审查。

  • 随着 Qwen3.8-Max(56 分)的推出,官方已将 Qwen3.7-Max 列为 Deprecated 归档追踪状态,长远生产部署应评估向 3.8 版本的平滑迁移。

复现步骤

  1. 使用 Alibaba Model Studio 官方端点调用 qwen3.7-max-2026-05-20 快照,开启 enable_thinking: true。

  2. 运行标准 10k token 输入基线请求,记录 TTFT(期望在 2.0s~2.5s 区间)与流式输出 tok/s。

  3. 统计长程推理任务的思考 Token 占比(Thinking vs Final Answer),计算单任务真实完成成本。

来源摘录或观察(仅做合规短引)

Artificial Analysis 评测摘要总结:“Qwen3.7 Max is amongst the leading models in intelligence... It's also notably fast, however somewhat verbose. At 206 tokens per second, Qwen3.7 Max is notably fast”。

能支持的判断

  • 支持复现当前智能、速度和成本快照,并选择推理预算。

不能支持的判断

  • 不能把它当作固定价格、普遍质量排名或 provider 更新后的稳定行为。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Artificial Analysis · Artificial Analysis Team · 原文发布日期 2026-05-20 · 本站编辑日期 2026-09-20

打开原始来源

Qwen3.7 Max

在 Tabbit 中比较 Qwen3.7 Max

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Qwen3.7 Max:模型定位、获取方式与适用边界

从官方快照、百万级上下文、Agent 场景、价格口径和实际风险,快速判断 Qwen3.7 Max 是否适合你的工作流。

相关评测

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验Qwen 官方报告 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上的结果,并展示 35 小时 GPU 优化实验;各项分数依赖不同 harness。Qwen3.7-Max BenchLM 公开证据覆盖与速度账本BenchLM 的 Qwen3.7 Max 账本记录 71.6/100、公开排名 #16/218、证据验证排名 #13/104 以及 204 tok/s 和 14.07 秒首 token;其聚合口径不统一。Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照Ofox 用相同提示、每项 5 次运行中位数和 senior reviewer 比较 Qwen3.7 Max/Plus;Max 在文本与长程迁移有小幅优势,Plus 约便宜 5 倍且支持视觉。Qwen3.7-Max ITBench-AA 企业运维与 SRE 故障根因分析实测ITBench-AA 用离线事故快照、Prometheus/OTel/Kubernetes 证据和 Stirrup 沙箱评估 Qwen3.7 Max 的 SRE 根因分析;工具权限与数据载荷决定结论。Qwen3.7-Max 长程 Agent、前端原型与办公提示词Qwen 官方长程案例把前端、办公和多步 Agent 任务拆成可验证阶段,并强调工具、超时和最终验收要分开记录。Qwen3.7-Max 阿里云 Model Studio 版本、价格与缓存配置Model Studio 页面把 Qwen3.7 Max 的快照、百万上下文、缓存计费和区域限流分开列出,适合先固定版本与成本口径。Qwen3.7-Max Three.js 电子魔方与 3D 物理交互原型提示词阿里云公开 Three.js 案例把视觉参考、交互规则和物理验收写成电子魔方原型任务,适合做浏览器端视觉原型的编辑改写。Qwen3.7-Max GPU 算子优化长程 Agent 提示词与验收闭环Qwen 团队的 GPU 算子案例把性能假设、编译测试、基准回归和长程进度记录连成闭环,硬件与验证器是关键边界。