Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Qwen3.7 Max · 媒体来源 · 独立测量

Qwen3.7-Max BenchLM 公开证据覆盖与速度账本

BenchLM 的 Qwen3.7 Max 账本记录 71.6/100、公开排名 #16/218、证据验证排名 #13/104 以及 204 tok/s 和 14.07 秒首 token;其聚合口径不统一。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源独立测量编辑日期 2026-09-20

测试条件速查

来源具体观察
页面数据截至 2026-08-17,覆盖 437 个 tracked rows、35 个可显示来源行,并标注 2026-05-16 release。
已公布条件
页面没有统一原始 prompt、采样参数或完整 trace;API 价格与模型 ID 也未被 BenchLM 独立核实。

关键数据与适用场景

一句话结论

BenchLM 将 Qwen3.7 Max 评为 71.6/100、公开排名 #16/218,证据验证排名 #13/104;多语言为 #1,但 Agentic 仅 #103,且 API 价格与模型 ID未被其独立核实。

测试环境

  • 数据集:BenchLM 公共模型目录与 437 个 tracked benchmark rows。

  • 时间:页面标注 2026-08-17 data as of,模型页面标注 2026-05-16 release。

  • 证据方法:Verified 行必须绑定公开来源;缺失字段保留为 not sourced/not published,不以估算填充。

  • 运行字段:页面记录 204 tok/s、首 token 14.07s,但标注 context direct source not stored;不能视为完整 runtime benchmark。

输入/配置

BenchLM 页面给出 35 个 source-displayable rows 的汇总和部分 provider-exact 数值,但没有公开统一的原始 prompt、采样参数或全部运行 trace。其“官方 exact-value snapshot”引用 Qwen 2026-05-16 发布页。

结果数据

总体与分类

项目页面结果
BenchLM score71.6/100
Public rank#16/218
Verified rank#13/104
Agentic39.8,#103/131
Coding52.8,#52/135
Reasoning85.8,未排名
Knowledge71.7,#22/57
Math81.8,未排名
Multilingual100.0,#1/13
Instruction Following92.6,#10/40
Speed204 tok/s;TTFT 14.07s
Context1M tokens

页面 ledger 的编码结果

  • LiveCodeBench 91.6%,页面列为 best verified。

  • SWE-bench Verified 80.4%,比页面 best verified Claude Opus 5 的 96% 低 15.6 个百分点。

  • SciCode 53.5%,比 best verified Sakana Fugu 60.1% 低 6.6 个百分点。

  • SWE-bench Pro 60.6%,比 best verified Claude Mythos 5 的 80.3% 低 19.7 个百分点。

  • SWE Multilingual 78.3%,NL2Repo 47.2%,Terminal-Bench 2.0 69.7%。

结论

  • 多语言与指令遵循是 BenchLM 证据中最突出的相对强项;编码证据较完整但并非每个 SWE/Terminal 指标都处于排行榜前列。

  • Agentic #103/131 与官方长程案例之间存在明显张力,说明“35 小时 demo”不能代替跨任务、跨 harness 的独立 Agent 指标。

  • 速度 204 tok/s 只是一条目录 runtime 记录;在 14.07s TTFT、区域、并发和长上下文下,必须用自己的 API trace 复测。

  • BenchLM 将模型标记为 superseded,Qwen3.8 Max Preview 已出现在 lineage;生产选型应先确认是否仍需 3.7 的稳定快照。

局限

  • BenchLM 是第三方聚合器,综合分数包含 disclosed weighting 和缺失数据处理;不要把 71.6 当成单一 benchmark。

  • API model ID、价格、最大输出、knowledge cutoff、模态等字段被标为未公开或未独立核实。

  • 部分 benchmark 是 provider exact 或 display only,harness 和评审者不完全一致。

  • 速度与 context 字段的直接来源不完整;不能用来替代官方 API 计费页和自己的负载测试。

复现步骤

  1. 保存 BenchLM 采集日期、模型生命周期状态和每条 ledger 的 evidence label。

  2. 按官方 Qwen 页固定 qwen3.7-max dated snapshot,分别跑 LiveCodeBench、SWE 和多语言任务。

  3. 对 Agent 任务额外记录 TTFT、输出速度、工具调用、上下文长度、失败/重试和 cost-per-success。

  4. 将“公开排名、验证排名、分类分数、速度”分开报告,不重算为一个未经说明的总分。

  5. 与 Qwen3.8 Max Preview 做同 harness A/B,确认继续使用 3.7 的复现和供应风险。

来源摘录或观察(仅做合规短引)

BenchLM 的决策提示是 “Validate before choosing”,原因是 35 个可见结果仍留下部分 benchmark 空槽。

能支持的判断

  • 支持依据类别覆盖和速度字段选择本地复测项目。

不能支持的判断

  • 不能把它当作统一排行榜、当前成本保证或 provider 中立的延迟结论。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

BenchLM.ai · BenchLM · 原文发布日期 2026-05-16 · 本站编辑日期 2026-09-20

打开原始来源

Qwen3.7 Max

在 Tabbit 中比较 Qwen3.7 Max

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Qwen3.7 Max:模型定位、获取方式与适用边界

从官方快照、百万级上下文、Agent 场景、价格口径和实际风险,快速判断 Qwen3.7 Max 是否适合你的工作流。

相关评测

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验Qwen 官方报告 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上的结果,并展示 35 小时 GPU 优化实验;各项分数依赖不同 harness。Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照Ofox 用相同提示、每项 5 次运行中位数和 senior reviewer 比较 Qwen3.7 Max/Plus;Max 在文本与长程迁移有小幅优势,Plus 约便宜 5 倍且支持视觉。Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测Artificial Analysis 把 Qwen3.7 Max 放入 182 模型池,按推理档位比较智能指数、单任务成本和输出速度;长思维 token 与档位会显著改变成本。Qwen3.7-Max ITBench-AA 企业运维与 SRE 故障根因分析实测ITBench-AA 用离线事故快照、Prometheus/OTel/Kubernetes 证据和 Stirrup 沙箱评估 Qwen3.7 Max 的 SRE 根因分析;工具权限与数据载荷决定结论。Qwen3.7-Max 长程 Agent、前端原型与办公提示词Qwen 官方长程案例把前端、办公和多步 Agent 任务拆成可验证阶段,并强调工具、超时和最终验收要分开记录。Qwen3.7-Max 阿里云 Model Studio 版本、价格与缓存配置Model Studio 页面把 Qwen3.7 Max 的快照、百万上下文、缓存计费和区域限流分开列出,适合先固定版本与成本口径。Qwen3.7-Max Three.js 电子魔方与 3D 物理交互原型提示词阿里云公开 Three.js 案例把视觉参考、交互规则和物理验收写成电子魔方原型任务,适合做浏览器端视觉原型的编辑改写。Qwen3.7-Max GPU 算子优化长程 Agent 提示词与验收闭环Qwen 团队的 GPU 算子案例把性能假设、编译测试、基准回归和长程进度记录连成闭环,硬件与验证器是关键边界。