BenchLM 将 Qwen3.7 Max 评为 71.6/100、公开排名 #16/218,证据验证排名 #13/104;多语言为 #1,但 Agentic 仅 #103,且 API 价格与模型 ID未被其独立核实。
数据集:BenchLM 公共模型目录与 437 个 tracked benchmark rows。
时间:页面标注 2026-08-17 data as of,模型页面标注 2026-05-16 release。
证据方法:Verified 行必须绑定公开来源;缺失字段保留为 not sourced/not published,不以估算填充。
运行字段:页面记录 204 tok/s、首 token 14.07s,但标注 context direct source not stored;不能视为完整 runtime benchmark。
BenchLM 页面给出 35 个 source-displayable rows 的汇总和部分 provider-exact 数值,但没有公开统一的原始 prompt、采样参数或全部运行 trace。其“官方 exact-value snapshot”引用 Qwen 2026-05-16 发布页。
| 项目 | 页面结果 |
|---|---|
| BenchLM score | 71.6/100 |
| Public rank | #16/218 |
| Verified rank | #13/104 |
| Agentic | 39.8,#103/131 |
| Coding | 52.8,#52/135 |
| Reasoning | 85.8,未排名 |
| Knowledge | 71.7,#22/57 |
| Math | 81.8,未排名 |
| Multilingual | 100.0,#1/13 |
| Instruction Following | 92.6,#10/40 |
| Speed | 204 tok/s;TTFT 14.07s |
| Context | 1M tokens |
LiveCodeBench 91.6%,页面列为 best verified。
SWE-bench Verified 80.4%,比页面 best verified Claude Opus 5 的 96% 低 15.6 个百分点。
SciCode 53.5%,比 best verified Sakana Fugu 60.1% 低 6.6 个百分点。
SWE-bench Pro 60.6%,比 best verified Claude Mythos 5 的 80.3% 低 19.7 个百分点。
SWE Multilingual 78.3%,NL2Repo 47.2%,Terminal-Bench 2.0 69.7%。
多语言与指令遵循是 BenchLM 证据中最突出的相对强项;编码证据较完整但并非每个 SWE/Terminal 指标都处于排行榜前列。
Agentic #103/131 与官方长程案例之间存在明显张力,说明“35 小时 demo”不能代替跨任务、跨 harness 的独立 Agent 指标。
速度 204 tok/s 只是一条目录 runtime 记录;在 14.07s TTFT、区域、并发和长上下文下,必须用自己的 API trace 复测。
BenchLM 将模型标记为 superseded,Qwen3.8 Max Preview 已出现在 lineage;生产选型应先确认是否仍需 3.7 的稳定快照。
BenchLM 是第三方聚合器,综合分数包含 disclosed weighting 和缺失数据处理;不要把 71.6 当成单一 benchmark。
API model ID、价格、最大输出、knowledge cutoff、模态等字段被标为未公开或未独立核实。
部分 benchmark 是 provider exact 或 display only,harness 和评审者不完全一致。
速度与 context 字段的直接来源不完整;不能用来替代官方 API 计费页和自己的负载测试。
保存 BenchLM 采集日期、模型生命周期状态和每条 ledger 的 evidence label。
按官方 Qwen 页固定 qwen3.7-max dated snapshot,分别跑 LiveCodeBench、SWE 和多语言任务。
对 Agent 任务额外记录 TTFT、输出速度、工具调用、上下文长度、失败/重试和 cost-per-success。
将“公开排名、验证排名、分类分数、速度”分开报告,不重算为一个未经说明的总分。
与 Qwen3.8 Max Preview 做同 harness A/B,确认继续使用 3.7 的复现和供应风险。
BenchLM 的决策提示是 “Validate before choosing”,原因是 35 个可见结果仍留下部分 benchmark 空槽。
Qwen3.7 Max