Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体Qwen3.7 Max

Qwen3.7-Max BenchLM 公开证据覆盖与速度账本

原始来源

BenchLM.ai

作者BenchLM

原文日期2026-05-16

Tabbit 整理2026-08-19

查看原文

一句话结论

BenchLM 将 Qwen3.7 Max 评为 71.6/100、公开排名 #16/218,证据验证排名 #13/104;多语言为 #1,但 Agentic 仅 #103,且 API 价格与模型 ID未被其独立核实。

测试环境

  • 数据集:BenchLM 公共模型目录与 437 个 tracked benchmark rows。

  • 时间:页面标注 2026-08-17 data as of,模型页面标注 2026-05-16 release。

  • 证据方法:Verified 行必须绑定公开来源;缺失字段保留为 not sourced/not published,不以估算填充。

  • 运行字段:页面记录 204 tok/s、首 token 14.07s,但标注 context direct source not stored;不能视为完整 runtime benchmark。

输入/配置

BenchLM 页面给出 35 个 source-displayable rows 的汇总和部分 provider-exact 数值,但没有公开统一的原始 prompt、采样参数或全部运行 trace。其“官方 exact-value snapshot”引用 Qwen 2026-05-16 发布页。

结果数据

总体与分类

项目页面结果
BenchLM score71.6/100
Public rank#16/218
Verified rank#13/104
Agentic39.8,#103/131
Coding52.8,#52/135
Reasoning85.8,未排名
Knowledge71.7,#22/57
Math81.8,未排名
Multilingual100.0,#1/13
Instruction Following92.6,#10/40
Speed204 tok/s;TTFT 14.07s
Context1M tokens

页面 ledger 的编码结果

  • LiveCodeBench 91.6%,页面列为 best verified。

  • SWE-bench Verified 80.4%,比页面 best verified Claude Opus 5 的 96% 低 15.6 个百分点。

  • SciCode 53.5%,比 best verified Sakana Fugu 60.1% 低 6.6 个百分点。

  • SWE-bench Pro 60.6%,比 best verified Claude Mythos 5 的 80.3% 低 19.7 个百分点。

  • SWE Multilingual 78.3%,NL2Repo 47.2%,Terminal-Bench 2.0 69.7%。

结论

  • 多语言与指令遵循是 BenchLM 证据中最突出的相对强项;编码证据较完整但并非每个 SWE/Terminal 指标都处于排行榜前列。

  • Agentic #103/131 与官方长程案例之间存在明显张力,说明“35 小时 demo”不能代替跨任务、跨 harness 的独立 Agent 指标。

  • 速度 204 tok/s 只是一条目录 runtime 记录;在 14.07s TTFT、区域、并发和长上下文下,必须用自己的 API trace 复测。

  • BenchLM 将模型标记为 superseded,Qwen3.8 Max Preview 已出现在 lineage;生产选型应先确认是否仍需 3.7 的稳定快照。

局限

  • BenchLM 是第三方聚合器,综合分数包含 disclosed weighting 和缺失数据处理;不要把 71.6 当成单一 benchmark。

  • API model ID、价格、最大输出、knowledge cutoff、模态等字段被标为未公开或未独立核实。

  • 部分 benchmark 是 provider exact 或 display only,harness 和评审者不完全一致。

  • 速度与 context 字段的直接来源不完整;不能用来替代官方 API 计费页和自己的负载测试。

复现步骤

  1. 保存 BenchLM 采集日期、模型生命周期状态和每条 ledger 的 evidence label。

  2. 按官方 Qwen 页固定 qwen3.7-max dated snapshot,分别跑 LiveCodeBench、SWE 和多语言任务。

  3. 对 Agent 任务额外记录 TTFT、输出速度、工具调用、上下文长度、失败/重试和 cost-per-success。

  4. 将“公开排名、验证排名、分类分数、速度”分开报告,不重算为一个未经说明的总分。

  5. 与 Qwen3.8 Max Preview 做同 harness A/B,确认继续使用 3.7 的复现和供应风险。

来源摘录或观察(仅做合规短引)

BenchLM 的决策提示是 “Validate before choosing”,原因是 35 个可见结果仍留下部分 benchmark 空槽。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

Qwen3.7 Max

在 Tabbit 中使用并对比模型

Qwen3.7 Max

相关测评

媒体Qwen 官方博客2026-05-20

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验

媒体Ofox AI2026-06-02

Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照

媒体Artificial Analysis2026-05-20

Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测

媒体Artificial Analysis & IBM Research2026-05-28

Qwen3.7-Max ITBench-AA 企业运维与 SRE 故障根因分析实测

Qwen3.7 Max

相关提示词

媒体Qwen 官方博客2026-05-20

Qwen3.7-Max 长程 Agent、前端原型与办公提示词

媒体Alibaba Cloud Model Studio2026-08-18

Qwen3.7-Max 阿里云 Model Studio 版本、价格与缓存配置

社区Reddit(r/opencodeCLI & r/QwenAI)2026-05-25

Qwen3.7-Max OpenCode 缓存配置与 Agent 防暴走规则

社区X.com & GitHub Community2026-08-08

Qwen3.7-Max 与多模型协同的代码阅读与审查路由配置