Qwen3.7 Max

Qwen3.7 Max 模型测评导航

汇总 Qwen3.7 Max 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。

8 条已核对来源的资料官方 · 媒体 · 社区

媒体

6 条已核对来源的资料
媒体Qwen 官方博客

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验

官方结果显示 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上很强,但分数来自不同 harness,最有说服力的复现路径是固定任务、工具和验证器后自行测 cost-per-success。

媒体BenchLM.ai

Qwen3.7-Max BenchLM 公开证据覆盖与速度账本

BenchLM 将 Qwen3.7 Max 评为 71.6/100、公开排名 16/218,证据验证排名 13/104;多语言为 1,但 Agentic 仅 103,且 API 价格与模型 ID未被其独立核实。

媒体Ofox AI

Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照

Ofox 用相同 prompt、5 次运行中位数和 senior reviewer 比较 Max/Plus:Max 在纯文本和长程迁移上有小幅质量/速度优势,但 Plus 在三个任务中约 5 倍便宜且支持视觉输入。

媒体Artificial Analysis

Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测

Artificial Analysis 独立实测显示 Qwen3.7-Max 智能指数达 47 分(排名前 23%),以 206.4 tok/s 输出速度位列第 9,单任务成本 $0.54 显著低于 Opus 5 与 GPT-5.6 Sol,但生成 100M Token 的倾向体现出较明显的长思维冗余。

媒体Artificial Analysis & IBM Research

Qwen3.7-Max ITBench-AA 企业运维与 SRE 故障根因分析实测

在 IBM Research 与 Artificial Analysis 联手推出的真实企业级 SRE 运维基准 ITBench-AA 中,Qwen3.7-Max 发布即斩获全球 3,在沙箱化 Kubernetes 复杂事故多维快照分析中展现出突出的跨系统根因定位能力。

媒体Artificial Analysis

Qwen3.7-Max AA-Omniscience 知识可靠性与幻觉率实测

AA-Omniscience 独立基准实测表明,Qwen3.7-Max 在知识不确定性校准上表现出更强的不确定性感知,相较于盲目自信给出错误答案,更倾向于承认知识边界,在纯文本知识可靠性与抗幻觉指标上优于同级别开源大模型。

社区

2 条已核对来源的资料

Qwen3.7 Max

在 Tabbit 中使用并对比模型

汇总 Qwen3.7 Max 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。