Qwen3.7 Max

Qwen3.7 Max · 测评与证据

Qwen3.7 Max,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

Qwen 官方报告 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上的结果,并展示 35 小时 GPU 优化实验;各项分数依赖不同 harness。

Qwen 官方博客 · 查看证据

BenchLM 的 Qwen3.7 Max 账本记录 71.6/100、公开排名 #16/218、证据验证排名 #13/104 以及 204 tok/s 和 14.07 秒首 token;其聚合口径不统一。

BenchLM.ai · 查看证据

Ofox 用相同提示、每项 5 次运行中位数和 senior reviewer 比较 Qwen3.7 Max/Plus;Max 在文本与长程迁移有小幅优势,Plus 约便宜 5 倍且支持视觉。

Ofox AI · 查看证据

完整测评与相关内容

模型深度阅读

总览 · 简体中文

Qwen3.7 Max:模型定位、获取方式与适用边界

从官方快照、百万级上下文、Agent 场景、价格口径和实际风险,快速判断 Qwen3.7 Max 是否适合你的工作流。

精选证据

媒体 / 基准方厂商自报

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验

Qwen 官方报告 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上的结果,并展示 35 小时 GPU 优化实验;各项分数依赖不同 harness。

来源Qwen 官方博客
原文日期2026-05-20
采集2026-09-20
来源具体观察
2026-05-20 Qwen 官方发布;比较 Claude Code、OpenClaw、Qwen Code 等框架和多种模型。
已公布条件
官方未公开所有 prompt、随机种子、失败轨迹和可下载运行包;35 小时 kernel 案例使用真武 M890 PPU 与自研验证器。
能力
媒体 / 基准方独立测量

Qwen3.7-Max BenchLM 公开证据覆盖与速度账本

BenchLM 的 Qwen3.7 Max 账本记录 71.6/100、公开排名 #16/218、证据验证排名 #13/104 以及 204 tok/s 和 14.07 秒首 token;其聚合口径不统一。

来源BenchLM.ai
原文日期2026-05-16
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
页面数据截至 2026-08-17,覆盖 437 个 tracked rows、35 个可显示来源行,并标注 2026-05-16 release。
已公布条件
页面没有统一原始 prompt、采样参数或完整 trace;API 价格与模型 ID 也未被 BenchLM 独立核实。
能力
媒体 / 基准方独立测量

Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照

Ofox 用相同提示、每项 5 次运行中位数和 senior reviewer 比较 Qwen3.7 Max/Plus;Max 在文本与长程迁移有小幅优势,Plus 约便宜 5 倍且支持视觉。

来源Ofox AI
原文日期2026-06-02
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
2026-06-02,更新 2026-08-03;三项任务包含 1,200 行 Python 重构、截图+stack trace 调试和 1,000 步 Postgres migration。
已公布条件
每模型每任务运行 5 次,temperature=0.2,长程任务 unattended 4 小时,质量由 senior reviewer 以 1–5 评分。
能力
媒体 / 基准方独立测量

Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测

Artificial Analysis 把 Qwen3.7 Max 放入 182 模型池,按推理档位比较智能指数、单任务成本和输出速度;长思维 token 与档位会显著改变成本。

来源Artificial Analysis
原文日期2026-05-20
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
页面以 2026-05-20 release、2026-08 数据和 182 模型比较池为口径,输入来自官方 API。
已公布条件
页面报告按 Intelligence Index 加权的 cost-per-task 与 tokens/s;具体 prompt、重复次数和快照需结合方法页复核。
能力

全部来源

全部来源

8 / 8
媒体 / 基准方厂商自报

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验

Qwen 官方报告 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上的结果,并展示 35 小时 GPU 优化实验;各项分数依赖不同 harness。

来源Qwen 官方博客
原文日期2026-05-20
采集2026-09-20
来源具体观察
2026-05-20 Qwen 官方发布;比较 Claude Code、OpenClaw、Qwen Code 等框架和多种模型。
已公布条件
官方未公开所有 prompt、随机种子、失败轨迹和可下载运行包;35 小时 kernel 案例使用真武 M890 PPU 与自研验证器。
能力
媒体 / 基准方独立测量

Qwen3.7-Max BenchLM 公开证据覆盖与速度账本

BenchLM 的 Qwen3.7 Max 账本记录 71.6/100、公开排名 #16/218、证据验证排名 #13/104 以及 204 tok/s 和 14.07 秒首 token;其聚合口径不统一。

来源BenchLM.ai
原文日期2026-05-16
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
页面数据截至 2026-08-17,覆盖 437 个 tracked rows、35 个可显示来源行,并标注 2026-05-16 release。
已公布条件
页面没有统一原始 prompt、采样参数或完整 trace;API 价格与模型 ID 也未被 BenchLM 独立核实。
能力
媒体 / 基准方独立测量

Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照

Ofox 用相同提示、每项 5 次运行中位数和 senior reviewer 比较 Qwen3.7 Max/Plus;Max 在文本与长程迁移有小幅优势,Plus 约便宜 5 倍且支持视觉。

来源Ofox AI
原文日期2026-06-02
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
2026-06-02,更新 2026-08-03;三项任务包含 1,200 行 Python 重构、截图+stack trace 调试和 1,000 步 Postgres migration。
已公布条件
每模型每任务运行 5 次,temperature=0.2,长程任务 unattended 4 小时,质量由 senior reviewer 以 1–5 评分。
能力
媒体 / 基准方独立测量

Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测

Artificial Analysis 把 Qwen3.7 Max 放入 182 模型池,按推理档位比较智能指数、单任务成本和输出速度;长思维 token 与档位会显著改变成本。

来源Artificial Analysis
原文日期2026-05-20
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
页面以 2026-05-20 release、2026-08 数据和 182 模型比较池为口径,输入来自官方 API。
已公布条件
页面报告按 Intelligence Index 加权的 cost-per-task 与 tokens/s;具体 prompt、重复次数和快照需结合方法页复核。
能力
社区个人体验

Qwen3.7-Max 真实代码任务中的负向指令混淆与 Token 消耗实测

Reddit 开发者案例记录 Qwen3.7 Max 在“禁用而非删除”代码任务中的越权失误,以及 3 次指令、134 次内部交互和 8.23M 输入 token;客户端缓存可能是混杂因素。

来源Reddit(r/opencode, r/QwenAI, r/LocalLLaMA)
原文日期2026-05-28
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
2026-05-28 汇总至 2026-07-15;OpenCode 真实代码任务,对比多种模型,样本来自社区公开案例。
已公布条件
报告记录一次功能禁用语义错误和一次 8.23M token 消耗,未提供受控重复、统一 API harness 或完整日志。
能力
社区个人体验

Qwen3.7-Max Arena.ai 盲测榜单与专业领域排位

ArenaAI 社区盲测把 Qwen3.7 Max 放入纯文本和专业领域排名;结果随快照和投票池变化,不能替代固定任务评测。

来源Arena.ai(LMSYS Chatbot Arena)
原文日期2026-05-18
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
2026-05-18 X/Arena 贴文,样本描述为大量真实用户 prompt 对抗投票,覆盖文本、数学和专业领域。
已公布条件
帖子未公开完整投票样本、快照、提示、评审脚本或重复方案,且早期 preview 排名会动态变化。
能力
媒体 / 基准方独立测量

Qwen3.7-Max ITBench-AA 企业运维与 SRE 故障根因分析实测

ITBench-AA 用离线事故快照、Prometheus/OTel/Kubernetes 证据和 Stirrup 沙箱评估 Qwen3.7 Max 的 SRE 根因分析;工具权限与数据载荷决定结论。

来源Artificial Analysis & IBM Research
原文日期2026-05-28
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
2026-05-28 Artificial Analysis/IBM ITBench-AA,输入是离线事故快照,含指标、traces、K8s events、日志和拓扑。
已公布条件
模型在 Stirrup 沙箱中拥有 Shell 与文件检索;页面指标不是无工具聊天能力,完整任务轨迹和部署成本未公开。
能力
媒体 / 基准方独立测量

Qwen3.7-Max AA-Omniscience 知识可靠性与幻觉率实测

AA-Omniscience 测试 Qwen3.7 Max 的知识不确定性与幻觉率,强调拒答/未尝试样本的定义;这是专门知识可靠性基准,不是通用 Agent 评测。

来源Artificial Analysis
原文日期2026-05-20
采集2026-09-20

待验证:本次未能重新核实原文。

来源具体观察
Artificial Analysis 在专用硬件和官方 API 上运行标准知识问答 prompt,页面更新至 2026-08。
已公布条件
Hallucination Rate 定义为 Incorrect/(Incorrect+Partial+Not Attempted);未注入额外欺骗条件,完整样本与重复细节需以方法页为准。
能力

Qwen3.7 Max

在 Tabbit 中比较 Qwen3.7 Max

客户端中的模型、功能和权限以当前账户为准。