Qwen 官方报告 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上的结果,并展示 35 小时 GPU 优化实验;各项分数依赖不同 harness。
Qwen 官方博客 · 查看证据Qwen3.7 Max · 测评与证据
Qwen3.7 Max,哪些结论值得看?
按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。
这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。
编辑结论
编辑结论
BenchLM 的 Qwen3.7 Max 账本记录 71.6/100、公开排名 #16/218、证据验证排名 #13/104 以及 204 tok/s 和 14.07 秒首 token;其聚合口径不统一。
BenchLM.ai · 查看证据Ofox 用相同提示、每项 5 次运行中位数和 senior reviewer 比较 Qwen3.7 Max/Plus;Max 在文本与长程迁移有小幅优势,Plus 约便宜 5 倍且支持视觉。
Ofox AI · 查看证据完整测评与相关内容
精选证据
Qwen3.7-Max 官方完整基准与 35 小时自主优化实验
Qwen 官方报告 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上的结果,并展示 35 小时 GPU 优化实验;各项分数依赖不同 harness。
- 来源具体观察
- 2026-05-20 Qwen 官方发布;比较 Claude Code、OpenClaw、Qwen Code 等框架和多种模型。
- 已公布条件
- 官方未公开所有 prompt、随机种子、失败轨迹和可下载运行包;35 小时 kernel 案例使用真武 M890 PPU 与自研验证器。
Qwen3.7-Max BenchLM 公开证据覆盖与速度账本
BenchLM 的 Qwen3.7 Max 账本记录 71.6/100、公开排名 #16/218、证据验证排名 #13/104 以及 204 tok/s 和 14.07 秒首 token;其聚合口径不统一。
待验证:本次未能重新核实原文。
- 来源具体观察
- 页面数据截至 2026-08-17,覆盖 437 个 tracked rows、35 个可显示来源行,并标注 2026-05-16 release。
- 已公布条件
- 页面没有统一原始 prompt、采样参数或完整 trace;API 价格与模型 ID 也未被 BenchLM 独立核实。
Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照
Ofox 用相同提示、每项 5 次运行中位数和 senior reviewer 比较 Qwen3.7 Max/Plus;Max 在文本与长程迁移有小幅优势,Plus 约便宜 5 倍且支持视觉。
待验证:本次未能重新核实原文。
- 来源具体观察
- 2026-06-02,更新 2026-08-03;三项任务包含 1,200 行 Python 重构、截图+stack trace 调试和 1,000 步 Postgres migration。
- 已公布条件
- 每模型每任务运行 5 次,temperature=0.2,长程任务 unattended 4 小时,质量由 senior reviewer 以 1–5 评分。
Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测
Artificial Analysis 把 Qwen3.7 Max 放入 182 模型池,按推理档位比较智能指数、单任务成本和输出速度;长思维 token 与档位会显著改变成本。
待验证:本次未能重新核实原文。
- 来源具体观察
- 页面以 2026-05-20 release、2026-08 数据和 182 模型比较池为口径,输入来自官方 API。
- 已公布条件
- 页面报告按 Intelligence Index 加权的 cost-per-task 与 tokens/s;具体 prompt、重复次数和快照需结合方法页复核。
全部来源
全部来源
Qwen3.7-Max 官方完整基准与 35 小时自主优化实验
Qwen 官方报告 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上的结果,并展示 35 小时 GPU 优化实验;各项分数依赖不同 harness。
- 来源具体观察
- 2026-05-20 Qwen 官方发布;比较 Claude Code、OpenClaw、Qwen Code 等框架和多种模型。
- 已公布条件
- 官方未公开所有 prompt、随机种子、失败轨迹和可下载运行包;35 小时 kernel 案例使用真武 M890 PPU 与自研验证器。
Qwen3.7-Max BenchLM 公开证据覆盖与速度账本
BenchLM 的 Qwen3.7 Max 账本记录 71.6/100、公开排名 #16/218、证据验证排名 #13/104 以及 204 tok/s 和 14.07 秒首 token;其聚合口径不统一。
待验证:本次未能重新核实原文。
- 来源具体观察
- 页面数据截至 2026-08-17,覆盖 437 个 tracked rows、35 个可显示来源行,并标注 2026-05-16 release。
- 已公布条件
- 页面没有统一原始 prompt、采样参数或完整 trace;API 价格与模型 ID 也未被 BenchLM 独立核实。
Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照
Ofox 用相同提示、每项 5 次运行中位数和 senior reviewer 比较 Qwen3.7 Max/Plus;Max 在文本与长程迁移有小幅优势,Plus 约便宜 5 倍且支持视觉。
待验证:本次未能重新核实原文。
- 来源具体观察
- 2026-06-02,更新 2026-08-03;三项任务包含 1,200 行 Python 重构、截图+stack trace 调试和 1,000 步 Postgres migration。
- 已公布条件
- 每模型每任务运行 5 次,temperature=0.2,长程任务 unattended 4 小时,质量由 senior reviewer 以 1–5 评分。
Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测
Artificial Analysis 把 Qwen3.7 Max 放入 182 模型池,按推理档位比较智能指数、单任务成本和输出速度;长思维 token 与档位会显著改变成本。
待验证:本次未能重新核实原文。
- 来源具体观察
- 页面以 2026-05-20 release、2026-08 数据和 182 模型比较池为口径,输入来自官方 API。
- 已公布条件
- 页面报告按 Intelligence Index 加权的 cost-per-task 与 tokens/s;具体 prompt、重复次数和快照需结合方法页复核。
Qwen3.7-Max 真实代码任务中的负向指令混淆与 Token 消耗实测
Reddit 开发者案例记录 Qwen3.7 Max 在“禁用而非删除”代码任务中的越权失误,以及 3 次指令、134 次内部交互和 8.23M 输入 token;客户端缓存可能是混杂因素。
待验证:本次未能重新核实原文。
- 来源具体观察
- 2026-05-28 汇总至 2026-07-15;OpenCode 真实代码任务,对比多种模型,样本来自社区公开案例。
- 已公布条件
- 报告记录一次功能禁用语义错误和一次 8.23M token 消耗,未提供受控重复、统一 API harness 或完整日志。
Qwen3.7-Max Arena.ai 盲测榜单与专业领域排位
ArenaAI 社区盲测把 Qwen3.7 Max 放入纯文本和专业领域排名;结果随快照和投票池变化,不能替代固定任务评测。
待验证:本次未能重新核实原文。
- 来源具体观察
- 2026-05-18 X/Arena 贴文,样本描述为大量真实用户 prompt 对抗投票,覆盖文本、数学和专业领域。
- 已公布条件
- 帖子未公开完整投票样本、快照、提示、评审脚本或重复方案,且早期 preview 排名会动态变化。
Qwen3.7-Max ITBench-AA 企业运维与 SRE 故障根因分析实测
ITBench-AA 用离线事故快照、Prometheus/OTel/Kubernetes 证据和 Stirrup 沙箱评估 Qwen3.7 Max 的 SRE 根因分析;工具权限与数据载荷决定结论。
待验证:本次未能重新核实原文。
- 来源具体观察
- 2026-05-28 Artificial Analysis/IBM ITBench-AA,输入是离线事故快照,含指标、traces、K8s events、日志和拓扑。
- 已公布条件
- 模型在 Stirrup 沙箱中拥有 Shell 与文件检索;页面指标不是无工具聊天能力,完整任务轨迹和部署成本未公开。
Qwen3.7-Max AA-Omniscience 知识可靠性与幻觉率实测
AA-Omniscience 测试 Qwen3.7 Max 的知识不确定性与幻觉率,强调拒答/未尝试样本的定义;这是专门知识可靠性基准,不是通用 Agent 评测。
待验证:本次未能重新核实原文。
- 来源具体观察
- Artificial Analysis 在专用硬件和官方 API 上运行标准知识问答 prompt,页面更新至 2026-08。
- 已公布条件
- Hallucination Rate 定义为 Incorrect/(Incorrect+Partial+Not Attempted);未注入额外欺骗条件,完整样本与重复细节需以方法页为准。