Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

Qwen3.7 Max · 媒体来源 · 厂商自报

Qwen3.7-Max 官方完整基准与 35 小时自主优化实验

Qwen 官方报告 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上的结果,并展示 35 小时 GPU 优化实验;各项分数依赖不同 harness。

媒体来源厂商自报编辑日期 2026-09-20

测试条件速查

来源具体观察
2026-05-20 Qwen 官方发布;比较 Claude Code、OpenClaw、Qwen Code 等框架和多种模型。
已公布条件
官方未公开所有 prompt、随机种子、失败轨迹和可下载运行包;35 小时 kernel 案例使用真武 M890 PPU 与自研验证器。

关键数据与适用场景

一句话结论

官方结果显示 Qwen3.7-Max 在编码、MCP/Skills、推理、多语言和长程工具任务上很强,但分数来自不同 harness,最有说服力的复现路径是固定任务、工具和验证器后自行测 cost-per-success。

测试环境

  • 模型:Qwen3.7-Max,与 Opus-4.6 Max、K2.6 Thinking、GLM-5.1 Thinking、DeepSeek V4 Pro Max、Qwen3.6-Plus 对照。

  • Agent 框架:Claude Code、OpenClaw、Qwen Code 及自定义工具框架;官方强调任务、harness、verifier 解耦以测试跨框架泛化。

  • Terminal-Bench 2.0-Terminus:Harbor/Terminus-2,5 小时 timeout,12 CPU/24GB RAM,temperature 1.0、top_p 0.95、top_k 20、max_tokens 80K、256K context,5 runs 平均。

  • SWE 系列:内部 Agent scaffold(bash + file-edit tools),temperature 1.0、top_p 0.95、200K context。

  • SkillsBench:OpenCode,78 tasks,排除 9 个外部 API 依赖任务,5 runs 平均。

  • Kernel Bench L3:50 个问题,单个隔离 Docker、1 张 H100 80GB,限制网络,最多 500 tool calls;连续 100 次无改进后 early stop。

输入/配置

官方页面公开了 benchmark 名称、部分 harness、超时和采样设置,但没有公开每项任务的完整 prompt、随机种子、全部失败轨迹或可下载运行包。35 小时 kernel 案例使用平头哥真武 M890 PPU 和自研评估脚本,不能当成通用硬件测试。

结果数据

编码与 Agent

基准Qwen3.7-Max
Terminal Bench 2.0-Terminus69.7
SWE-Verified80.4
SWE-Pro60.6
SWE-Multilingual78.3
NL2repo47.2
SciCode53.5
QwenWebDev1568
QwenSVG1608
Qwenclaw64.3
CoWorkBench67.2
ClawEval65.2
Skillsbench59.2
BFCL-V475.0
MCP-Mark60.8
MCP-Atlas76.4
SpreadSheetBench-v187.0
Kernel Bench L31.98x / 96%

推理、多语言与长上下文

基准Qwen3.7-Max
GPQA Diamond92.4
HLE41.4
LiveCodeBench91.6
HMMT 2026 Feb97.1
IMOAnswerBench90.0
Apex44.5
MMLU-Pro89.6
IFBench79.1
MRCR-v2 128K90.4
WMT24++85.8
MAXIFE89.2
PolyMATH86.5

长程自主实验

  • Extend Attention kernel 实验:约 35 小时、432 次 kernel evaluation、1,158 次工具调用;相对 Triton 参考实现几何平均加速比 10.0x。

  • 对照:GLM-5.1 7.3x、Kimi K2.6 5.0x、DeepSeek V4 Pro 3.3x、Qwen3.6-Plus 1.1x;官方页面没有给出相同硬件/工具全部细节。

  • Reward-hacking 监控:超过 80 小时 RL 实验、累计万次调用,新增 13 条启发式规则并识别 1,618 个作弊案例。

  • YC-Bench 模拟经营:Qwen3.7-Max 营收 2.08M 美元、完成 237 项任务;这是官方模拟环境,不是现实企业 ROI。

结论

  • 编码与工具调用是官方证据最密集的优势面:SWE-Verified 80.4、MCP-Atlas 76.4、Skillsbench 59.2、Kernel Bench L3 1.98x/96%。

  • MRCR-v2 128K 为 90.4,配合 1M 级上下文定位,适合长文档/长程 Agent 的候选测试,但不能把单个检索分数外推到所有文档结构。

  • 35 小时实验支持“在特定工具和验证器下能保持长程进展”,不等于所有 Agent harness 都能无人值守运行 35 小时。

  • 多 benchmark 表格展示了能力广度,但不同任务的裁判、工具和采样配置不同,应按任务类型拆分比较。

局限

  • 官方发布数据存在供应商选择、内部 benchmark 和自报结果偏差;没有独立盲测。

  • QwenWebDev、QwenClaw、CoWorkBench、YC-Bench 等内部 benchmark 的任务和评审细节不完整,不能独立重算。

  • 部分分数由不同 harness、judge 或环境产生;跨表横向排序不严谨。

  • 35 小时 kernel、RL 监控和企业模拟环境高度特定,不能直接当作生产 SLA、投资回报或安全保证。

复现步骤

  1. 选一个公开任务集,固定 Qwen3.7-Max dated snapshot、temperature、top_p、推理开关、工具版本、context 和 timeout。

  2. 对 Agent 任务保存任务、harness、verifier 三者版本;记录每轮工具调用、失败、重试、tokens、墙钟时间和成本。

  3. 对 Terminal/SWE 先重复 5 runs,再报告均值、方差、首轮通过率和人工纠正次数。

  4. 对长程任务设置无改进停止阈值,分开报告“完成率”和“持续运行时间”,避免只宣传最长运行时长。

  5. 选至少一个非 Qwen judge 或独立代码检查器复核结果,并比较 cost-per-success 而非单一 benchmark。

来源摘录或观察(仅做合规短引)

官方把模型概括为 “The Agent Frontier”,但页面同时给出了各 benchmark 的 harness 和限制,复现时应保留这些条件。

能支持的判断

  • 支持在明确验证器下设计 Qwen3.7 Max 长程编码和工具工作流测试。

不能支持的判断

  • 不能证明所有 Agent harness 都能无人值守运行 35 小时,也不能把分数跨硬件迁移。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Qwen 官方博客 · Qwen Team · 原文发布日期 2026-05-20 · 本站编辑日期 2026-09-20

打开原始来源

Qwen3.7 Max

在 Tabbit 中比较 Qwen3.7 Max

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

Qwen3.7 Max:模型定位、获取方式与适用边界

从官方快照、百万级上下文、Agent 场景、价格口径和实际风险,快速判断 Qwen3.7 Max 是否适合你的工作流。

相关评测

Qwen3.7-Max BenchLM 公开证据覆盖与速度账本BenchLM 的 Qwen3.7 Max 账本记录 71.6/100、公开排名 #16/218、证据验证排名 #13/104 以及 204 tok/s 和 14.07 秒首 token;其聚合口径不统一。Qwen3.7-Max 与 Qwen3.7-Plus 三项真实任务成本与质量对照Ofox 用相同提示、每项 5 次运行中位数和 senior reviewer 比较 Qwen3.7 Max/Plus;Max 在文本与长程迁移有小幅优势,Plus 约便宜 5 倍且支持视觉。Qwen3.7-Max Artificial Analysis 综合智能指数与成本速度实测Artificial Analysis 把 Qwen3.7 Max 放入 182 模型池,按推理档位比较智能指数、单任务成本和输出速度;长思维 token 与档位会显著改变成本。Qwen3.7-Max ITBench-AA 企业运维与 SRE 故障根因分析实测ITBench-AA 用离线事故快照、Prometheus/OTel/Kubernetes 证据和 Stirrup 沙箱评估 Qwen3.7 Max 的 SRE 根因分析;工具权限与数据载荷决定结论。Qwen3.7-Max 长程 Agent、前端原型与办公提示词Qwen 官方长程案例把前端、办公和多步 Agent 任务拆成可验证阶段,并强调工具、超时和最终验收要分开记录。Qwen3.7-Max 阿里云 Model Studio 版本、价格与缓存配置Model Studio 页面把 Qwen3.7 Max 的快照、百万上下文、缓存计费和区域限流分开列出,适合先固定版本与成本口径。Qwen3.7-Max Three.js 电子魔方与 3D 物理交互原型提示词阿里云公开 Three.js 案例把视觉参考、交互规则和物理验收写成电子魔方原型任务,适合做浏览器端视觉原型的编辑改写。Qwen3.7-Max GPU 算子优化长程 Agent 提示词与验收闭环Qwen 团队的 GPU 算子案例把性能假设、编译测试、基准回归和长程进度记录连成闭环,硬件与验证器是关键边界。