Qwen3.8 Max · 媒体来源 · 厂商自报
Qwen 官方发布说明汇总 Qwen3.8 Max 的多项 benchmark;不同任务的 harness、样本和 reasoning 参数并不统一,发布日期与采集日期必须分开,不能拼成当前总榜。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
Qwen 官方把 Qwen3.8-Max 定位为面向编码、办公、科研、长程任务和多模态智能体的旗舰模型,宣称总参数 2.4T、激活参数 95B,并提供 reasoning effort、API 和多种 Agent harness 集成。官方文章给出大量内部基准与端到端案例,优势集中在长链路工具使用、视觉 Agent、文档办公和持续反馈;这些数字属于厂商发布结果,引用时必须同时标注评测框架、运行次数和基准性质。
Terminal Bench 2.1:86.6;SWE-bench Pro:67.7;PaperBench:93.0;OSWorld-Verified:86.1。
CoWorkBench:74.8;WorkSpaceBench:67.7;WideSearch:81.9。
GPQA Diamond:92.6;IFBench:82.8;MRCR v2 256K(8-needle):92.9。
MMMU-Pro:82.3;MathVision:95.2 / 97.7;VideoMME(含字幕):90.4。
官方案例:约 16 天自主运行留下 265 commits、127 PR、151 issues;论文复现连续约 125 小时、7600 行代码、33 轮 GPU 训练;WWW2025 比赛准确率从 0.60 提升到 0.853。
E-Commerce Bench:最终现金 ¥416,252,官方称比第二名 GLM 5.2 高 38%,比 Qwen3.7-Max 高 152%。
官方文章混合了内部基准、公开基准和展示性案例;不同模型还使用不同 harness(例如 Claude Code、Codex、OpenCode 或 Qwen-Agent)。不能把所有表格数字视为同一实验条件下的横向排名。文章本身也注明部分外部结果来自排行榜或官方报告。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
以上“文章原文”为 Tabbit 国际版页面提取到的可见正文,包含页面开头的导航文字和结尾的页脚文字;未通过国内版应用或国内站点访问。原文中的内部基准、案例和参数应回到官方页面复核后再用于发布。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
Qwen 官方博客 · Qwen Team · 原文发布日期 2026-08-03 · 本站编辑日期 2026-09-20
打开原始来源Qwen3.8 Max
下载 Tabbit 客户端后检查模型可用性