Qwen 官方把 Qwen3.8-Max 定位为面向编码、办公、科研、长程任务和多模态智能体的旗舰模型,宣称总参数 2.4T、激活参数 95B,并提供 reasoning effort、API 和多种 Agent harness 集成。官方文章给出大量内部基准与端到端案例,优势集中在长链路工具使用、视觉 Agent、文档办公和持续反馈;这些数字属于厂商发布结果,引用时必须同时标注评测框架、运行次数和基准性质。
Terminal Bench 2.1:86.6;SWE-bench Pro:67.7;PaperBench:93.0;OSWorld-Verified:86.1。
CoWorkBench:74.8;WorkSpaceBench:67.7;WideSearch:81.9。
GPQA Diamond:92.6;IFBench:82.8;MRCR v2 256K(8-needle):92.9。
MMMU-Pro:82.3;MathVision:95.2 / 97.7;VideoMME(含字幕):90.4。
官方案例:约 16 天自主运行留下 265 commits、127 PR、151 issues;论文复现连续约 125 小时、7600 行代码、33 轮 GPU 训练;WWW2025 比赛准确率从 0.60 提升到 0.853。
E-Commerce Bench:最终现金 ¥416,252,官方称比第二名 GLM 5.2 高 38%,比 Qwen3.7-Max 高 152%。
官方文章混合了内部基准、公开基准和展示性案例;不同模型还使用不同 harness(例如 Claude Code、Codex、OpenCode 或 Qwen-Agent)。不能把所有表格数字视为同一实验条件下的横向排名。文章本身也注明部分外部结果来自排行榜或官方报告。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
以上“文章原文”为 Tabbit 国际版页面提取到的可见正文,包含页面开头的导航文字和结尾的页脚文字;未通过国内版应用或国内站点访问。原文中的内部基准、案例和参数应回到官方页面复核后再用于发布。
Qwen3.8 Max