BenchLM 将 Qwen3.8 Max 的 52 条来源可显示基准归一为 79.91/100、218 个模型中第 6,但分类账本同时显示它在 Reasoning、Agentic、Multimodal 和指令遵循上很强,而 AutomationBench、OSWorld 2.0、HLE 等项目仍有明显缺口;“第 6”不能替代分项任务选择。
适合的任务:按能力类别筛选模型、核对每个分数的来源、把 Qwen 与其他模型放在同一套可见证据账本里比较。
不适合的任务:把 BenchLM 总分当作新实验,或把 provider exact 的官方分数当成 BenchLM 自己复跑的独立结果。
适用的模型版本:Qwen3.8 Max(页面标注 2026-08-03 发布);数据冻结/刷新点为 2026-08-17。
适用的客户端、Agent 或 API:BenchLM/BenchAlign 数据库;实际部署仍需回到 Qwen 官方 endpoint 和自己的 harness。
推荐的推理档位和参数:BenchLM 页面不公开统一的 Qwen 调用参数;各 benchmark 的原始配置以其 Evidence 链接和 Qwen 官方脚注为准。
BenchLM 方法页说明公共表默认只显示 exact-source rows,生成或推测的 benchmark value 不进入 evidence;模型页每行保留 score、weight、cohort 和 evidence state。
整体 Agentic/Coding 使用 BenchAlign v5.2 的冻结产物;其余类别仍是证据视图,直到各自验证完成。
打开模型页,先记录总分、排名、来源行数和类别分数,再展开 Coding、Agentic、Reasoning、Knowledge、Multimodal、Instruction Following 等分类。
点击每个 row 的 Evidence 原始链接,确认 Qwen 官方发布表、评测脚注、运行 harness 和日期;不能把 BenchLM 的聚合排名当作原始数据。
Overall:79.91/100,#6/218;52 条 source-displayable rows。
AgenticRank:79.2,#2/131,99th percentile,14 个 benchmark,权重 22%。
CodingRank:66.6,#11/135,93rd percentile,7 个 benchmark,权重 20%。
ReasoningRank:94.3,#1/2,100th percentile,2 个 benchmark,权重 17%。
Knowledge:66.5,未排名,4 个 benchmark,证据已验证。
Multimodal:88.1,#2/33,97th percentile,24 个 benchmark,权重 12%。
Instruction Following:97.9,#1/40,1 个 benchmark,权重 5%。
Math 与 Multilingual:页面标为未测量,不能从总分推断。
Coding:SWE-bench Pro 67.7%(比页面最佳 verified row 低 12.6 个百分点);Terminal-Bench 2.1 为 86.6%;PaperBench 93.0% 为当前 verified row 最佳。
Agentic:OSWorld-Verified 86.1%、CoWorkBench 74.8%、WideResearch 81.9%、AndroidWorld 85.3%、MobileWorld 77.8% 均在页面中列为 Qwen 当前最佳 verified row;AutomationBench 27.3%,比 GLM-5.3 的 48.2% 低 20.9 个百分点;OSWorld 2.0 为 19.4%,比 Claude Opus 5 的 70.6% 低 51.2 个百分点。
Reasoning/Knowledge:LongBench v2 66.3%;MRCRv2 92.9%,距页面最佳 0.7 个百分点;HLE 43.6%,比 Claude Opus 5 的 64.7% 低 21.1 个百分点;GPQA 92.6%,比页面最佳低 2.9 个百分点。
Multimodal:MMMU-Pro 82.3%;OmniDocBench 1.5 为 92.1%;Video-MME(含字幕)90.4%;LVBench 81.8%,比 Gemini 3.7 Flash 的 85.4% 低 3.6 个百分点。
BenchLM 的价值在于把“高分”拆成可点击的来源行:Qwen3.8 Max 的强项集中在长上下文、工具/桌面代理、多模态文档视频和指令遵循,但自动化边界任务、OSWorld 2.0 和专家知识考试不能被总分掩盖。选型时应根据业务任务取对应分项,并把 Qwen 官方分数的 harness、温度、重复次数和脚注一起保存。
BenchLM 的排名取决于其权重、cohort 和 BenchAlign 版本;分类排名与总分不是自然常数。
绝大多数 Qwen 行的 Evidence 指向 Qwen 官方发布说明,BenchLM 并没有在该页面声明独立复跑;因此文档只能称为可核验聚合账本,不能冒充 independent re-run。
页面显示的 best verified comparison 来自当前目录中的其他模型,随着新模型或来源加入,差距会变化。
没有公开的一手 API 价格时,BenchLM 显示 N/A;本页面的总分不能代替成本、速度或上下文稳定性测试。
固定 2026-08-17 数据刷新点,保存 Qwen3.8 Max 模型页和 BenchLM 方法页。
将 52 条 source-displayable rows 导出为表格,保留 benchmark、score、weight、cohort、evidence 和原始 URL 五列。
对关键行回到 Qwen 官方页面,核对模型版本、harness、温度、重复次数、max tokens 和官方脚注。
用自己的真实任务集分别复跑 Coding、Agentic、Multimodal 和 HLE 风格任务,并把新结果另列为 independent reproduction,不覆盖 BenchLM 的聚合值。
BenchLM 对本页的证据约束是 “exact-source rows only”;这意味着它适合做来源账本,也意味着它不能被描述为一套全新独立跑分。
Qwen3.8 Max