Qwen3.8 Max · 社区来源 · 个人体验
作者在四台机器上测试 Qwen3.8-27B:M5 Max 上的 MLX 4-bit,以及 DGX Spark 上通过 vLLM 运行的 unsloth/Qwen3.8-27B-NVFP4。他观察到从关闭思考到 effort=low 有明显跃升,但 4-bit 下 xhigh 可能因为长思考和量化误差出现极端耗时或截断。后续回复还给出 64K 预算、8-bit 复测和内存消耗等信息。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
作者在四台机器上测试 Qwen3.8-27B:M5 Max 上的 MLX 4-bit,以及 DGX Spark 上通过 vLLM 运行的 unsloth/Qwen3.8-27B-NVFP4。他观察到从关闭思考到 effort=low 有明显跃升,但 4-bit 下 xhigh 可能因为长思考和量化误差出现极端耗时或截断。后续回复还给出 64K 预算、8-bit 复测和内存消耗等信息。
两次运行取平均,每次运行持续数小时。
effort=low 以增加 token 成本换取接近前沿模型的结果。
4-bit 的 xhigh 可能超过 50K 思考 token 仍未完成;作者用几何平均排除极端值。
作者后续称 64K 预算能让部分 xhigh 任务完成;某些测试耗时约一小时但仍达到 100%。
M5 Max 为 128GB RAM;4-bit 测试使用约 23–24GB,8-bit 约 40GB;更长上下文还会增加内存需求。
这不是 Qwen3.8-Max 云端模型的直接测评,而是同系列 27B 开放权重模型的本地量化实测。它对提示词和运行配置的启发是:先用 low/medium 做成本与延迟基线,再为困难任务单独提高 effort,并给 xhigh 设置明确的 token/time 上限。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
I ran the model with a 64k token budget and eventually had to use that for xhigh to complete the tasks that were failing… 以上为必要节选,完整内容请查看原文。
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
X(@jtdavies) · John T Davies · 原文发布日期 2026-08-16 · 本站编辑日期 2026-09-20
打开原始来源Qwen3.8 Max
下载 Tabbit 客户端后检查模型可用性