作者在四台机器上测试 Qwen3.8-27B:M5 Max 上的 MLX 4-bit,以及 DGX Spark 上通过 vLLM 运行的 unsloth/Qwen3.8-27B-NVFP4。他观察到从关闭思考到 effort=low 有明显跃升,但 4-bit 下 xhigh 可能因为长思考和量化误差出现极端耗时或截断。后续回复还给出 64K 预算、8-bit 复测和内存消耗等信息。
两次运行取平均,每次运行持续数小时。
effort=low 以增加 token 成本换取接近前沿模型的结果。
4-bit 的 xhigh 可能超过 50K 思考 token 仍未完成;作者用几何平均排除极端值。
作者后续称 64K 预算能让部分 xhigh 任务完成;某些测试耗时约一小时但仍达到 100%。
M5 Max 为 128GB RAM;4-bit 测试使用约 23–24GB,8-bit 约 40GB;更长上下文还会增加内存需求。
这不是 Qwen3.8-Max 云端模型的直接测评,而是同系列 27B 开放权重模型的本地量化实测。它对提示词和运行配置的启发是:先用 low/medium 做成本与延迟基线,再为困难任务单独提高 effort,并给 xhigh 设置明确的 token/time 上限。
本站仅展示 Tabbit 编辑摘要和必要节选;完整内容、上下文与最新版本请查看原始来源。
I ran the model with a 64k token budget and eventually had to use that for xhigh to complete the tasks that were failing… 以上为必要节选,完整内容请查看原文。
Qwen3.8 Max