u/Lopsided_Dot_4557 分享用 colibrì(纯 C 实现的引擎,从磁盘流式加载 MoE experts)在一台无 GPU 的机器上跑 GLM 5.2(744B MoE)的实测:
744B MoE 每 token 只激活少数 experts:colibrì 把稠密部分(约 10GB)常驻 RAM,按需从磁盘流式加载被路由到的 experts。
完整 int4 模型磁盘占用约 370GB,不需要全部放进内存。
测试机:单机、132GB RAM、Ubuntu 22.04、本地 NVMe。
| 阶段 | 速度 | expert 命中率 | RSS |
|---|---|---|---|
| 冷启动首个 token | ~0.03 tok/s | ~21% | - |
| 几轮短提示后 | ~0.15 tok/s | ~65% | - |
| 进一步预热 | ~0.22 tok/s | ~71% | ~113GB |
命中率随使用爬升:引擎会钉住实际路由到的 experts,越用越快。
完整实操视频:https://youtu.be/jxML3S5C-8Y
评论补充(Apple M5 Max 128GB):CPU/默认 1.06 tok/s(RSS 21.8GB);Metal cu --ram 96 预热后 1.11→1.83 tok/s;--ram 110 最高约 2.06 tok/s。
u/Sleepybear2611(做过 754B 三天实测):命中率爬升主要靠大 RAM(RSS 113GB 时持有约 30% expert 存储,LRU 收敛);31GB 小内存机上覆盖率只能停在 ~40–60%,因为一次生成会触及全部 experts 的 38%,工作集放不进小内存;冷启动数字与其"bytes/token ÷ 盘带宽"模型预测一致(约 11GB/token)。
"For the past month, I've been running local GLM 5.2 Q4 non-stop on my workstation rig, on repeat asking the prompt **'R… 以上为必要节选,完整内容请查看原文。
(一条可直接复制的本地持续审计提示词;对应结果:约 3.5 天一轮、每轮 10–15 个新 bug、其中 1–2 个为幻觉,偶有惊艳发现。)
反对意见(u/Littlepharaoh):0.5 tok/s 太慢,用 serverless Runpod 或廉价 API 几分钟就能跑完同样任务,成本几美分;本地跑适合"国家禁止国际支付"或"不想把代码库交出去"的人。
支持意见(u/SV_SV_SV):本地 24/7 后台审计不把代码/数据交给任何人,哲学与隐私价值成立。
生态:u/misanthrophiccunt 提到 colibrì 正在加 DeepSeek V4 Flash 支持;u/Refinery73 问是否有中小 MoE 版本——当前引擎专为 GLM 系列构建(proof of concept)。
结论指向:GLM 5.2(744B MoE)可以在无 GPU、仅 RAM+NVMe 的机器上跑起来(纯 CPU),适合"慢速、后台、长时间"的代码审计类任务;真实吞吐远低于云端 API,不适合交互式开发。
参数口径:该帖称 744B(其他来源如 GLM-5.3 发布帖称 743B,可能为四舍五入差异);int4 量化后约 370GB。
边界:单用户环境(132GB RAM)的经验;小内存机器命中率与吞吐会大幅下降;"10-15 个 bug/3.5 天"是单用户重复单提示词的观察,非受控基准。
复现:colibrì 引擎 + GLM-5.2 int4 权重 + 上述硬件即可复现量级,具体参数见原文与视频。
GLM-5.2