Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区GLM-5.2

r/LocalLLaMA 实测:Colibri 引擎无 GPU 本地运行 GLM 5.2(744B MoE)

原始来源

Reddit r/LocalLLaMA

作者u/LopsidedDot4557(主帖);u/SVSVSV、u/trej、u/Sleepybear2611、u/Academic-Most6214 等(评论)

原文日期2026-07

Tabbit 整理2026-08-19

查看原文

核心内容摘要

u/Lopsided_Dot_4557 分享用 colibrì(纯 C 实现的引擎,从磁盘流式加载 MoE experts)在一台无 GPU 的机器上跑 GLM 5.2(744B MoE)的实测:

原理与配置

  • 744B MoE 每 token 只激活少数 experts:colibrì 把稠密部分(约 10GB)常驻 RAM,按需从磁盘流式加载被路由到的 experts。

  • 完整 int4 模型磁盘占用约 370GB,不需要全部放进内存。

  • 测试机:单机、132GB RAM、Ubuntu 22.04、本地 NVMe。

实测性能(冷启动 → 预热)

阶段速度expert 命中率RSS
冷启动首个 token~0.03 tok/s~21%-
几轮短提示后~0.15 tok/s~65%-
进一步预热~0.22 tok/s~71%~113GB
  • 命中率随使用爬升:引擎会钉住实际路由到的 experts,越用越快。

  • 完整实操视频:https://youtu.be/jxML3S5C-8Y

  • 评论补充(Apple M5 Max 128GB):CPU/默认 1.06 tok/s(RSS 21.8GB);Metal cu --ram 96 预热后 1.11→1.83 tok/s;--ram 110 最高约 2.06 tok/s。

  • u/Sleepybear2611(做过 754B 三天实测):命中率爬升主要靠大 RAM(RSS 113GB 时持有约 30% expert 存储,LRU 收敛);31GB 小内存机上覆盖率只能停在 ~40–60%,因为一次生成会触及全部 experts 的 38%,工作集放不进小内存;冷启动数字与其"bytes/token ÷ 盘带宽"模型预测一致(约 11GB/token)。

评论区的杀手级用例(u/trej 原话引用)

"For the past month, I've been running local GLM 5.2 Q4 non-stop on my workstation rig, on repeat asking the prompt **'R… 以上为必要节选,完整内容请查看原文。

(一条可直接复制的本地持续审计提示词;对应结果:约 3.5 天一轮、每轮 10–15 个新 bug、其中 1–2 个为幻觉,偶有惊艳发现。)

社区讨论要点

  • 反对意见(u/Littlepharaoh):0.5 tok/s 太慢,用 serverless Runpod 或廉价 API 几分钟就能跑完同样任务,成本几美分;本地跑适合"国家禁止国际支付"或"不想把代码库交出去"的人。

  • 支持意见(u/SV_SV_SV):本地 24/7 后台审计不把代码/数据交给任何人,哲学与隐私价值成立。

  • 生态:u/misanthrophiccunt 提到 colibrì 正在加 DeepSeek V4 Flash 支持;u/Refinery73 问是否有中小 MoE 版本——当前引擎专为 GLM 系列构建(proof of concept)。

证据要点与适用边界

  • 结论指向:GLM 5.2(744B MoE)可以在无 GPU、仅 RAM+NVMe 的机器上跑起来(纯 CPU),适合"慢速、后台、长时间"的代码审计类任务;真实吞吐远低于云端 API,不适合交互式开发。

  • 参数口径:该帖称 744B(其他来源如 GLM-5.3 发布帖称 743B,可能为四舍五入差异);int4 量化后约 370GB。

  • 边界:单用户环境(132GB RAM)的经验;小内存机器命中率与吞吐会大幅下降;"10-15 个 bug/3.5 天"是单用户重复单提示词的观察,非受控基准。

  • 复现:colibrì 引擎 + GLM-5.2 int4 权重 + 上述硬件即可复现量级,具体参数见原文与视频。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GLM-5.2

在 Tabbit 中使用并对比模型

GLM-5.2

相关测评

官方Z.ai 官方博客2026-06-16

GLM-5.2 官方发布说明与完整跑分表(Z.ai 博客)

媒体NIST(美国国家标准与技术研究院)官网新闻2026-07-17

NIST CAISI 对 Z.ai GLM-5.2 的独立能力评估

媒体rentry.org(作者个人提示词库的说明页)2026-03-09

Evening-Truth 对 Z.AI Coding Plan 响应质量的投诉与量化疑云

媒体Hugging Face 官方博客(Security incident disclosure)2026-07

Hugging Face 安全事件取证:GLM-5.2 被用于自托管攻击日志分析(真实项目报告)

GLM-5.2

相关提示词

媒体Z.ai 官方开发者文档(docs.z.ai)2026-06-16

GLM-5.2 官方文档 Overview 与 API 快速开始(docs.z.ai)

媒体Z.ai 官方开发者文档(docs.z.ai,Get Started / Migrate)2026-06

从 GLM-5.1 / GLM-5 / GLM-4.x 迁移到 GLM-5.2 的官方配置指南

媒体Z.ai 官方开发者文档(docs.z.ai,Capabilities / Thinking Mode)

GLM-5.2 思考模式配置:默认思考 / 交错思考 / 保留思考 / 回合级思考(官方)

社区X.com(Twitter),@arena(Arena.ai 官方账号)2026-06-27

Arena.ai 前端编码同题对比:GLM-5.2 (Max) vs Claude Opus 4.8 (Thinking) 的 10 个单次生成示例