Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.2 · 社区来源 · 个人体验

r/LocalLLaMA 实测:Colibri 引擎无 GPU 本地运行 GLM 5.2(744B MoE)

u/LopsidedDot4557 分享用 colibrì(纯 C 实现的引擎,从磁盘流式加载 MoE experts)在一台无 GPU 的机器上跑 GLM 5.2(744B MoE)的实测。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源个人体验编辑日期 2026-09-20

测试条件速查

模型/版本
模型为 GLM-5.2;来源标题:r/LocalLLaMA 实测:Colibri 引擎无 GPU 本地运行 GLM 5.2(744B MoE)。精确快照按原始来源。
任务/harness
LocalLLaMA 记录 colibrì 在 132GB RAM、Ubuntu 22.04、约 370GB int4 权重的无 GPU GLM-5.2 744B 运行,速度从冷启动约 0.03 tok/s 预热到约 0.22 tok/s。 完整任务集、provider、参数和评审流程未完全公开。
样本/日期
来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。

关键数据与适用场景

核心内容摘要

u/Lopsided_Dot_4557 分享用 colibrì(纯 C 实现的引擎,从磁盘流式加载 MoE experts)在一台无 GPU 的机器上跑 GLM 5.2(744B MoE)的实测:

原理与配置

  • 744B MoE 每 token 只激活少数 experts:colibrì 把稠密部分(约 10GB)常驻 RAM,按需从磁盘流式加载被路由到的 experts。

  • 完整 int4 模型磁盘占用约 370GB,不需要全部放进内存。

  • 测试机:单机、132GB RAM、Ubuntu 22.04、本地 NVMe。

实测性能(冷启动 → 预热)

阶段速度expert 命中率RSS
冷启动首个 token~0.03 tok/s~21%-
几轮短提示后~0.15 tok/s~65%-
进一步预热~0.22 tok/s~71%~113GB
  • 命中率随使用爬升:引擎会钉住实际路由到的 experts,越用越快。

  • 完整实操视频:https://youtu.be/jxML3S5C-8Y

  • 评论补充(Apple M5 Max 128GB):CPU/默认 1.06 tok/s(RSS 21.8GB);Metal cu --ram 96 预热后 1.11→1.83 tok/s;--ram 110 最高约 2.06 tok/s。

  • u/Sleepybear2611(做过 754B 三天实测):命中率爬升主要靠大 RAM(RSS 113GB 时持有约 30% expert 存储,LRU 收敛);31GB 小内存机上覆盖率只能停在 ~40–60%,因为一次生成会触及全部 experts 的 38%,工作集放不进小内存;冷启动数字与其"bytes/token ÷ 盘带宽"模型预测一致(约 11GB/token)。

评论区的杀手级用例(u/trej 原话引用)

"For the past month, I've been running local GLM 5.2 Q4 non-stop on my workstation rig, on repeat asking the prompt **'R… 以上为必要节选,完整内容请查看原文。

(一条可直接复制的本地持续审计提示词;对应结果:约 3.5 天一轮、每轮 10–15 个新 bug、其中 1–2 个为幻觉,偶有惊艳发现。)

社区讨论要点

  • 反对意见(u/Littlepharaoh):0.5 tok/s 太慢,用 serverless Runpod 或廉价 API 几分钟就能跑完同样任务,成本几美分;本地跑适合"国家禁止国际支付"或"不想把代码库交出去"的人。

  • 支持意见(u/SV_SV_SV):本地 24/7 后台审计不把代码/数据交给任何人,哲学与隐私价值成立。

  • 生态:u/misanthrophiccunt 提到 colibrì 正在加 DeepSeek V4 Flash 支持;u/Refinery73 问是否有中小 MoE 版本——当前引擎专为 GLM 系列构建(proof of concept)。

证据要点与适用边界

  • 结论指向:GLM 5.2(744B MoE)可以在无 GPU、仅 RAM+NVMe 的机器上跑起来(纯 CPU),适合"慢速、后台、长时间"的代码审计类任务;真实吞吐远低于云端 API,不适合交互式开发。

  • 参数口径:该帖称 744B(其他来源如 GLM-5.3 发布帖称 743B,可能为四舍五入差异);int4 量化后约 370GB。

  • 边界:单用户环境(132GB RAM)的经验;小内存机器命中率与吞吐会大幅下降;"10-15 个 bug/3.5 天"是单用户重复单提示词的观察,非受控基准。

  • 复现:colibrì 引擎 + GLM-5.2 int4 权重 + 上述硬件即可复现量级,具体参数见原文与视频。

能支持的判断

  • LocalLLaMA 记录 colibrì 在 132GB RAM、Ubuntu 22.04、约 370GB int4 权重的无 GPU GLM-5.2 744B 运行,速度从冷启动约 0.03 tok/s 预热到约 0.22 tok/s。

不能支持的判断

  • 不支持将该来源的结果外推为普遍能力、生产成功率或当前排名;LocalLLaMA 记录 colibrì 在 132GB RAM、Ubuntu 22.04、约 370GB int4 权重的无 GPU GLM-5.2 744B 运行,速度从冷启动约 0.03 tok/s 预热到约 0.22 tok/s的完整 harness、样本和复测条件未完全公开。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Reddit r/LocalLLaMA · u/LopsidedDot4557(主帖);u/SVSVSV、u/trej、u/Sleepybear2611、u/Academic-Most6214 等(评论) · 原文发布日期 2026-07 · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.2

在 Tabbit 中比较 GLM-5.2

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GLM-5.2 是什么:价格、部署与适用边界

说明 GLM-5.2 的 2026 年 6 月发布、1M 上下文、开源权重、API 计费、编码证据与安全试用边界。

相关评测

Reddit 盲代码评审:GLM-5.2 的生产就绪评分与多裁判复核Reddit VPS Manager 盲评在同一规格下比较 5 个模型,首轮由 Qwen 3.7 Plus 按固定 25 分表评分,后续增加 GPT Codex 与 Gemini 3.1 Pro 复核;样本为单项目。GLM-5.2 官方发布说明与完整跑分表(Z.ai 博客)Z.ai 2026-06-16 发布材料把 GLM-5.2 定位为 1M context 的长时程旗舰,并报告 Terminal-Bench 2.1 81.0、SWE-Bench Pro 62.1;官方还披露训练阶段 reward-hacking 风险。NIST CAISI 对 Z.ai GLM-5.2 的独立能力评估NIST CAISI 2026-07-17 发布、2026-07-08 完成的评估认为 GLM-5.2 综合能力接近 GPT-5.2、网络能力接近 Opus 4.6,但 safeguards 对 agentic exploit 与生物问题表现混合。Semgrep IDOR 基准:GLM-5.2 在安全代码审计中的裸提示词结果Semgrep 2026-06-22 的 IDOR 基准在相同数据集、评估方法和提示词下给 GLM-5.2 的 Pydantic AI prompt-only harness 39% F1、约 $0.17/漏洞;不是通用网络安全分数。GLM-5.2 官方文档 Overview 与 API 快速开始(docs.z.ai)官方给 GLM-5.2 的标准接入配置:模型名 `glm-5.2`、1M 上下文 / 128K 最大输出、`thinking.type: enabled` + `reasoning_effort: max`、`temperature: 1.0`,可直接复制 curl / Python 示例完成首次调用,并了解官方认定的典型使用场景。GLM-5.2 思考模式配置:默认思考 / 交错思考 / 保留思考 / 回合级思考(官方)官方说明 GLM-5.2 思考默认开启(与 GLM-5.1/5/4.7 一致),提供四种思考形态——默认思考、交错思考(工具调用之间思考)、保留思考(跨轮保留推理内容,`clear_thinking: false`)、回合级思考(每回合独立开关),并给出"必须把历史 `reasoning_content` 原样回传"的 Agent 集成关键约束。从 GLM-5.1 / GLM-5 / GLM-4.x 迁移到 GLM-5.2 的官方配置指南官方给出的 GLM-5.2 迁移清单与参数配置:模型 ID 改为 `glm-5.2`、`temperature` 默认 1.0 / `top_p` 默认 0.95(二选一调参)、思考默认开启、`reasoning_effort` 用 `high` 或 `max`、流式与工具流式(`stream=true` + `tool_stream=true`)需按官方方式拼接,并附可直接使用的 Python 迁移示例。通过 Mistral 平台使用 GLM-5.2(zai-glm-5-2):第三方托管配置与定价GLM-5.2 已由 Mistral 作为第三方开源模型托管(Public Preview,模型 ID `zai-glm-5-2`,1M 上下文 / 128k 输出,未做任何修改),可直接在 Mistral 生态(Vibe CLI 等)中用该 ID 接入,价格为 $1.4 / $0.14(缓存输入)/ $4.4(输出)每百万 token。