GLM-5.2

GLM-5.2 模型测评导航

汇总 GLM-5.2 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。

11 条已核对来源的资料官方 · 媒体 · 社区

官方

1 条已核对来源的资料

媒体

4 条已核对来源的资料
媒体NIST(美国国家标准与技术研究院)官网新闻

NIST CAISI 对 Z.ai GLM-5.2 的独立能力评估

NIST CAISI 在 GLM-5.2 发布(2026-06-16,Z.ai 前身智谱 AI 发布开源权重)后约三周完成评估,给出官方机构口径的独立结论。

媒体rentry.org(作者个人提示词库的说明页)

Evening-Truth 对 Z.AI Coding Plan 响应质量的投诉与量化疑云

Evening-Truth 在提示词库中单独开了一页投诉 Z.AI Coding Plan 的响应质量: 主张:订阅 z.ai coding plan 后,"经常甚至永久"看到响应质量大幅下降;作者用同一批测试调用对比 z.ai 与 OpenRouter,差异"大到无法忽视"。

媒体Hugging Face 官方博客(Security incident disclosure)

Hugging Face 安全事件取证:GLM-5.2 被用于自托管攻击日志分析(真实项目报告)

Hugging Face 披露 2026 年 7 月遭到一次由自主 Agent 框架发起的入侵(对手以"agentic 攻击者"方式在大量短生命周期沙箱中执行数千次自动化动作、自迁移 C2),并在事件响应中实际使用了 GLM-5.2。

媒体Semgrep 官方博客

Semgrep IDOR 基准:GLM-5.2 在安全代码审计中的裸提示词结果

任务:IDOR(不安全直接对象引用)检测;数据集为此前研究使用的真实开源应用。 指标:以已知真阳性计算 precision、recall 和 F1,并记录每个真阳性的成本。 固定项:同一 IDOR 数据集、评估方法和系统提示词。

社区

6 条已核对来源的资料
社区X.com(Twitter),@arena(Arena.ai 官方账号)

Arena.ai 独立评测:GLM-5.2 (Max) 在 Code Arena / Agent Arena / Text Arena 的排名

Arena.ai 在 2026 年 6 月对 GLM-5.2 (Max) 做了三类平台内评测,结论如下。

社区X.com(Twitter),@vista8(向阳乔木,前端/独立开发者)

X 实测:GLM 5.2 生成前端网页效果被评"远超 GPT 当前版本"(@vista8)

前端开发者 @vista8(向阳乔木)在 X 上发布实测观点:GLM 5.2 生成的前端网页效果明显好于当前版本 GPT,即使使用很好的 Skill 也救不回 Codex 中 GPT 的"拉胯"前端效果。该帖获 30 转发、131 赞、约 7.2 万次浏览,并附 0:40 对比视频。

社区Reddit r/LocalLLaMA

r/LocalLLaMA 实测:Colibri 引擎无 GPU 本地运行 GLM 5.2(744B MoE)

u/LopsidedDot4557 分享用 colibrì(纯 C 实现的引擎,从磁盘流式加载 MoE experts)在一台无 GPU 的机器上跑 GLM 5.2(744B MoE)的实测。

社区Reddit r/PoeAI

r/PoeAI 讨论:GLM-5.2 突然"变笨"?——平台托管质量差异的社区证据

u/Friendly-Play-1953 在 r/PoeAI 发帖:自己用 Poe 上的 GLM-5.2 做创意写作一直效果很好,但最近两三天"像一夜之间丢了一半 IQ"——连基本细节都会跨帖遗忘(同一角色上一帖金发、下一帖变成棕发),"像 18 个月前的模型"。提示词与角色卡完全没变。

社区Reddit r/openrouter

r/openrouter 讨论:GLM-5.2 免费端点(Decart 托管)的可用性与限制

u/FreeTruck7609 发现 OpenRouter 上出现 Decart 托管的 GLM 免费端点("大约一天前"上线),初期有可靠性问题,之后稳定在接近 100% 可用率。

社区Reddit,r/ZaiGLM

Reddit 盲代码评审:GLM-5.2 的生产就绪评分与多裁判复核

任务:同一 VPS Manager 规格下的规划与代码实现;共 5 个模型实现。 盲评:首轮由 Qwen 3.7 Plus 按固定 25 分网格评分;后续增加 GPT Codex、Gemini 3.1 Pro 两个独立评审。

GLM-5.2

在 Tabbit 中使用并对比模型

汇总 GLM-5.2 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。