NIST CAISI 在 GLM-5.2 发布(2026-06-16,Z.ai 前身智谱 AI 发布开源权重)后约三周完成评估,给出官方机构口径的独立结论:
发布时很可能是最强的开源权重模型("probably the most capable open-weight AI model when it was released")。
综合能力与 2025 年 12 月发布的 GPT-5.2 相当。
网络(cyber)能力与 2026 年 2 月发布的 Claude Opus 4.6 相当。
安全护栏(safeguards)表现参差:
允许协助开发 Agentic 网络漏洞利用(assistance with agentic cyber exploit development);
对敏感生物问题的拦截少于美国参考模型;
但对 Agent 劫持与越狱攻击的鲁棒性可能高于其他被评估的中国开源权重模型;
注意:开源权重模型自托管时护栏均可被绕过。
新闻稿包含"发布时最强美/中模型综合能力随时间对比"图(Figure 1),y 轴 400 分对应任务求解概率提升 10 倍;方法与细节见完整评估报告的 Appendix A1/A4——报告正文未随新闻稿公开,需在 NIST CAISI 站点另行获取。
该评估是美国政府机构视角,与 Z.ai 官方跑分互相独立,可交叉验证"GLM-5.2 发布时为开源最强"这一结论。
证据等级说明:属于有完整方法论(但正文未在本次采集的页面公开)的独立机构评估;要复现需获取 CAISI 完整评估报告。
用途:可用于判断 GLM-5.2 的(1)开源模型横向定位,(2)与闭源旗舰(GPT-5.2、Opus 4.6 级别)的能力差距,(3)网络能力风险等级,(4)安全护栏强弱——尤其适合做"选型时是否引入该模型"的合规与安全评估。
边界:结论基于 CAISI 自己的评估集,非通用排名;网络安全能力结论涉及敏感用途,引用时注意上下文;护栏结论不适用于自托管部署(可绕过)。
"GLM-5.2 was probably the most capable open-weight AI model when it was released."
"GLM-5.2's overall capabilities are similar to that of GPT-5.2, released in December 2025."
"GLM-5.2's cyber capabilities are similar to that of Opus 4.6, released in February 2026."
"GLM-5.2 appears potentially more robust against agent hijacking and jailbreaking attacks than other evaluated PRC open-… 以上为必要节选,完整内容请查看原文。
"Regardless of their robustness, safeguards for open-weight models can be circumvented when self-hosted."
GLM-5.2