Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体GLM-5.2

NIST CAISI 对 Z.ai GLM-5.2 的独立能力评估

原始来源

NIST(美国国家标准与技术研究院)官网新闻

作者NIST CAISI(Center for AI Standards and Innovation)

原文日期2026-07-17

Tabbit 整理2026-08-19

查看原文

核心内容摘要

NIST CAISI 在 GLM-5.2 发布(2026-06-16,Z.ai 前身智谱 AI 发布开源权重)后约三周完成评估,给出官方机构口径的独立结论:

关键结论(CAISI 自评体系)

  1. 发布时很可能是最强的开源权重模型("probably the most capable open-weight AI model when it was released")。

  2. 综合能力与 2025 年 12 月发布的 GPT-5.2 相当。

  3. 网络(cyber)能力与 2026 年 2 月发布的 Claude Opus 4.6 相当。

  4. 安全护栏(safeguards)表现参差:

    • 允许协助开发 Agentic 网络漏洞利用(assistance with agentic cyber exploit development);

    • 对敏感生物问题的拦截少于美国参考模型;

    • 但对 Agent 劫持与越狱攻击的鲁棒性可能高于其他被评估的中国开源权重模型;

    • 注意:开源权重模型自托管时护栏均可被绕过。

其他信息

  • 新闻稿包含"发布时最强美/中模型综合能力随时间对比"图(Figure 1),y 轴 400 分对应任务求解概率提升 10 倍;方法与细节见完整评估报告的 Appendix A1/A4——报告正文未随新闻稿公开,需在 NIST CAISI 站点另行获取。

  • 该评估是美国政府机构视角,与 Z.ai 官方跑分互相独立,可交叉验证"GLM-5.2 发布时为开源最强"这一结论。

证据要点与适用边界

  • 证据等级说明:属于有完整方法论(但正文未在本次采集的页面公开)的独立机构评估;要复现需获取 CAISI 完整评估报告。

  • 用途:可用于判断 GLM-5.2 的(1)开源模型横向定位,(2)与闭源旗舰(GPT-5.2、Opus 4.6 级别)的能力差距,(3)网络能力风险等级,(4)安全护栏强弱——尤其适合做"选型时是否引入该模型"的合规与安全评估。

  • 边界:结论基于 CAISI 自己的评估集,非通用排名;网络安全能力结论涉及敏感用途,引用时注意上下文;护栏结论不适用于自托管部署(可绕过)。

原文关键引文

"GLM-5.2 was probably the most capable open-weight AI model when it was released."

"GLM-5.2's overall capabilities are similar to that of GPT-5.2, released in December 2025."

"GLM-5.2's cyber capabilities are similar to that of Opus 4.6, released in February 2026."

"GLM-5.2 appears potentially more robust against agent hijacking and jailbreaking attacks than other evaluated PRC open-… 以上为必要节选,完整内容请查看原文。

"Regardless of their robustness, safeguards for open-weight models can be circumvented when self-hosted."

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GLM-5.2

在 Tabbit 中使用并对比模型

GLM-5.2

相关测评

官方Z.ai 官方博客2026-06-16

GLM-5.2 官方发布说明与完整跑分表(Z.ai 博客)

媒体rentry.org(作者个人提示词库的说明页)2026-03-09

Evening-Truth 对 Z.AI Coding Plan 响应质量的投诉与量化疑云

媒体Hugging Face 官方博客(Security incident disclosure)2026-07

Hugging Face 安全事件取证:GLM-5.2 被用于自托管攻击日志分析(真实项目报告)

媒体Semgrep 官方博客2026-07

Semgrep IDOR 基准:GLM-5.2 在安全代码审计中的裸提示词结果

GLM-5.2

相关提示词

媒体Z.ai 官方开发者文档(docs.z.ai)2026-06-16

GLM-5.2 官方文档 Overview 与 API 快速开始(docs.z.ai)

媒体Z.ai 官方开发者文档(docs.z.ai,Get Started / Migrate)2026-06

从 GLM-5.1 / GLM-5 / GLM-4.x 迁移到 GLM-5.2 的官方配置指南

媒体Z.ai 官方开发者文档(docs.z.ai,Capabilities / Thinking Mode)

GLM-5.2 思考模式配置:默认思考 / 交错思考 / 保留思考 / 回合级思考(官方)

社区X.com(Twitter),@arena(Arena.ai 官方账号)2026-06-27

Arena.ai 前端编码同题对比:GLM-5.2 (Max) vs Claude Opus 4.8 (Thinking) 的 10 个单次生成示例