Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.2 · 媒体来源 · 编辑分析

NIST CAISI 对 Z.ai GLM-5.2 的独立能力评估

NIST CAISI 2026-07-17 发布、2026-07-08 完成的评估认为 GLM-5.2 综合能力接近 GPT-5.2、网络能力接近 Opus 4.6,但 safeguards 对 agentic exploit 与生物问题表现混合。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源编辑分析编辑日期 2026-09-20

测试条件速查

条件
版本 GLM-5.2;NIST CAISI 评估完成 2026-07-08、发布 2026-07-17;机构评测含 prompt jailbreak robustness 与 safeguards,完整题集/重复见报告附录。

关键数据与适用场景

核心内容摘要

NIST CAISI 在 GLM-5.2 发布(2026-06-16,Z.ai 前身智谱 AI 发布开源权重)后约三周完成评估,给出官方机构口径的独立结论:

关键结论(CAISI 自评体系)

  1. 发布时很可能是最强的开源权重模型("probably the most capable open-weight AI model when it was released")。

  2. 综合能力与 2025 年 12 月发布的 GPT-5.2 相当。

  3. 网络(cyber)能力与 2026 年 2 月发布的 Claude Opus 4.6 相当。

  4. 安全护栏(safeguards)表现参差:

    • 允许协助开发 Agentic 网络漏洞利用(assistance with agentic cyber exploit development);

    • 对敏感生物问题的拦截少于美国参考模型;

    • 但对 Agent 劫持与越狱攻击的鲁棒性可能高于其他被评估的中国开源权重模型;

    • 注意:开源权重模型自托管时护栏均可被绕过。

其他信息

  • 新闻稿包含"发布时最强美/中模型综合能力随时间对比"图(Figure 1),y 轴 400 分对应任务求解概率提升 10 倍;方法与细节见完整评估报告的 Appendix A1/A4——报告正文未随新闻稿公开,需在 NIST CAISI 站点另行获取。

  • 该评估是美国政府机构视角,与 Z.ai 官方跑分互相独立,可交叉验证"GLM-5.2 发布时为开源最强"这一结论。

证据要点与适用边界

  • 证据等级说明:属于有完整方法论(但正文未在本次采集的页面公开)的独立机构评估;要复现需获取 CAISI 完整评估报告。

  • 用途:可用于判断 GLM-5.2 的(1)开源模型横向定位,(2)与闭源旗舰(GPT-5.2、Opus 4.6 级别)的能力差距,(3)网络能力风险等级,(4)安全护栏强弱——尤其适合做"选型时是否引入该模型"的合规与安全评估。

  • 边界:结论基于 CAISI 自己的评估集,非通用排名;网络安全能力结论涉及敏感用途,引用时注意上下文;护栏结论不适用于自托管部署(可绕过)。

原文关键引文

"GLM-5.2 was probably the most capable open-weight AI model when it was released."

"GLM-5.2's overall capabilities are similar to that of GPT-5.2, released in December 2025."

"GLM-5.2's cyber capabilities are similar to that of Opus 4.6, released in February 2026."

"GLM-5.2 appears potentially more robust against agent hijacking and jailbreaking attacks than other evaluated PRC open-… 以上为必要节选,完整内容请查看原文。

"Regardless of their robustness, safeguards for open-weight models can be circumvented when self-hosted."

能支持的判断

  • 支持引用机构对能力与 safeguards 的分项判断。

不能支持的判断

  • 不支持把开源权重自托管后的安全性视为同一评测结果。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

NIST(美国国家标准与技术研究院)官网新闻 · NIST CAISI(Center for AI Standards and Innovation) · 原文发布日期 2026-07-17 · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.2

在 Tabbit 中比较 GLM-5.2

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GLM-5.2 是什么:价格、部署与适用边界

说明 GLM-5.2 的 2026 年 6 月发布、1M 上下文、开源权重、API 计费、编码证据与安全试用边界。

相关评测

Semgrep IDOR 基准:GLM-5.2 在安全代码审计中的裸提示词结果Semgrep 2026-06-22 的 IDOR 基准在相同数据集、评估方法和提示词下给 GLM-5.2 的 Pydantic AI prompt-only harness 39% F1、约 $0.17/漏洞;不是通用网络安全分数。GLM-5.2 官方发布说明与完整跑分表(Z.ai 博客)Z.ai 2026-06-16 发布材料把 GLM-5.2 定位为 1M context 的长时程旗舰,并报告 Terminal-Bench 2.1 81.0、SWE-Bench Pro 62.1;官方还披露训练阶段 reward-hacking 风险。Reddit 盲代码评审:GLM-5.2 的生产就绪评分与多裁判复核Reddit VPS Manager 盲评在同一规格下比较 5 个模型,首轮由 Qwen 3.7 Plus 按固定 25 分表评分,后续增加 GPT Codex 与 Gemini 3.1 Pro 复核;样本为单项目。Evening-Truth 对 Z.AI Coding Plan 响应质量的投诉与量化疑云Evening-Truth 在提示词库中单独开了一页投诉 Z.AI Coding Plan 的响应质量: 主张:订阅 z.ai coding plan 后,"经常甚至永久"看到响应质量大幅下降;作者用同一批测试调用对比 z.ai 与 OpenRouter,差异"大到无法忽视"。GLM-5.2 官方文档 Overview 与 API 快速开始(docs.z.ai)官方给 GLM-5.2 的标准接入配置:模型名 `glm-5.2`、1M 上下文 / 128K 最大输出、`thinking.type: enabled` + `reasoning_effort: max`、`temperature: 1.0`,可直接复制 curl / Python 示例完成首次调用,并了解官方认定的典型使用场景。GLM-5.2 思考模式配置:默认思考 / 交错思考 / 保留思考 / 回合级思考(官方)官方说明 GLM-5.2 思考默认开启(与 GLM-5.1/5/4.7 一致),提供四种思考形态——默认思考、交错思考(工具调用之间思考)、保留思考(跨轮保留推理内容,`clear_thinking: false`)、回合级思考(每回合独立开关),并给出"必须把历史 `reasoning_content` 原样回传"的 Agent 集成关键约束。从 GLM-5.1 / GLM-5 / GLM-4.x 迁移到 GLM-5.2 的官方配置指南官方给出的 GLM-5.2 迁移清单与参数配置:模型 ID 改为 `glm-5.2`、`temperature` 默认 1.0 / `top_p` 默认 0.95(二选一调参)、思考默认开启、`reasoning_effort` 用 `high` 或 `max`、流式与工具流式(`stream=true` + `tool_stream=true`)需按官方方式拼接,并附可直接使用的 Python 迁移示例。通过 Mistral 平台使用 GLM-5.2(zai-glm-5-2):第三方托管配置与定价GLM-5.2 已由 Mistral 作为第三方开源模型托管(Public Preview,模型 ID `zai-glm-5-2`,1M 上下文 / 128k 输出,未做任何修改),可直接在 Mistral 生态(Vibe CLI 等)中用该 ID 接入,价格为 $1.4 / $0.14(缓存输入)/ $4.4(输出)每百万 token。