GLM-5.2

GLM-5.2 · 测评与证据

GLM-5.2,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

Z.ai 2026-06-16 发布材料把 GLM-5.2 定位为 1M context 的长时程旗舰,并报告 Terminal-Bench 2.1 81.0、SWE-Bench Pro 62.1;官方还披露训练阶段 reward-hacking 风险。

Z.ai 官方博客 · 查看证据

Semgrep 2026-06-22 的 IDOR 基准在相同数据集、评估方法和提示词下给 GLM-5.2 的 Pydantic AI prompt-only harness 39% F1、约 $0.17/漏洞;不是通用网络安全分数。

Semgrep 官方博客 · 查看证据

完整测评与相关内容

模型深度阅读

总览 · 简体中文

GLM-5.2 是什么:价格、部署与适用边界

说明 GLM-5.2 的 2026 年 6 月发布、1M 上下文、开源权重、API 计费、编码证据与安全试用边界。

精选证据

官方厂商自报

GLM-5.2 官方发布说明与完整跑分表(Z.ai 博客)

Z.ai 2026-06-16 发布材料把 GLM-5.2 定位为 1M context 的长时程旗舰,并报告 Terminal-Bench 2.1 81.0、SWE-Bench Pro 62.1;官方还披露训练阶段 reward-hacking 风险。

来源Z.ai 官方博客
原文日期2026-06-16
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 GLM-5.2;官方发布 2026-06-16;任务为 Terminal-Bench 2.1、SWE-Bench Pro 与长时程工程;完整 harness、重复和生产成功率未公开。
推理能力
媒体 / 基准方编辑分析

NIST CAISI 对 Z.ai GLM-5.2 的独立能力评估

NIST CAISI 2026-07-17 发布、2026-07-08 完成的评估认为 GLM-5.2 综合能力接近 GPT-5.2、网络能力接近 Opus 4.6,但 safeguards 对 agentic exploit 与生物问题表现混合。

来源NIST(美国国家标准与技术研究院)官网新闻
原文日期2026-07-17
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 GLM-5.2;NIST CAISI 评估完成 2026-07-08、发布 2026-07-17;机构评测含 prompt jailbreak robustness 与 safeguards,完整题集/重复见报告附录。
推理能力
媒体 / 基准方编辑分析

Semgrep IDOR 基准:GLM-5.2 在安全代码审计中的裸提示词结果

Semgrep 2026-06-22 的 IDOR 基准在相同数据集、评估方法和提示词下给 GLM-5.2 的 Pydantic AI prompt-only harness 39% F1、约 $0.17/漏洞;不是通用网络安全分数。

来源Semgrep 官方博客
原文日期2026-07
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 GLM-5.2;Semgrep IDOR 真实开源应用数据集;同一 prompt/Pydantic AI harness;单次配置结果,F1 39%、约 $0.17/漏洞,非大规模复跑。
推理能力
社区个人体验

Reddit 盲代码评审:GLM-5.2 的生产就绪评分与多裁判复核

Reddit VPS Manager 盲评在同一规格下比较 5 个模型,首轮由 Qwen 3.7 Plus 按固定 25 分表评分,后续增加 GPT Codex 与 Gemini 3.1 Pro 复核;样本为单项目。

来源Reddit,r/ZaiGLM
原文日期未知
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 GLM-5.2;同一 VPS Manager 规格、5 个实现;首轮 Qwen 3.7 Plus 评分,后续 GPT Codex/Gemini 3.1 Pro 复核;项目数、prompt 和重复有限。
推理能力

全部来源

全部来源

11 / 11
官方厂商自报

GLM-5.2 官方发布说明与完整跑分表(Z.ai 博客)

Z.ai 2026-06-16 发布材料把 GLM-5.2 定位为 1M context 的长时程旗舰,并报告 Terminal-Bench 2.1 81.0、SWE-Bench Pro 62.1;官方还披露训练阶段 reward-hacking 风险。

来源Z.ai 官方博客
原文日期2026-06-16
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 GLM-5.2;官方发布 2026-06-16;任务为 Terminal-Bench 2.1、SWE-Bench Pro 与长时程工程;完整 harness、重复和生产成功率未公开。
推理能力
媒体 / 基准方编辑分析

NIST CAISI 对 Z.ai GLM-5.2 的独立能力评估

NIST CAISI 2026-07-17 发布、2026-07-08 完成的评估认为 GLM-5.2 综合能力接近 GPT-5.2、网络能力接近 Opus 4.6,但 safeguards 对 agentic exploit 与生物问题表现混合。

来源NIST(美国国家标准与技术研究院)官网新闻
原文日期2026-07-17
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 GLM-5.2;NIST CAISI 评估完成 2026-07-08、发布 2026-07-17;机构评测含 prompt jailbreak robustness 与 safeguards,完整题集/重复见报告附录。
推理能力
媒体 / 基准方编辑分析

Semgrep IDOR 基准:GLM-5.2 在安全代码审计中的裸提示词结果

Semgrep 2026-06-22 的 IDOR 基准在相同数据集、评估方法和提示词下给 GLM-5.2 的 Pydantic AI prompt-only harness 39% F1、约 $0.17/漏洞;不是通用网络安全分数。

来源Semgrep 官方博客
原文日期2026-07
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 GLM-5.2;Semgrep IDOR 真实开源应用数据集;同一 prompt/Pydantic AI harness;单次配置结果,F1 39%、约 $0.17/漏洞,非大规模复跑。
推理能力
社区个人体验

Reddit 盲代码评审:GLM-5.2 的生产就绪评分与多裁判复核

Reddit VPS Manager 盲评在同一规格下比较 5 个模型,首轮由 Qwen 3.7 Plus 按固定 25 分表评分,后续增加 GPT Codex 与 Gemini 3.1 Pro 复核;样本为单项目。

来源Reddit,r/ZaiGLM
原文日期未知
采集2026-08-18

待验证:本次未能重新核实原文。

条件
版本 GLM-5.2;同一 VPS Manager 规格、5 个实现;首轮 Qwen 3.7 Plus 评分,后续 GPT Codex/Gemini 3.1 Pro 复核;项目数、prompt 和重复有限。
推理能力
社区个人体验

Arena.ai 独立评测:GLM-5.2 (Max) 在 Code Arena / Agent Arena / Text Arena 的排名

Arena.ai 在 2026 年 6 月对 GLM-5.2 (Max) 做了三类平台内评测,结论如下。

来源X.com(Twitter),@arena(Arena.ai 官方账号)
原文日期2026-06-17
采集2026-08-18

待验证:本次未能重新核实原文。

模型/版本
模型为 GLM-5.2;来源标题:Arena.ai 独立评测:GLM-5.2 (Max) 在 Code Arena / Agent Arena / Text Arena 的排名。精确快照按原始来源。
任务/harness
Arena.ai 的 GLM-5.2 Max 记录覆盖 Frontend Code Arena、Agent Arena 和 Text Arena;其中前端榜的社区投票位置可用于任务分流。 完整任务集、provider、参数和评审流程未完全公开。
样本/日期
来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
推理能力
社区个人体验

X 实测:GLM 5.2 生成前端网页效果被评"远超 GPT 当前版本"(@vista8)

前端开发者 @vista8(向阳乔木)在 X 上发布实测观点:GLM 5.2 生成的前端网页效果明显好于当前版本 GPT,即使使用很好的 Skill 也救不回 Codex 中 GPT 的"拉胯"前端效果。该帖获 30 转发、131 赞、约 7.2 万次浏览,并附 0:40 对比视频。

来源X.com(Twitter),@vista8(向阳乔木,前端/独立开发者)
原文日期2026-07-05
采集2026-08-18

待验证:本次未能重新核实原文。

模型/版本
模型为 GLM-5.2;来源标题:X 实测:GLM 5.2 生成前端网页效果被评"远超 GPT 当前版本"(@vista8)。精确快照按原始来源。
任务/harness
vista8 的单次前端实测称 GLM 5.2 的网页生成效果明显强于其当前 GPT 对照,并附有约 0:40 的对比视频。 完整任务集、provider、参数和评审流程未完全公开。
样本/日期
来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
推理能力
社区个人体验

r/LocalLLaMA 实测:Colibri 引擎无 GPU 本地运行 GLM 5.2(744B MoE)

u/LopsidedDot4557 分享用 colibrì(纯 C 实现的引擎,从磁盘流式加载 MoE experts)在一台无 GPU 的机器上跑 GLM 5.2(744B MoE)的实测。

来源Reddit r/LocalLLaMA
原文日期2026-07
采集2026-08-18

待验证:本次未能重新核实原文。

模型/版本
模型为 GLM-5.2;来源标题:r/LocalLLaMA 实测:Colibri 引擎无 GPU 本地运行 GLM 5.2(744B MoE)。精确快照按原始来源。
任务/harness
LocalLLaMA 记录 colibrì 在 132GB RAM、Ubuntu 22.04、约 370GB int4 权重的无 GPU GLM-5.2 744B 运行,速度从冷启动约 0.03 tok/s 预热到约 0.22 tok/s。 完整任务集、provider、参数和评审流程未完全公开。
样本/日期
来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
推理能力
社区个人体验

r/PoeAI 讨论:GLM-5.2 突然"变笨"?——平台托管质量差异的社区证据

u/Friendly-Play-1953 在 r/PoeAI 发帖:自己用 Poe 上的 GLM-5.2 做创意写作一直效果很好,但最近两三天"像一夜之间丢了一半 IQ"——连基本细节都会跨帖遗忘(同一角色上一帖金发、下一帖变成棕发),"像 18 个月前的模型"。提示词与角色卡完全没变。

来源Reddit r/PoeAI
原文日期2026-08-16
采集2026-08-18

待验证:本次未能重新核实原文。

模型/版本
模型为 GLM-5.2;来源标题:r/PoeAI 讨论:GLM-5.2 突然"变笨"?——平台托管质量差异的社区证据。精确快照按原始来源。
任务/harness
Poe 用户报告 GLM-5.2 创意写作中角色细节在数天内跨帖遗忘,评论将差异归因于 provider 托管变化。 完整任务集、provider、参数和评审流程未完全公开。
样本/日期
来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
推理能力
媒体 / 基准方编辑分析

Evening-Truth 对 Z.AI Coding Plan 响应质量的投诉与量化疑云

Evening-Truth 在提示词库中单独开了一页投诉 Z.AI Coding Plan 的响应质量: 主张:订阅 z.ai coding plan 后,"经常甚至永久"看到响应质量大幅下降;作者用同一批测试调用对比 z.ai 与 OpenRouter,差异"大到无法忽视"。

来源rentry.org(作者个人提示词库的说明页)
原文日期2026-03-09
采集2026-08-18

待验证:本次未能重新核实原文。

模型/版本
模型为 GLM-5.2;来源标题:Evening-Truth 对 Z.AI Coding Plan 响应质量的投诉与量化疑云。精确快照按原始来源。
任务/harness
Evening-Truth 的记录对同一批测试调用比较 Z.AI Coding Plan 与 OpenRouter,并声称响应质量差异明显。 完整任务集、provider、参数和评审流程未完全公开。
样本/日期
来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
推理能力
社区个人体验

r/openrouter 讨论:GLM-5.2 免费端点(Decart 托管)的可用性与限制

u/FreeTruck7609 发现 OpenRouter 上出现 Decart 托管的 GLM 免费端点("大约一天前"上线),初期有可靠性问题,之后稳定在接近 100% 可用率。

来源Reddit r/openrouter
原文日期2026-08-18
采集2026-08-18

待验证:本次未能重新核实原文。

模型/版本
模型为 GLM-5.2;来源标题:r/openrouter 讨论:GLM-5.2 免费端点(Decart 托管)的可用性与限制。精确快照按原始来源。
任务/harness
OpenRouter 社区记录 Decart 托管的 GLM 免费端点初期不稳定,随后自述接近 100% 可用率。 完整任务集、provider、参数和评审流程未完全公开。
样本/日期
来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
推理能力
媒体 / 基准方编辑分析

Hugging Face 安全事件取证:GLM-5.2 被用于自托管攻击日志分析(真实项目报告)

Hugging Face 披露 2026 年 7 月遭到一次由自主 Agent 框架发起的入侵(对手以"agentic 攻击者"方式在大量短生命周期沙箱中执行数千次自动化动作、自迁移 C2),并在事件响应中实际使用了 GLM-5.2。

来源Hugging Face 官方博客(Security incident disclosure)
原文日期2026-07
采集2026-08-18

待验证:本次未能重新核实原文。

模型/版本
模型为 GLM-5.2;来源标题:Hugging Face 安全事件取证:GLM-5.2 被用于自托管攻击日志分析(真实项目报告)。精确快照按原始来源。
任务/harness
Hugging Face 的事件复盘称其在自主 Agent 入侵响应中实际使用 GLM-5.2,场景涉及大量短生命周期沙箱和自动化动作。 完整任务集、provider、参数和评审流程未完全公开。
样本/日期
来源笔记于 2026-09-20 复核;样本数和重复次数未公开处保持未知。
推理能力

GLM-5.2

在 Tabbit 中比较 GLM-5.2

客户端中的模型、功能和权限以当前账户为准。