GLM-5.3 · 社区来源 · 个人体验
单项金属内核审查说明某个 xhigh 配置下的任务差异,不能扩展为总榜。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
作者用 Fable(某个代码审查/评测工具)在金属内核(metal kernel)审查任务上对 GLM 5.3 与 Grok 4.6 做了对比打分。
"Fable 刚刚在金属内核审查任务中将 glm 5.3 xhigh 评为 88/100,将 grok 4.6 评为 86/100。 GLM 在发现方面略微领先,而 grok 在准确性和一致性方面领先(当然还有速度)。Glm 5.3 max… 以上为必要节选,完整内容请查看原文。
代码/安全审查场景:GLM 5.3(xhigh 档)88 分 vs Grok 4.6 86 分——整体略胜。
维度差异:GLM 在"发现"(discovery,找到问题/漏洞)上略微领先;Grok 在"准确性与一致性"以及速度上领先。
档位说明:作者用的是 xhigh(更高档推理),并预期 max 档更好——呼应官方"max 适合最难任务"的建议。
该评测属于第三方工具对比(非官方基准),样本单一,但提供了一个"GLM-5.3 在真实审查任务中 vs Grok 4.6"的横切面,与 Z.ai 官方"漏洞发现能力 SOTA、利用链越深差距越大"的口径方向一致。
平台:X(推特)
时间:2026-08-15
类型:第三方工具(Fable)单任务审查对比
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
X(Twitter) · Rafa Schwinger(@RafaSchwinger) · 原文发布日期 2026-08-15 · 本站编辑日期 2026-09-20
打开原始来源GLM-5.3
下载 Tabbit 客户端后检查模型可用性