Arena.ai 在 2026 年 6 月对 GLM-5.2 (Max) 做了三类平台内评测,结论如下:
GLM-5.2 (Max) 整体排名第 2,比 Claude Opus 4.7 (Thinking) 高 +29 分,仅落后 Claude Fable 5;是排名最高的开源模型。
子榜:React 第 2、HTML 第 4;是相对 Kimi-K2.6、MiniMax-M3 领先优势最大的开源模型。
轨迹:GLM 系列在 Code Arena: Frontend 从 GLM-4.6 的 1408 分升至 GLM-5.2 (Max) 的 1595 分——超过 Claude Opus 4.8,逼近 Claude Fable 5(1665 分)。
8 月 4 日更新帖:GLM-5.2 (Max) 在 Frontend Code Arena 整体仍列第 2(开放组第 1)。
6 月 18 日:GLM-5.2 (Max) 进入前 10,是当时测到的最强开源权重结果:确认任务成功率(confirmed task success)+9.4%、赞扬-抱怨比(praise-complaint ratio)+14.9%(相对基线)。
6 月 26 日发布 Agent Arena 令牌效率分析帖(模型可调用搜索、文件系统、终端完成写代码、做幻灯片、研究、建应用、分析文档等复杂工作流)。
GLM-5.2 (Max) 整体排名 #25,与 GLM-5.1 相近;细分上最大进步在 Expert Arena、Multi-Turn,以及 Life、Physical & Social Science、Creative Writing、Medicine 等职业类别。
8 月 15 日:GLM-5.3 即将上线 Arena;官方预告将对比 GLM-5.1 / 5.2(GLM 上一轮更新在 Agent Arena 带来显著进步)。
证据等级:Arena 是社区驱动评测(真实用户投票/真实任务),非封闭实验室基准;样本与投票分布随时间变化,分数为相对量级参考。
结论指向:GLM-5.2 (Max) 的最强场景是前端编码(HTML/React 单文件生成)与 Agent 类真实任务;文本综合能力与 5.1 相当(不是文本全面升级)。
配置口径:评测使用 Max 档;不适用于 low/high 档位结论。
时间点:2026-06 排名;8 月 4 日 Frontend 排名仍成立(在 GLM-5.3 上线前)。
复现方式:同题单次对比示例见提示词目录《04-X-Arena-前端编码同题对比示例》。
"GLM-5.2 (Max) 在 Code Arena: Frontend 中排名第 2,比 Claude Opus 4.7 (Thinking) 高出 +29 分,仅落后于 Fable 5!"
"Agent Arena ... 我们测得的最强开源权重结果,确认成功率 +9.4%,相对于基准的赞扬-抱怨比率 +14.9%。"
"GLM-5.2 (Max) 是实验室迄今最强的编码模型"
GLM-5.2