GLM-5.2 · 社区来源 · 个人体验
Arena.ai 在 2026 年 6 月对 GLM-5.2 (Max) 做了三类平台内评测,结论如下。
待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。
Arena.ai 在 2026 年 6 月对 GLM-5.2 (Max) 做了三类平台内评测,结论如下:
GLM-5.2 (Max) 整体排名第 2,比 Claude Opus 4.7 (Thinking) 高 +29 分,仅落后 Claude Fable 5;是排名最高的开源模型。
子榜:React 第 2、HTML 第 4;是相对 Kimi-K2.6、MiniMax-M3 领先优势最大的开源模型。
轨迹:GLM 系列在 Code Arena: Frontend 从 GLM-4.6 的 1408 分升至 GLM-5.2 (Max) 的 1595 分——超过 Claude Opus 4.8,逼近 Claude Fable 5(1665 分)。
8 月 4 日更新帖:GLM-5.2 (Max) 在 Frontend Code Arena 整体仍列第 2(开放组第 1)。
6 月 18 日:GLM-5.2 (Max) 进入前 10,是当时测到的最强开源权重结果:确认任务成功率(confirmed task success)+9.4%、赞扬-抱怨比(praise-complaint ratio)+14.9%(相对基线)。
6 月 26 日发布 Agent Arena 令牌效率分析帖(模型可调用搜索、文件系统、终端完成写代码、做幻灯片、研究、建应用、分析文档等复杂工作流)。
GLM-5.2 (Max) 整体排名 #25,与 GLM-5.1 相近;细分上最大进步在 Expert Arena、Multi-Turn,以及 Life、Physical & Social Science、Creative Writing、Medicine 等职业类别。
8 月 15 日:GLM-5.3 即将上线 Arena;官方预告将对比 GLM-5.1 / 5.2(GLM 上一轮更新在 Agent Arena 带来显著进步)。
证据等级:Arena 是社区驱动评测(真实用户投票/真实任务),非封闭实验室基准;样本与投票分布随时间变化,分数为相对量级参考。
结论指向:GLM-5.2 (Max) 的最强场景是前端编码(HTML/React 单文件生成)与 Agent 类真实任务;文本综合能力与 5.1 相当(不是文本全面升级)。
配置口径:评测使用 Max 档;不适用于 low/high 档位结论。
时间点:2026-06 排名;8 月 4 日 Frontend 排名仍成立(在 GLM-5.3 上线前)。
复现方式:同题单次对比示例见提示词目录《04-X-Arena-前端编码同题对比示例》。
"GLM-5.2 (Max) 在 Code Arena: Frontend 中排名第 2,比 Claude Opus 4.7 (Thinking) 高出 +29 分,仅落后于 Fable 5!"
"Agent Arena ... 我们测得的最强开源权重结果,确认成功率 +9.4%,相对于基准的赞扬-抱怨比率 +14.9%。"
"GLM-5.2 (Max) 是实验室迄今最强的编码模型"
本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。
需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。
X.com(Twitter),@arena(Arena.ai 官方账号) · Arena.ai(社区驱动的真实任务评测平台) · 原文发布日期 2026-06-17 · 本站编辑日期 2026-09-20
打开原始来源GLM-5.2
下载 Tabbit 客户端后检查模型可用性