MindStudio 使用固定、可复现的第三方基准 KingBench 3(80 分制、每任务 10 分),在同一提示词集下对比 GLM-5.3 与 Fable 5、Opus 4.8、Opus 5、Kimi K3、Qwen3.8 Max。
| 模型 | KingBench 3 得分 |
|---|---|
| GLM-5.3 | 73/80(91.25%)— 该基准历史最高 |
| Fable 5 | 82.5% |
| Qwen3.8 Max | 81.25% |
| Opus 4.8 | 80% |
| Opus 5 | 77.5% |
| Kimi K3 | 77.5% |
| GLM-5.2(约两个月前) | 75% |
关键观察:约两个月内、参数与架构不变的情况下,GLM-5.2 → 5.3 从 75% 跳到 91.25%,完全归因于后训练,提升幅度异常大。
电梯模拟(多人群、随机楼层、三电梯排队调度):8 分(Fable 5 为 9)。
隐形眼镜盒 Three.js 3D 模型(可点击 L/R 盖):3 → 8 分(5.2 同题仅 3 分)。
折叠桌 Three.js(滑块控制 3D 折叠动画):满分 10(Fable 5 为 9)。
熊猫吃汉堡 SVG:满分 10(细节:腮红、竹子背景、汉堡屑)。
弓箭游戏(移动靶 + 排行榜):满分 10,模型甚至先自我验证游戏逻辑(Fable 5 为 8)。
排列计数数学题(正确答案 2460):满分 10。
端到端本地流水线(生成数据集 → 微调 Gemma 2B → 网页 UI 服务):满分 10,全程无需人工干预。
最难任务——双时区 3D 腕表:7 分(其他模型大多 0–3 分,Fable 5 为 4、Opus 5 为 3),与该项历史最佳持平;成品含 GMT 式表盘、扫秒针、日期/星期窗口与表圈第二时区。
在该基准上 GLM-5.3 以微弱优势胜过 Fable 5、明显胜过 Opus 5 与 Kimi K3。
更值得注意的是 5.2 → 5.3 的后训练跃升:"That kind of gain from post-training alone suggests there's still more [headroom]"——纯后训练仍有大量空间。
ZAI 将 GLM-5.3 定位为安全分析专用(代码审计、漏洞发现),并配套"开源盾牌倡议"(open source shield initiative):防守性安全能力保持开源,高风险滥用能力走受限访问。
该测试印证 GLM-5.3 补齐了开源模型"后端逻辑 vs 前端打磨"的短板——同一任务里既能产出干净 UI 又能写对仿真逻辑。
"GLM-5.3 scored 91.25%, the highest result recorded on that test, ahead of Opus 5, Kimi K3, and Qwen3.8 Max, and roughly… 以上为必要节选,完整内容请查看原文。
"The score matters because it comes from a fixed, repeatable set of coding and simulation challenges run against every m… 以上为必要节选,完整内容请查看原文。
GLM-5.3