社区用户的实战评测帖,观点鲜明:GLM 5.3 前端与动效"王朝",但代码质量与逻辑短板明显。
前端惊艳:一上手就被前端效果惊艳到,"似乎觉醒了什么黑金配色八股",单论前端和动效真的很王朝(附多张页面截图)。
代码质量差:"这个模型的代码质量很差,像是学会了 opus 4.7 4.8 的错字"——绝大多数 case 需要返工额外修改,造成很大一部分扣分项。
逻辑拉跨:部分案例"前端样式看似写的很好,实际代码逻辑拉了大坨",出现极低分。
用户判断:"感觉在 k3 竞技场烂炒后智谱走了弯路,这个模型纯前端和动效无敌,没背过的逻辑就差很多了。感觉也有小模型后训练到头的因素,还是早日 scaling 吧。"
与官方跑分(DeepSWE、Terminal-Bench 大幅提升)形成对照:官方数据聚焦"编程 Agent / 终端任务",而该帖反映纯前端生成是强项、未见过/未背过的复杂逻辑仍是短板——与 X 上 @imhaoyi(前端效果最佳)、@ivanainai(GLM 把 3 个细节都做对)等前端好评一致,但与"逻辑拉跨"的观感互补。
说明:该帖为个人体感评测(非标准基准),样本与任务有限,仅供参考。
"这模型一上手前端就惊艳到我了……单论前端和动效真的很王朝。"
"这个模型的代码质量很差,像是学会了 opus 4.7 4.8 的错字。绝大多数 case 都需要返工额外修改,造成了很大一部分扣分项。"
"这个模型纯前端和动效无敌,没背过的逻辑就差很多了。"
GLM-5.3