爱范儿(APPSO)提前拿到 GLM-5.3 测试资格,用 3D 网页生成、网页应用开发、macOS 小工具开发等任务实测,并给出"同尺寸最强模型、编程开发者首选"的评价。
发布当周"神仙打架":Grok 4.6(Cursor 数据加持)、DeepSeek V4 Pro 正式版、Gemini Flash、GLM-5.3 密集发布。
官方口径:编程能力比肩 Fable 5 和 GPT-5.6 Sol;内测用户反馈体感优于 Kimi K3、DeepSeek V4-Pro-0813。
六个 benchmark 表现不赖,GDPVal(OpenAI 提出)拿下第一;AutomationBench、Agents' Last Exam 数一数二。
参数量与前代相当(约 7000 亿/743B 基模),与 Kimi K3(2.8T)、Qwen3.8-Max 的"万亿参数"路线不同——智谱官方:"我们在与 GLM-5.2 完全相同基座上高效推进强化学习,可能我们还远未开发出这个基座的智能上界。"
开源 Slime(史莱姆)后训练框架,覆盖发布级模型后训练完整工作流;从 GLM 4.5 起一直使用;支持 GLM、Qwen、DeepSeek 部分模型和 Llama 3。
人体血液循环 3D 交互仿真:交付较粗糙(火柴人、器官堆叠),但自定义丰富——视图图层、心率/血压等生理参数、可选失血性休克场景、可见血流方向;"能用在教学场景,但没那么好看"。
金字塔滑板游戏(DeepSeek Harness 测试,GLM-5.3 + Claude Code 最高推理深度):游戏体验好、场景渲染准确,"如果你不好好操作,可能真的会输";缺点是滑板残影太"亮眼"。
水母湖 3D 场景(数百万只写实水母在翡翠湖中飘动):"确实还挺漂亮的",渲染水母不像人体那样用简单圆圈;提示词相当长。
Claude Code 兼容问题:开启自动审批命令时常报错"auto mode cannot determine the safety of Bash right now"——第三方模型尚未适配 Claude Code 的自动模式机制;换用 ZCode 体验更好:能像 Codex 一样截图识屏、分析问题、持续优化,运行时间更长(行星撞地球模拟在 ZCode 中跑超过 1 小时仍在反复测试检查,最终效果震撼:地壳开裂、熔岩喷出、碎片形成行星环)。
网络安全任务表现与 Claude Mythos 5 持平。
ExploitGym(OpenAI 评估待发布模型时攻击 Hugging Face 所用的测试):898 道题、限时 6 小时完成 130 道。
公开网络安全披露账本(cvd.z.ai):模型找到的最古老漏洞可追溯约 40 年前。"40 年都没找到,GLM-5.3 一出手就找到了。"
已上线 Zcode(智谱官方 Agent 应用)与 AutoClaw(效率工具);对 GLM Coding Plan 用户全量开放并开放订阅(发布当天下午重置过一次)。
第三方平台 WorkBuddy、QwenWork、TraeWork 等开放抢先体验;API 预计下周二开放;完整权重两周内开源。
官网 API 价格仍为 GLM-5.2 版本,同尺寸估计 5.3 定价不会有太大变化。
"GLM-5.3 的意义……回到了原本属于它的位置,即同尺寸最强模型,编程开发者的首选。"
"K3 用了 2.8T,DeepSeek V4 用了 1.6T,而 GLM 5.2 用了不到一半的参数,就实现了同样程度的智能。"
宏观:GLM-5.3 与这一连串新模型把大模型"最强保质期"压得越来越短(GLM 用 20 天被 Kimi 超越,Kimi 20 天被 DeepSeek 超越……)。
GLM-5.3