GLM-5.3

GLM-5.3 模型测评导航

汇总 GLM-5.3 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。

22 条已核对来源的资料官方 · 媒体 · 社区

官方

1 条已核对来源的资料

媒体

7 条已核对来源的资料
媒体VentureBeat(美国科技媒体)

GLM-5.3 发布测评:先进网络安全能力与编程提升(VentureBeat)

中国 AI 初创公司 Z.ai(智谱国际名)于 2026 年 8 月 14 日发布 GLM-5.3,主打长程编程(long-horizon coding)能力大幅提升,以及更具争议性的网络安全能力跃升。据报道,GLM-5.3 的网络安全能力已经发现 Cursor(被 SpaceX 收购的 AI 编程公司)的一个"潜在严重漏洞"。

媒体MindStudio(AI 开发平台官方博客)

GLM-5.3 独立基准测试:KingBench 3 得分 91.25%,登顶(MindStudio)

MindStudio 使用固定、可复现的第三方基准 KingBench 3(80 分制、每任务 10 分),在同一提示词集下对比 GLM-5.3 与 Fable 5、Opus 4.8、Opus 5、Kimi K3、Qwen3.8 Max。

媒体EggStriker.AI Blog(中文 AI 资讯/测评站)

GLM-5.3 深度测评(2026年8月):最强的开源编程模型?(EggStriker.AI)

年 8 月 14 日智谱(Z.ai,港股 02513)发布 GLM-5.3。它没有换架构、没有堆参数(743B,与 GLM-5.2 同一基座),几乎全部能力提升来自后训练缩放——用更长程的任务环境、更丰富的环境类型、更长的强化学习时间来"榨"出上限。发布时点智谱 ARR 已达 10 亿美元(国内第一家迈过该里程碑的大模型厂商)。

媒体腾讯新闻(转载自爱范儿官方账号)

实测 GLM-5.3:神仙打架的一周杀回国模顶流(爱范儿/腾讯新闻)

爱范儿(APPSO)提前拿到 GLM-5.3 测试资格,用 3D 网页生成、网页应用开发、macOS 小工具开发等任务实测,并给出"同尺寸最强模型、编程开发者首选"的评价。

媒体腾讯云开发者社区(JeecgBoot AI 专题研究系列)

GLM 5.3 硬刚 Kimi K3:不换基座的极限压榨(腾讯云开发者社区)

国产开源大模型双雄对决深度解析:GLM 5.3 后训练 Scaling 路线 vs Kimi K3 超大新基座路线。两条路线撞在一起,构成国产大模型竞赛最耐人寻味的切面。

媒体The New Stack(美国技术媒体)

GLM-5.3 没换基座,编程增益从哪来?后训练深度分析(The New Stack)

Z.ai 于 8 月 14 日发布 GLM-5.3,与 GLM-5.2 共用同一基座,全部增益来自后训练。开发者已可通过 GLM Coding Plan 在 Claude Code、Cline、OpenCode 与 Codex 中使用 GLM-5.3;直接 API 访问标注为"即将推出",权重将在两周加固与安全测试后发布。

媒体BenchLM(第三方模型基准目录)

GLM-5.3:BenchLM 源可核验基准账本与“不排名”结论

BenchLM 收录了 GLM-5.3 的 17 条“原始来源可显示”跑分,但因缺少独立复测而不给综合分或排名,当前更适合把它当作可追溯的厂商数据账本,而不是独立排行榜。

社区

14 条已核对来源的资料
社区LINUX DO(中文开发者社区论坛,开发调优版块)

GLM 5.3 测评:前端王朝,逻辑拉跨(LINUX DO 社区实测)

社区用户的实战评测帖,观点鲜明:GLM 5.3 前端与动效"王朝",但代码质量与逻辑短板明显。

社区Reddit r/LocalLLaMA(本地大模型社区)

Reddit r/LocalLLaMA:GLM 5.3 发布帖社区反应

LocalLLaMA 的官方发布帖(内容为官方公告链接),评论区热度集中在"纯后训练"路线与社区情绪。

社区Reddit r/SillyTavernAI(角色扮演/对话前端社区)

Reddit r/SillyTavernAI:GLM 5.3 社区共识(角色扮演/日常场景测试)

SillyTavern(角色扮演前端)用户对 GLM 5.3 的共识征集帖:相比 5.2,5.3 在角色一致性、指令跟随、回声问题(echoing)上有明显改善,但体验因预设(preset)而异。

社区Reddit r/ZaiGLM(GLM 官方社区)

Reddit r/ZaiGLM:GLM 5.3 思维链(Thought Traces)观察——"太疯狂了"

用户在 Pi 前端阅读 GLM 5.3 的思维链(thinking traces)后分享:与 5.2 的"说话方式"截然不同——全大写、emoji、脏话,情绪化到像打了鸡血。

社区Reddit r/opencode(开源编码 Agent 社区)

Reddit r/opencode:GLM 5.3 用量计费争议($60 vs $15?)

用户在 OpenCode 平台使用 GLM 5.3 时发现用量计费与标价不符的争议帖——涉及 GLM 5.3 的配额计量、token 效率与平台计费透明度。

社区X(Twitter)

X(推特)@uzairakrum:GLM 5.3 早期评测——接近 GPT-5.6 Sol

作者发布 GLM 5.3 的"非常早期的评测",给出正面评价,并把 GLM 5.3 定位在接近 GPT-5.6 Sol 的档位。

社区X(Twitter)

X(推特)@Rafa_Schwinger:金属内核审查任务——GLM 5.3 xhigh 88/100 vs Grok 4.6 86/100

作者用 Fable(某个代码审查/评测工具)在金属内核(metal kernel)审查任务上对 GLM 5.3 与 Grok 4.6 做了对比打分。

社区X(Twitter)

X(推特)@Ubendev:GLM 5.3 发现 Claude 所写后端代码的 10 个严重 bug

作者分享真实工作流中的交叉验证经验:让 Claude 写 landing page 后端,再用 GLM 5.3 做代码审查,结果 GLM 5.3 发现 10 个严重 bug。

社区X(Twitter)

X(推特)@LufzzLiz:GLM 5.3 测完——国产模型里排第三,速度较快

作者完成 GLM 5.3 的测试(该帖被 Google 中文搜索"GLM-5.3 测评"收录为高权重结果之一),给出速度与体感评价。

社区X(Twitter)

X(推特)@dongwukeji:GLM-5.3 CyberGym 84.5% 与"知道哪些漏洞真正重要"

作者转发 Z.ai 官方信息,强调 GLM-5.3 在软件漏洞发现上的突破,并提出一个关键观点:当 AI 找漏洞变得极其出色时,"知道哪些漏洞真正重要"成为更宝贵的能力。

社区X(Twitter)

X(推特)@MichaelGannotti:GLM-5.3 一次生成整个网站(one-shot)

作者用一句评价分享 GLM-5.3 的前端/全栈生成能力。

社区X(Twitter)

X(推特)@ollobrains:基准分数之外的真相——最好的模型往往不是跑分最高的

作者针对某次(GLM-5.3 相关)"震惊"的对比结果发表观点,讨论编码 AI 领域"跑分 vs 实际表现"的关系。

社区X(Twitter)

X(推特)@Sal7one:长时间 Agent 运行 + 让 GLM 5.3 每小时审查代码

作者分享使用国产模型(含 GLM 5.3)跑长时间 Agent 任务的实际体验,并介绍了一个实用工作流:让 GLM 5.3 每隔几小时做一次代码审查。

社区Reddit r/AIToolsPerformance

Reddit AIToolsPerformance:GLM-5.3 发布表拆解与本地自测清单

这篇社区分析把 GLM-5.3 的发布表拆成“编码/Agent 真实优势、闭源前沿仍领先、所有数字暂属厂商报告”三层,并给出可在权重或 API 开放后复现的自测项目。

GLM-5.3

在 Tabbit 中使用并对比模型

汇总 GLM-5.3 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。