GLM-5.3

GLM-5.3 · 测评与证据

GLM-5.3,哪些结论值得看?

按主题、来源身份和证据类型浏览公开测评。不同版本、档位和测试环境不直接并排比较。

这是第三方资料导航,不是 Tabbit 自测。动态指标以原始来源当前页面为准;未知值保持未知。

编辑结论

编辑结论

完整测评与相关内容

模型深度阅读

总览 · 简体中文

GLM-5.3 详解:相比 GLM-5.2 改变了什么

GLM-5.3 延续 GLM-5.2 基座,通过 post-training 强化长流程编程与智能体任务。本文比较变化、获取方式、成本和未知风险。

精选证据

官方厂商自报

GLM-5.3 官方技术博客:前沿编程与涌现的网络安全能力(Z.ai)

官方资料能支持发布口径与条件化基准记录,不支持扩展成全面第一。

来源Z.ai 官方博客(智谱国际)
原文日期2026-08-14
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
Z.ai 发布表;项目的 harness、预算、推理档位和任务集不一致。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程Agent能力
媒体 / 基准方编辑分析

GLM-5.3 发布测评:先进网络安全能力与编程提升(VentureBeat)

把发布日媒体报道中的网络安全、编码与迁移信息分开阅读,厂商跑分不等于独立复测。

来源VentureBeat(美国科技媒体)
原文日期2026-08-14
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
媒体报道含厂商发布信息与对照跑分;未公开统一复测 harness。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程Agent能力
媒体 / 基准方独立测量

GLM-5.3 独立基准测试:KingBench 3 得分 91.25%,登顶(MindStudio)

固定提示词集提供有条件的外部参照,但不能替代多次复测。

来源MindStudio(AI 开发平台官方博客)
原文日期2026-08-14
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
MindStudio 使用 80 分制、8 个任务和同一提示词集;逐次原始输出未公开。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程视觉生成能力
媒体 / 基准方平台遥测

GLM-5.3:BenchLM 源可核验基准账本与“不排名”结论

exact-source 行适合追溯厂商数字;没有独立复测就不应形成总排名。

来源BenchLM(第三方模型基准目录)
原文日期2026-08-17
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
2026-08-17 目录快照,17 条来源可见记录;原始行回指 Z.ai,未运行模型。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程Agent研究

全部来源

全部来源

22 / 22
官方厂商自报

GLM-5.3 官方技术博客:前沿编程与涌现的网络安全能力(Z.ai)

官方资料能支持发布口径与条件化基准记录,不支持扩展成全面第一。

来源Z.ai 官方博客(智谱国际)
原文日期2026-08-14
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
Z.ai 发布表;项目的 harness、预算、推理档位和任务集不一致。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程Agent能力
媒体 / 基准方编辑分析

GLM-5.3 发布测评:先进网络安全能力与编程提升(VentureBeat)

把发布日媒体报道中的网络安全、编码与迁移信息分开阅读,厂商跑分不等于独立复测。

来源VentureBeat(美国科技媒体)
原文日期2026-08-14
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
媒体报道含厂商发布信息与对照跑分;未公开统一复测 harness。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程Agent能力
媒体 / 基准方独立测量

GLM-5.3 独立基准测试:KingBench 3 得分 91.25%,登顶(MindStudio)

固定提示词集提供有条件的外部参照,但不能替代多次复测。

来源MindStudio(AI 开发平台官方博客)
原文日期2026-08-14
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
MindStudio 使用 80 分制、8 个任务和同一提示词集;逐次原始输出未公开。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程视觉生成能力
媒体 / 基准方平台遥测

GLM-5.3:BenchLM 源可核验基准账本与“不排名”结论

exact-source 行适合追溯厂商数字;没有独立复测就不应形成总排名。

来源BenchLM(第三方模型基准目录)
原文日期2026-08-17
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
2026-08-17 目录快照,17 条来源可见记录;原始行回指 Z.ai,未运行模型。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程Agent研究
媒体 / 基准方编辑分析

GLM-5.3 深度测评(2026年8月):最强的开源编程模型?(EggStriker.AI)

深度测评把后训练增益与延迟开放、敏感能力控制放在同一叙事中,需区分事实和评论。

来源EggStriker.AI Blog(中文 AI 资讯/测评站)
原文日期2026-08-15
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
发布周二次分析,混合官方数字、价格判断和媒体评论;没有统一独立样本。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程Agent稳定性
媒体 / 基准方个人体验

实测 GLM-5.3:神仙打架的一周杀回国模顶流(爱范儿/腾讯新闻)

媒体实测给出网页生成与长程工具循环的具体任务观察,不是基准排名。

来源腾讯新闻(转载自爱范儿官方账号)
原文日期2026-08-14
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
作者获得提前测试资格,任务和客户端由报道描述;无统一可复现对照。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程视觉生成Agent
媒体 / 基准方编辑分析

GLM 5.3 硬刚 Kimi K3:不换基座的极限压榨(腾讯云开发者社区)

同一文章的对比可定位任务差异,但不能把两套客户端条件合成总分。

来源腾讯云开发者社区(JeecgBoot AI 专题研究系列)
原文日期2026-08-14
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
专题实测/分析,GLM 与 Kimi 的工具、时间和版本条件需分别读取。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程Agent能力
社区个人体验

GLM 5.3 测评:前端王朝,逻辑拉跨(LINUX DO 社区实测)

社区样本提醒前端观感与后端逻辑可能分离,适合转成自己的验收清单。

来源LINUX DO(中文开发者社区论坛,开发调优版块)
原文日期2026-08-14
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
论坛作者自报任务与结果,提示词、版本、重复次数和评分器未统一。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程视觉生成稳定性
媒体 / 基准方编辑分析

GLM-5.3 没换基座,编程增益从哪来?后训练深度分析(The New Stack)

媒体分析解释后训练、环境和验证器叙事,但不构成第三方性能复核。

来源The New Stack(美国技术媒体)
原文日期2026-08-14
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
文章围绕官方技术材料展开,训练数据与任务细节并非全部公开。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程Agent研究
社区个人体验

Reddit r/LocalLLaMA:GLM 5.3 发布帖社区反应

发布帖评论展示早期期待与疑问,不能推导稳定偏好或能力排名。

来源Reddit r/LocalLLaMA(本地大模型社区)
原文日期2026-08-14
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
评论者客户端、提示词和模型路由不一致。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程Agent稳定性
社区个人体验

Reddit r/SillyTavernAI:GLM 5.3 社区共识(角色扮演/日常场景测试)

RP 反馈集中在预设、审查感和角色一致性,适用于配置实验,不适用于通用性能结论。

来源Reddit r/SillyTavernAI(角色扮演/对话前端社区)
原文日期2026-08-14
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
角色卡、采样参数、上下文和预设差异很大,没有盲测。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
角色扮演writing稳定性
社区个人体验

Reddit r/ZaiGLM:GLM 5.3 思维链(Thought Traces)观察——"太疯狂了"

社区对可见思维摘要的观察只能说明界面体验,不能把隐藏推理当作证据。

来源Reddit r/ZaiGLM(GLM 官方社区)
原文日期2026-08-14
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
需按原文核对客户端和返回字段;隐藏思考不作为用户证据。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
推理稳定性
社区个人体验

Reddit r/opencode:GLM 5.3 用量计费争议($60 vs $15?)

一条账户账单体验提醒计费口径可能与宣传数字不同,不能替代官方价格表。

来源Reddit r/opencode(开源编码 Agent 社区)
原文日期2026-08-16
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
单账户、单提供商、单窗口;积分、订阅与 API token 不可混算。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
成本Agent
社区个人体验

X(推特)@uzairakrum:GLM 5.3 早期评测——接近 GPT-5.6 Sol

早期体感可作为任务选择线索,但不提供可审计的胜负或成本结论。

来源X(Twitter)
原文日期2026-08-15
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
个人体验,模型版本、客户端与任务样本有限。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程能力
社区个人体验

X(推特)@Rafa_Schwinger:金属内核审查任务——GLM 5.3 xhigh 88/100 vs Grok 4.6 86/100

单项金属内核审查说明某个 xhigh 配置下的任务差异,不能扩展为总榜。

来源X(Twitter)
原文日期2026-08-15
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
单项 Fable 工具任务;GLM 的 xhigh、工具和评分条件需保留原文边界。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程推理能力
社区个人体验

X(推特)@Ubendev:GLM 5.3 发现 Claude 所写后端代码的 10 个严重 bug

“发现 10 个 bug”是单次工作流结果,支持交叉审查作为流程,不支持普遍发现率。

来源X(Twitter)
原文日期2026-08-16
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
一个 landing-page 后端由 Claude 生成后再经 GLM 复查;无独立审计报告。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程Agent能力
社区个人体验

X(推特)@LufzzLiz:GLM 5.3 测完——国产模型里排第三,速度较快

速度与主观排名只代表作者当时的任务体验,不能替代同条件测试。

来源X(Twitter)
原文日期2026-08-14
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
作者自报测试;参数量、速度和排名依据没有完整公开。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程速度与延迟能力
社区编辑分析

X(推特)@dongwukeji:GLM-5.3 CyberGym 84.5% 与"知道哪些漏洞真正重要"

这是一条对官方 CyberGym 说法的转发与行业判断,不是独立安全测试。

来源X(Twitter)
原文日期2026-08-16
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
引用官方 84.5% 与漏洞账本;没有独立输入、工具链或复现日志。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
研究能力
社区个人体验

X(推特)@MichaelGannotti:GLM-5.3 一次生成整个网站(one-shot)

一句“one shot”口碑提醒网页生成要先验收,不足以证明复杂项目一次交付。

来源X(Twitter)
原文日期2026-08-16
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
只有一句体验描述,没有仓库、提示词、迭代次数或可复现实物。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
视觉生成编程
社区编辑分析

X(推特)@ollobrains:基准分数之外的真相——最好的模型往往不是跑分最高的

这条未完整的观点强调模型选择应回到真实代码库,但不是 GLM-5.3 的定量证据。

来源X(Twitter)
原文日期2026-08-16
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
上下文不完整,提到 Sol xhigh 与长期体验但没有完整任务记录。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程研究
社区个人体验

X(推特)@Sal7one:长时间 Agent 运行 + 让 GLM 5.3 每小时审查代码

“每隔几小时审查”是可复用流程想法,个人长程体验不是受控稳定性测试。

来源X(Twitter)
原文日期2026-08-16
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
个人多模型工作流,任务、工具、配额和失败率未结构化公开。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
Agent编程稳定性
社区编辑分析

Reddit AIToolsPerformance:GLM-5.3 发布表拆解与本地自测清单

社区作者把厂商表拆成优势、短板和复测项目,适合规划验证而非直接下结论。

来源Reddit r/AIToolsPerformance
原文日期2026-08-15
采集2026-08-18

待验证:本次未能重新核实原文。

测试与来源边界
发布日社区分析未运行模型;数字来自 Z.ai,复测建议尚无输出。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified
编程Agent研究

GLM-5.3

在 Tabbit 中比较 GLM-5.3

客户端中的模型、功能和权限以当前账户为准。