Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.3 · 媒体来源 · 个人体验

实测 GLM-5.3:神仙打架的一周杀回国模顶流(爱范儿/腾讯新闻)

媒体实测给出网页生成与长程工具循环的具体任务观察,不是基准排名。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源个人体验编辑日期 2026-09-20

测试条件速查

测试与来源边界
作者获得提前测试资格,任务和客户端由报道描述;无统一可复现对照。
模型与版本
GLM-5.3;不与 GLM-5.2、其他模型、不同推理档位或不同 harness 直接合并
采集日期
2026-08-18;本轮未重新打开原始网页,动态事实保持 unverified

关键数据与适用场景

核心内容摘要

爱范儿(APPSO)提前拿到 GLM-5.3 测试资格,用 3D 网页生成、网页应用开发、macOS 小工具开发等任务实测,并给出"同尺寸最强模型、编程开发者首选"的评价。

背景

  • 发布当周"神仙打架":Grok 4.6(Cursor 数据加持)、DeepSeek V4 Pro 正式版、Gemini Flash、GLM-5.3 密集发布。

  • 官方口径:编程能力比肩 Fable 5 和 GPT-5.6 Sol;内测用户反馈体感优于 Kimi K3、DeepSeek V4-Pro-0813。

  • 六个 benchmark 表现不赖,GDPVal(OpenAI 提出)拿下第一;AutomationBench、Agents' Last Exam 数一数二。

  • 参数量与前代相当(约 7000 亿/743B 基模),与 Kimi K3(2.8T)、Qwen3.8-Max 的"万亿参数"路线不同——智谱官方:"我们在与 GLM-5.2 完全相同基座上高效推进强化学习,可能我们还远未开发出这个基座的智能上界。"

  • 开源 Slime(史莱姆)后训练框架,覆盖发布级模型后训练完整工作流;从 GLM 4.5 起一直使用;支持 GLM、Qwen、DeepSeek 部分模型和 Llama 3。

实测任务表现

  • 人体血液循环 3D 交互仿真:交付较粗糙(火柴人、器官堆叠),但自定义丰富——视图图层、心率/血压等生理参数、可选失血性休克场景、可见血流方向;"能用在教学场景,但没那么好看"。

  • 金字塔滑板游戏(DeepSeek Harness 测试,GLM-5.3 + Claude Code 最高推理深度):游戏体验好、场景渲染准确,"如果你不好好操作,可能真的会输";缺点是滑板残影太"亮眼"。

  • 水母湖 3D 场景(数百万只写实水母在翡翠湖中飘动):"确实还挺漂亮的",渲染水母不像人体那样用简单圆圈;提示词相当长。

  • Claude Code 兼容问题:开启自动审批命令时常报错"auto mode cannot determine the safety of Bash right now"——第三方模型尚未适配 Claude Code 的自动模式机制;换用 ZCode 体验更好:能像 Codex 一样截图识屏、分析问题、持续优化,运行时间更长(行星撞地球模拟在 ZCode 中跑超过 1 小时仍在反复测试检查,最终效果震撼:地壳开裂、熔岩喷出、碎片形成行星环)。

网络安全能力

  • 网络安全任务表现与 Claude Mythos 5 持平。

  • ExploitGym(OpenAI 评估待发布模型时攻击 Hugging Face 所用的测试):898 道题、限时 6 小时完成 130 道。

  • 公开网络安全披露账本(cvd.z.ai):模型找到的最古老漏洞可追溯约 40 年前。"40 年都没找到,GLM-5.3 一出手就找到了。"

获取与定价

  • 已上线 Zcode(智谱官方 Agent 应用)与 AutoClaw(效率工具);对 GLM Coding Plan 用户全量开放并开放订阅(发布当天下午重置过一次)。

  • 第三方平台 WorkBuddy、QwenWork、TraeWork 等开放抢先体验;API 预计下周二开放;完整权重两周内开源。

  • 官网 API 价格仍为 GLM-5.2 版本,同尺寸估计 5.3 定价不会有太大变化。

评价

  • "GLM-5.3 的意义……回到了原本属于它的位置,即同尺寸最强模型,编程开发者的首选。"

  • "K3 用了 2.8T,DeepSeek V4 用了 1.6T,而 GLM 5.2 用了不到一半的参数,就实现了同样程度的智能。"

  • 宏观:GLM-5.3 与这一连串新模型把大模型"最强保质期"压得越来越短(GLM 用 20 天被 Kimi 超越,Kimi 20 天被 DeepSeek 超越……)。

能支持的判断

  • 媒体实测给出网页生成与长程工具循环的具体任务观察,不是基准排名。(仅支持上述条件下的来源观察)。

不能支持的判断

  • 不支持把提前体验的单次任务观察外推成可复现的模型排名。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

腾讯新闻(转载自爱范儿官方账号) · 爱范儿 · 原文发布日期 2026-08-14 · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.3

在 Tabbit 中比较 GLM-5.3

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GLM-5.3 详解:相比 GLM-5.2 改变了什么

GLM-5.3 延续 GLM-5.2 基座,通过 post-training 强化长流程编程与智能体任务。本文比较变化、获取方式、成本和未知风险。

相关评测

GLM-5.3 发布测评:先进网络安全能力与编程提升(VentureBeat)把发布日媒体报道中的网络安全、编码与迁移信息分开阅读,厂商跑分不等于独立复测。GLM-5.3 独立基准测试:KingBench 3 得分 91.25%,登顶(MindStudio)固定提示词集提供有条件的外部参照,但不能替代多次复测。GLM-5.3:BenchLM 源可核验基准账本与“不排名”结论exact-source 行适合追溯厂商数字;没有独立复测就不应形成总排名。GLM-5.3 官方技术博客:前沿编程与涌现的网络安全能力(Z.ai)官方资料能支持发布口径与条件化基准记录,不支持扩展成全面第一。固定 Hermes Agent 做同提示词对比复用同一视觉任务与固定 Agent 框架记录多模型输出,并把框架影响与模型影响分开。用分阶段上下文完成编码任务把项目上下文、目标、约束和验收标准写成可分阶段执行的编码任务。在 ZCode 里先计划再编辑在 ZCode 中先检查项目、批准计划,再以小任务验证 GLM-5.3 的编辑与测试流程。区分 API、基准与权重状态按发布日材料区分 API、Coding Plan、基准口径与权重状态,避免把开源承诺写成当日可下载。