Tabbit部落格

GLM-5.3 詳解:相較 GLM-5.2 改變了什麼

GLM-5.3 延續 GLM-5.2 基座,以 post-training 強化長流程程式設計與代理任務。本文比較變化、取得方式、成本與未知風險。

本文目錄
  1. 先看結論
  2. GLM-5.3 規格與可用性
  3. 相較 GLM-5.2 改變了什麼
  4. 現在如何取得
  5. API
  6. Coding Plan 與 ZCode
  7. 本地權重
  8. Tabbit
  9. 仍然未知的風險
  10. 社群訊號:與官方聲明分開
  11. 選擇前自檢
  12. 來源
  13. 下一步

GLM-5.3 是以 GLM-5.2 為基座、針對長流程程式設計與代理循環強化的文字推理模型。若工作包含程式碼儲存庫、工具呼叫或安全分析,它值得測試;但不是每個 5.2 工作流的無條件替代品。GLM-5.3 模型頁 (简体中文)提供資源入口,本文只說明發布變化、取得邊界與風險。

最影響決策的數字是官方同一張表中的 Terminal-Bench 3.0:GLM-5.3 為 28.3,GLM-5.2 為 4.6。這是基準的大幅變化,但不是個人成功率;測試工具、提示詞、測試集與輸出預算都會影響結果。把它視為值得做任務試點的理由,不要當作所有儲存庫都會提升的證明。

先看結論

  • 需要長流程程式設計、工具使用或可調推理力度的 API 模型時,先將 GLM-5.3 放入試點。

  • 若客戶端依賴關閉思考、穩定預算或已知授權,保留 GLM-5.2 作為對照。

  • API、Coding Plan、本地權重與 Tabbit 是四個不同的取得問題,不能混寫。

  • 目前最強證據是 Z.ai 自己的基準;獨立重現與你的 Tabbit 帳號可用性仍最不確定。

GLM-5.3 規格與可用性

問題2026-09-20 核驗結果邊界
模型形態文字輸入/輸出;1M 上下文;最多 128K 輸出服務商或客戶端可能另有限制
推理始終開啟;lowhighmax;文件預設 max舊的關閉思考請求不能直接假定有效
API 價格輸入 $1.40/M、快取輸入 $0.26/M、輸出 $4.40/M美元快照,價格會變動
Coding Plan目前套餐都列出 GLM-5.3;按 credits 與非尖峰規則計量額度、舊套餐與並發取決於帳號
本地選項Hugging Face 公開 zai-org/GLM-5.3 與部署說明目前標示 glm-5.3 授權,需讀完整條款
Tabbit國際版公開頁面列出 GLM 5.3本次沒有驗證登入選擇器或版本發布

依據包括 GLM-5.3 文件目前定價DevPack 計畫Hugging Face 模型卡片。規格不等於權益;模型提示詞 (简体中文)評測評論 (简体中文)回答不同問題。

相較 GLM-5.2 改變了什麼

Z.ai 表示 GLM-5.3 使用相同 GLM-5.2 基座,主要增益來自更強的 post-training。發布重點是複雜程式設計、長流程執行、終端環境和網路安全推理,不是已文件化的新架構。

維度GLM-5.2GLM-5.3實際影響
訓練路線GLM-5.2 基座相同基座加 post-training先預期行為改變,不要假定 API 完全相容
Terminal-Bench 3.04.628.3分別測試長循環、工具復原與儲存庫狀態
DeepSWE v1.146.266.9值得試點代理程式設計,不保證你的技術棧同幅提升
CyberGym77.284.5安全能力增強,也提高雙用途風險
思考控制5.2 文件支援多模式強制開啟;low/high/max,預設 max重新預算延遲與 token,複查關閉思考呼叫
遷移舊模型 ID 與參數新模型 ID,加 reasoning_effort 與工具串流變化切生產前做回歸測試

官方遷移指南建議檢查延遲、隨機性、參數完整性、串流輸出與工具呼叫。post-training 可能改善代理循環,這是由官方描述到機制影響的推論,不等於私有程式碼也會同幅提升。大上下文的取捨可參考 GPT-5.6 Sol 1M 說明

這個版本變化的實際意義是:5.3 更適合放進需要持續讀取狀態、呼叫工具、處理失敗再繼續的任務,而不是只看一次問答的漂亮答案。始終開啟思考會改變請求結構、等待時間與輸出預算;同一提示在不同客戶端可能有不同截斷、快取或工具串流行為。遷移時固定提示、工具 schema、溫度與停止條件,先比較十個代表任務,再決定是否擴大流量。

安全基準也要單獨解釋。較高的 CyberGym、ExploitBench 或 ExploitGym 數字表示模型能做更多安全推理,但不代表輸出經過生產安全審查,更不代表可以測試第三方目標。防禦性程式碼審查應使用脫敏儲存庫、唯讀工具和人工批准的補丁;真實漏洞驗證則先確認授權與回滾路徑。

現在如何取得

API

Z.ai 文件列出 OpenAI Chat Completions、Responses 與 Anthropic 相容端點。模型名設為 glm-5.3,保持思考開啟,並明確選擇 reasoning_effort。價格快照是輸入 $1.40/M、快取輸入 $0.26/M、輸出 $4.40/M;遷移前確認 endpoint、帳單、地區與速率限制。先在隔離環境記錄快取命中、輸出長度和工具重試,不要用單次短請求估算生產成本。

Coding Plan 與 ZCode

DevPack 頁面把 GLM-5.3 列在 Lite、Pro、Max 套餐,以 credits 而非單純請求數計量,並記錄非尖峰折扣。ZCode 的目前文件說明 GLM-5.3 可用於代理開發環境與工作流。這是 Z.ai 產品權益,不代表第三方客戶端有相同額度。舊套餐、尖峰時段與並發可能不同,購買前應在自己的帳戶頁重新核對。

API 價格與 Coding Plan 額度不能直接互換。API 適合把輸入、快取、輸出和工具呼叫寫進自己的帳單;計畫適合在 Z.ai 產品內使用,但 credits、尖峰窗口與客戶端工作流都會影響實際消耗。若任務必須在預算內完成,先用短任務測量,再選擇較高推理力度,而不是預設使用 max

本地權重

Hugging Face 模型卡片公開 zai-org/GLM-5.3,提供 vLLM、SGLang、Transformers 與 Docker 路徑。5.3 標示 glm-5.3,5.2 卡片則顯示 MIT;「看得到權重」和「允許你的部署方式」是兩項檢查。硬體佔用、量化、商業再散布與安全更新要分開評估,不能只因儲存庫公開就上線。

Tabbit

Tabbit 國際版公開頁面列出 GLM 5.3,但本次沒有登入帳號或打開模型選擇器,地區、版本、套餐與 rollout 都未知。可從 Tabbit 模型頁 (简体中文)開始,把AI 瀏覽器總覽作為背景,不要把它們當作即時權益證明。若看不到模型,先確認帳號與版本,再向產品支援核對,不要把儲存庫或公開頁面當作可用性證明。

Tabbit Browser

仍然未知的風險

獨立性能。 Z.ai 的表適合判斷方向和選擇任務,但測試框架、私有基準與工具鏈由廠商控制。MindStudio 的 73/80 KingBench 是獨立資料點,不是通用成功率。本文沒有執行本地測試,也沒有把社群結果當作重現。

額度行為。 社群對 Coding Plan 額度消耗、快取計量、並發與重置時間的回饋不一。SillyTavern 比較帖既有「比 5.0 和 5.2 好」的看法,也有某個角色扮演 preset 過度思考的經歷。ZaiGLM 套餐消耗討論中,soemre 說 OpenCode 會話六分鐘耗盡五小時額度,並懷疑長上下文計量。這些是待檢查的失敗模式,不是帳單事實。

安全與權限。 CyberGym 分數表示能力,不表示授權。不要對沒有權限的系統使用生成的 exploit chain;把金鑰、生產憑證與不可逆操作排除在不受信任的循環外。

授權與 Tabbit 可用性。 5.3 模型卡片的 glm-5.3 標籤不能自動繼承 5.2 的 MIT 經驗;Tabbit 公開頁面也不等於登入後的模型選擇器。商業部署或切換前,分別核對完整授權、帳號、地區和版本。

社群訊號:與官方聲明分開

獨立回饋混合且高度依賴客戶端。dptgreg 在 2026-08-14 的 SillyTavern 比較帖寫道:「Better than 5.0 and 5.2. Better than 5.1? Unsure.」Vaxyu 則描述自己的 preset 中過度思考與自我審查;上下文、採樣與角色卡都沒有控制。

Comprehensive-Bet-83 在這篇 ZaiGLM 討論中,把 GLM-5.3 作為關鍵認證、安全和 kernel C++ 工作的第二助手,稱其「not bad at all」,但評論仍認為速度、價格和品質會波動。研究記錄另收錄 Fahd Mirza 於 2026-08-19 發布、討論程式設計/安全/創意程式設計的第三方 GLM-5.3 YouTube review,原始頁面只返回標題和元資料,未用來證明性能。

這篇 ZCode Workflows 討論中,jfricker 於 2026-09-20 描述 ZCode 3.14.0 的分階段工作流,並說明自己用它審查大型程式碼庫。這是 ZCode 客戶端的工作流經驗,不是 GLM-5.3 基準,也不證明 Tabbit 有相同入口。

選擇前自檢

  1. 任務: 是長流程程式設計/工具循環,還是普通文字?普通文字未必值得額外推理成本。

  2. 執行時: 需要 API、Coding Plan、本地權重還是 Tabbit?只選一條路徑,核對自己的條款。

  3. 控制: 客戶端能接受強制思考和 low/high/max 嗎?不能就保留 5.2 或另一條基線。

  4. 預算: 能記錄輸入、快取輸入、輸出、延遲、重試和工具呼叫嗎?不能就不要由單次會話推斷成本。

  5. 風險: 模型會看到金鑰、部署程式碼、付款或系統探測權限嗎?加入人工審批和最小權限。

  6. 證據: 能以同一 harness 跑十個代表任務比較品質、時間和成本嗎?不能就把結論標成暫時。

來源

官方與廠商: Z.ai GLM-5.3 文件GLM-5.2 文件遷移指南定價DevPackZCode 文件目前 Hugging Face 模型卡片,均於 2026-09-20 重開。它們支持規格、廠商基準、價格/計畫快照、端點建議和授權標籤,不支持個人成功率或 Tabbit 帳號可用性結論。

獨立與社群原始頁: SillyTavern 比較(dptgreg/Vaxyu,2026-08-14,SillyTavern 角色扮演)、ZaiGLM 程式設計比較(Comprehensive-Bet-83,2026-09-20,認證/安全/kernel C++)、套餐消耗報告(soemre,2026-08-22,OpenCode)、ZCode Workflows(jfricker,2026-09-20,ZCode 3.14.0)和 Fahd Mirza 的 YouTube review(2026-08-19,僅元資料)。Reddit 是環境相關觀察,影片沒有可核驗轉錄;X 已嘗試但原始 status 頁面不可讀,正文不引用 X。

下一步

先開啟 GLM-5.3 模型入口 (简体中文),再選擇提示詞包 (简体中文)評測評論 (简体中文)。瀏覽器研究可繼續看AI 深度研究場景Tabbit 最佳實踐什麼是代理式瀏覽器。保留 5.2 基線,先核驗實際存取,再記錄十個任務結果,才決定是否切換生產流量。

常見問題

GLM-5.3 是什麼?

GLM-5.3 是 Z.ai 的文字推理模型,沿用 GLM-5.2 基座,並透過 post-training 強化長流程程式設計與代理任務。Z.ai 回報了更強的程式設計與安全基準結果,但不是所有專案的通用成功率。

GLM-5.3 相較 GLM-5.2 改變了什麼?

主要變化是 post-training、始終開啟的 low/high/max 推理力度、更新後的工具串流遷移和更高的官方代理基準。目前文件仍列出 1M 上下文與 128K 最大輸出。

如何取得 GLM-5.3?

可使用 Z.ai API、目前 Coding Plan,或透過 Hugging Face 模型卡片本地部署。Tabbit 國際版公開頁面列出 GLM-5.3,但本次未驗證登入後的模型選擇器,因此帳號與版本可用性仍未知。

GLM-5.3 開源且免費嗎?

目前 Hugging Face 頁面公開模型儲存庫,並標示 glm-5.3 授權,不是 GLM-5.2 卡片上的 MIT 標籤。API 與 Coding Plan 按價格或額度計量,本地部署仍須檢查授權與硬體。

誰現在不該選擇 GLM-5.3?

若你需要關閉思考、跨客戶端穩定的 token 計量、已驗證的 Tabbit 入口、明確寬鬆的授權,或獨立重現的基準,就不應無條件切換。先保留基線並做回歸測試。

下一步

讓 Tabbit 與你並肩工作。

跨分頁調研、自動化重複的瀏覽器工作,讓每一處上下文都觸手可及。