Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.2 · 官方来源 · 厂商自报

GLM-5.2 官方发布说明与完整跑分表(Z.ai 博客)

Z.ai 2026-06-16 发布材料把 GLM-5.2 定位为 1M context 的长时程旗舰,并报告 Terminal-Bench 2.1 81.0、SWE-Bench Pro 62.1;官方还披露训练阶段 reward-hacking 风险。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

官方来源厂商自报编辑日期 2026-09-20

测试条件速查

条件
版本 GLM-5.2;官方发布 2026-06-16;任务为 Terminal-Bench 2.1、SWE-Bench Pro 与长时程工程;完整 harness、重复和生产成功率未公开。

关键数据与适用场景

核心内容摘要

GLM-5.2 是 Z.ai 面向"长时程任务(long-horizon tasks)"推出的旗舰模型,核心卖点是真正可用的 1M token 上下文、灵活的思考档位与 MIT 开源协议(无地域限制)。官方口径:相比 GLM-5.1 在长时程任务能力上有实质跃升,且首次在 1M 上下文上"稳定扛住工程压力"。

发布要点

  • 1M 上下文:为编码 Agent 场景大幅扩展了 1M 上下文训练(大规模实现、自动化研究、性能优化、复杂调试),强调"1M 上下文要工程可用,不只是能接更多 token"。

  • 架构 IndexShare:每 4 层稀疏注意力共享一个 indexer,在 1M 上下文长度下每 token FLOPs 降低 2.9×;MTP(多 token 预测)层改进用于投机解码,接受长度提升最多 20%(消融:baseline 4.56 → +IndexShare+KV Share 5.10 → +Rejection Sampling 5.29 → +End-to-end TV Loss 5.47)。

  • 推理服务:基于 LayerSplit 做细粒度内存管理与并行,优化长上下文 kernel 与 CPU 侧缓存管理,上下文越长吞吐优势越大。

  • Agentic RL(slime 框架):并行 OPD 训练合并 10+ 专家模型,整个 OPD 训练约 2 天;引入 critic-based PPO(单 rollout、token 级 advantage)适配 compaction;编码 RL 引入两阶段反作弊(rule-based filter + LLM judge),在线拦截 hack 调用并返回假数据让 rollout 继续。

  • 获取:GLM Coding Plan(模型名 GLM-5.2,Claude Code 中用 GLM-5.2[1m] 启用 1M 上下文);Z.ai 聊天;HuggingFace / ModelScope 开源权重(支持 transformers、vLLM、SGLang、xLLM、ktransformers)。

完整跑分表(厂商口径,2026-06-16)

基准GLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
HLE40.531.041.437.037.749.8*41.4*45.0
HLE w/ Tools54.752.353.5-48.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.0-94.695.798.398.2
HMMT Nov. 202594.494.095.084.494.496.596.594.8
HMMT Feb. 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.0-89.883.5-81.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.9--47.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (Best Harness)82.7 (Claude Code)69 (Claude Code)---78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE(Dominance, 2026/06/16)74.430.5--29.075.172.639.6
PostTrainBench34.320.1---37.228.421.6
SWE-Marathon13.01.0---26.012.04.0
MCP-Atlas (Public Set)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.7--52.859.955.648.8

(* 为 full set 分数)

长时程三基准(官方口径)

  • FrontierSWE(Proximal 评测,1M 上下文 + Max 档 + 128K 输出):74.4,仅落后 Opus 4.8(75.1)约 1%,领先 GPT-5.5(72.6)约 1%、Opus 4.7 约 11%。

  • PostTrainBench(每个 agent 一台 H100,看能把小模型后训练提升多少):34.3,仅次于 Opus 4.8(37.2)。

  • SWE-Marathon(超长时程:写编译器、优化 kernel、开发生产级服务):13.0,落后 Opus 4.8(26.0)约 13%(原文表述),仍为开源第一。

官方评测方法脚注(可复现性关键)

  • HLE 等推理任务:temperature=1.0, top_p=0.95,最大生成长度 163,840;默认报 text-only 子集。

  • SWE-bench Pro:OpenHands + 定制指令提示词,temperature=1, top_p=1, max_new_tokens=32k,400K 上下文。

  • DeepSWE:官方 pier 评测框架 + mini-swe-agent,temperature=1.0, top_p=1.0, timeout=2h,400K 上下文,隔离容器(2 CPU、8GB RAM、无网络)。

  • Terminal-Bench 2.1:Terminus-2 框架(parser=json, timeout=4h, max_new_tokens=48k, max_episodes=500, 256K 上下文,4 CPU / 8GB RAM 上限);Claude Code 版本用透明代理把 max_new_tokens 提到 128k,去掉墙钟时限,5 次平均。

  • MCP-Atlas:think mode、500 任务公开子集、单任务 10 分钟超时、Gemini-3.0-Pro 作裁判。

  • 用途提示:不同模型可能用不同 harness,跨行对比需谨慎。

配额与成本(Coding Plan 口径)

  • 高峰期 3× 配额消耗、非高峰 2×;限时促销(至 9 月底)非高峰按 1× 计。高峰时段为每日 14:00–18:00(UTC+8)。

  • 编码任务官方推荐 Max 档。

原文关键引文

"Supporting long-horizon tasks starts with making long context engineering-usable: the model must maintain quality acros… 以上为必要节选,完整内容请查看原文。

"A 1M context is easy to claim, but much harder to keep reliable under real engineering pressure."

"Across all three benchmarks, GLM-5.2 is the highest-ranked open-source model, showing that its 1M context has translate… 以上为必要节选,完整内容请查看原文。

适用边界

  • 全部跑分为厂商自报,含第三方评测机构(Proximal / PostTrainBench / Abundant AI)执行的部分;与闭源模型对比时注意各模型所用 harness、上下文与档位不同。

  • 引用外部分数时建议同时给出官方脚注中的评测配置;GLM-5.3 发布时官方公布的 5.2 基线(如 Terminal-Bench 3.0 4.6、DeepSWE v1.1 46.2)与本文 2.x 基准不同,注意区分版本。

能支持的判断

  • 支持引用官方长上下文、benchmark 与 reward-hacking 披露。

不能支持的判断

  • 不支持把官方分数当成跨 provider 的稳定表现或安全保证。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Z.ai 官方博客 · Z.ai Research · 原文发布日期 2026-06-16 · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.2

在 Tabbit 中比较 GLM-5.2

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GLM-5.2 是什么:价格、部署与适用边界

说明 GLM-5.2 的 2026 年 6 月发布、1M 上下文、开源权重、API 计费、编码证据与安全试用边界。

相关评测

NIST CAISI 对 Z.ai GLM-5.2 的独立能力评估NIST CAISI 2026-07-17 发布、2026-07-08 完成的评估认为 GLM-5.2 综合能力接近 GPT-5.2、网络能力接近 Opus 4.6,但 safeguards 对 agentic exploit 与生物问题表现混合。Semgrep IDOR 基准:GLM-5.2 在安全代码审计中的裸提示词结果Semgrep 2026-06-22 的 IDOR 基准在相同数据集、评估方法和提示词下给 GLM-5.2 的 Pydantic AI prompt-only harness 39% F1、约 $0.17/漏洞;不是通用网络安全分数。Reddit 盲代码评审:GLM-5.2 的生产就绪评分与多裁判复核Reddit VPS Manager 盲评在同一规格下比较 5 个模型,首轮由 Qwen 3.7 Plus 按固定 25 分表评分,后续增加 GPT Codex 与 Gemini 3.1 Pro 复核;样本为单项目。Arena.ai 独立评测:GLM-5.2 (Max) 在 Code Arena / Agent Arena / Text Arena 的排名Arena.ai 在 2026 年 6 月对 GLM-5.2 (Max) 做了三类平台内评测,结论如下。GLM-5.2 官方文档 Overview 与 API 快速开始(docs.z.ai)官方给 GLM-5.2 的标准接入配置:模型名 `glm-5.2`、1M 上下文 / 128K 最大输出、`thinking.type: enabled` + `reasoning_effort: max`、`temperature: 1.0`,可直接复制 curl / Python 示例完成首次调用,并了解官方认定的典型使用场景。GLM-5.2 思考模式配置:默认思考 / 交错思考 / 保留思考 / 回合级思考(官方)官方说明 GLM-5.2 思考默认开启(与 GLM-5.1/5/4.7 一致),提供四种思考形态——默认思考、交错思考(工具调用之间思考)、保留思考(跨轮保留推理内容,`clear_thinking: false`)、回合级思考(每回合独立开关),并给出"必须把历史 `reasoning_content` 原样回传"的 Agent 集成关键约束。从 GLM-5.1 / GLM-5 / GLM-4.x 迁移到 GLM-5.2 的官方配置指南官方给出的 GLM-5.2 迁移清单与参数配置:模型 ID 改为 `glm-5.2`、`temperature` 默认 1.0 / `top_p` 默认 0.95(二选一调参)、思考默认开启、`reasoning_effort` 用 `high` 或 `max`、流式与工具流式(`stream=true` + `tool_stream=true`)需按官方方式拼接,并附可直接使用的 Python 迁移示例。通过 Mistral 平台使用 GLM-5.2(zai-glm-5-2):第三方托管配置与定价GLM-5.2 已由 Mistral 作为第三方开源模型托管(Public Preview,模型 ID `zai-glm-5-2`,1M 上下文 / 128k 输出,未做任何修改),可直接在 Mistral 生态(Vibe CLI 等)中用该 ID 接入,价格为 $1.4 / $0.14(缓存输入)/ $4.4(输出)每百万 token。