GLM-5.2 是 Z.ai 面向"长时程任务(long-horizon tasks)"推出的旗舰模型,核心卖点是真正可用的 1M token 上下文、灵活的思考档位与 MIT 开源协议(无地域限制)。官方口径:相比 GLM-5.1 在长时程任务能力上有实质跃升,且首次在 1M 上下文上"稳定扛住工程压力"。
1M 上下文:为编码 Agent 场景大幅扩展了 1M 上下文训练(大规模实现、自动化研究、性能优化、复杂调试),强调"1M 上下文要工程可用,不只是能接更多 token"。
架构 IndexShare:每 4 层稀疏注意力共享一个 indexer,在 1M 上下文长度下每 token FLOPs 降低 2.9×;MTP(多 token 预测)层改进用于投机解码,接受长度提升最多 20%(消融:baseline 4.56 → +IndexShare+KV Share 5.10 → +Rejection Sampling 5.29 → +End-to-end TV Loss 5.47)。
推理服务:基于 LayerSplit 做细粒度内存管理与并行,优化长上下文 kernel 与 CPU 侧缓存管理,上下文越长吞吐优势越大。
Agentic RL(slime 框架):并行 OPD 训练合并 10+ 专家模型,整个 OPD 训练约 2 天;引入 critic-based PPO(单 rollout、token 级 advantage)适配 compaction;编码 RL 引入两阶段反作弊(rule-based filter + LLM judge),在线拦截 hack 调用并返回假数据让 rollout 继续。
获取:GLM Coding Plan(模型名 GLM-5.2,Claude Code 中用 GLM-5.2[1m] 启用 1M 上下文);Z.ai 聊天;HuggingFace / ModelScope 开源权重(支持 transformers、vLLM、SGLang、xLLM、ktransformers)。
| 基准 | GLM-5.2 | GLM-5.1 | Qwen3.7-Max | MiniMax M3 | DeepSeek-V4-Pro | Claude Opus 4.8 | GPT-5.5 | Gemini 3.1 Pro |
|---|---|---|---|---|---|---|---|---|
| HLE | 40.5 | 31.0 | 41.4 | 37.0 | 37.7 | 49.8* | 41.4* | 45.0 |
| HLE w/ Tools | 54.7 | 52.3 | 53.5 | - | 48.2 | 57.9* | 52.2* | 51.4* |
| CritPt | 20.9 | 4.6 | 13.4 | 3.7 | 12.9 | 20.9 | 27.1 | 17.7 |
| AIME 2026 | 99.2 | 95.3 | 97.0 | - | 94.6 | 95.7 | 98.3 | 98.2 |
| HMMT Nov. 2025 | 94.4 | 94.0 | 95.0 | 84.4 | 94.4 | 96.5 | 96.5 | 94.8 |
| HMMT Feb. 2026 | 92.5 | 82.6 | 97.1 | 84.4 | 95.2 | 96.7 | 96.7 | 87.3 |
| IMOAnswerBench | 91.0 | 83.8 | 90.0 | - | 89.8 | 83.5 | - | 81.0 |
| GPQA-Diamond | 91.2 | 86.2 | 90.0 | 93.0 | 90.1 | 93.6 | 93.6 | 94.3 |
| SWE-bench Pro | 62.1 | 58.4 | 60.6 | 59.0 | 55.4 | 69.2 | 58.6 | 54.2 |
| NL2Repo | 48.9 | 42.7 | 47.2 | 42.1 | 35.5 | 69.7 | 50.7 | 33.4 |
| DeepSWE | 46.2 | 18.0 | 18.0 | 20.0 | 8.0 | 58.0 | 70.0 | 10.0 |
| ProgramBench | 63.7 | 50.9 | - | - | 47.8 | 71.9 | 70.8 | 39.5 |
| Terminal-Bench 2.1 (Terminus-2) | 81.0 | 63.5 | 75.0 | 65.0 | 64.0 | 85.0 | 84.0 | 74.0 |
| Terminal-Bench 2.1 (Best Harness) | 82.7 (Claude Code) | 69 (Claude Code) | - | - | - | 78.9 (Claude Code) | 83.4 (Codex) | 70.7 (Gemini CLI) |
| FrontierSWE(Dominance, 2026/06/16) | 74.4 | 30.5 | - | - | 29.0 | 75.1 | 72.6 | 39.6 |
| PostTrainBench | 34.3 | 20.1 | - | - | - | 37.2 | 28.4 | 21.6 |
| SWE-Marathon | 13.0 | 1.0 | - | - | - | 26.0 | 12.0 | 4.0 |
| MCP-Atlas (Public Set) | 76.8 | 71.8 | 76.4 | 74.2 | 73.6 | 77.8 | 75.3 | 69.2 |
| Tool-Decathlon | 48.2 | 40.7 | - | - | 52.8 | 59.9 | 55.6 | 48.8 |
(* 为 full set 分数)
FrontierSWE(Proximal 评测,1M 上下文 + Max 档 + 128K 输出):74.4,仅落后 Opus 4.8(75.1)约 1%,领先 GPT-5.5(72.6)约 1%、Opus 4.7 约 11%。
PostTrainBench(每个 agent 一台 H100,看能把小模型后训练提升多少):34.3,仅次于 Opus 4.8(37.2)。
SWE-Marathon(超长时程:写编译器、优化 kernel、开发生产级服务):13.0,落后 Opus 4.8(26.0)约 13%(原文表述),仍为开源第一。
HLE 等推理任务:temperature=1.0, top_p=0.95,最大生成长度 163,840;默认报 text-only 子集。
SWE-bench Pro:OpenHands + 定制指令提示词,temperature=1, top_p=1, max_new_tokens=32k,400K 上下文。
DeepSWE:官方 pier 评测框架 + mini-swe-agent,temperature=1.0, top_p=1.0, timeout=2h,400K 上下文,隔离容器(2 CPU、8GB RAM、无网络)。
Terminal-Bench 2.1:Terminus-2 框架(parser=json, timeout=4h, max_new_tokens=48k, max_episodes=500, 256K 上下文,4 CPU / 8GB RAM 上限);Claude Code 版本用透明代理把 max_new_tokens 提到 128k,去掉墙钟时限,5 次平均。
MCP-Atlas:think mode、500 任务公开子集、单任务 10 分钟超时、Gemini-3.0-Pro 作裁判。
用途提示:不同模型可能用不同 harness,跨行对比需谨慎。
高峰期 3× 配额消耗、非高峰 2×;限时促销(至 9 月底)非高峰按 1× 计。高峰时段为每日 14:00–18:00(UTC+8)。
编码任务官方推荐 Max 档。
"Supporting long-horizon tasks starts with making long context engineering-usable: the model must maintain quality acros… 以上为必要节选,完整内容请查看原文。
"A 1M context is easy to claim, but much harder to keep reliable under real engineering pressure."
"Across all three benchmarks, GLM-5.2 is the highest-ranked open-source model, showing that its 1M context has translate… 以上为必要节选,完整内容请查看原文。
全部跑分为厂商自报,含第三方评测机构(Proximal / PostTrainBench / Abundant AI)执行的部分;与闭源模型对比时注意各模型所用 harness、上下文与档位不同。
引用外部分数时建议同时给出官方脚注中的评测配置;GLM-5.3 发布时官方公布的 5.2 基线(如 Terminal-Bench 3.0 4.6、DeepSWE v1.1 46.2)与本文 2.x 基准不同,注意区分版本。
GLM-5.2