Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
官方GLM-5.2

GLM-5.2 官方发布说明与完整跑分表(Z.ai 博客)

原始来源

Z.ai 官方博客

作者Z.ai Research

原文日期2026-06-16

Tabbit 整理2026-08-19

查看原文

核心内容摘要

GLM-5.2 是 Z.ai 面向"长时程任务(long-horizon tasks)"推出的旗舰模型,核心卖点是真正可用的 1M token 上下文、灵活的思考档位与 MIT 开源协议(无地域限制)。官方口径:相比 GLM-5.1 在长时程任务能力上有实质跃升,且首次在 1M 上下文上"稳定扛住工程压力"。

发布要点

  • 1M 上下文:为编码 Agent 场景大幅扩展了 1M 上下文训练(大规模实现、自动化研究、性能优化、复杂调试),强调"1M 上下文要工程可用,不只是能接更多 token"。

  • 架构 IndexShare:每 4 层稀疏注意力共享一个 indexer,在 1M 上下文长度下每 token FLOPs 降低 2.9×;MTP(多 token 预测)层改进用于投机解码,接受长度提升最多 20%(消融:baseline 4.56 → +IndexShare+KV Share 5.10 → +Rejection Sampling 5.29 → +End-to-end TV Loss 5.47)。

  • 推理服务:基于 LayerSplit 做细粒度内存管理与并行,优化长上下文 kernel 与 CPU 侧缓存管理,上下文越长吞吐优势越大。

  • Agentic RL(slime 框架):并行 OPD 训练合并 10+ 专家模型,整个 OPD 训练约 2 天;引入 critic-based PPO(单 rollout、token 级 advantage)适配 compaction;编码 RL 引入两阶段反作弊(rule-based filter + LLM judge),在线拦截 hack 调用并返回假数据让 rollout 继续。

  • 获取:GLM Coding Plan(模型名 GLM-5.2,Claude Code 中用 GLM-5.2[1m] 启用 1M 上下文);Z.ai 聊天;HuggingFace / ModelScope 开源权重(支持 transformers、vLLM、SGLang、xLLM、ktransformers)。

完整跑分表(厂商口径,2026-06-16)

基准GLM-5.2GLM-5.1Qwen3.7-MaxMiniMax M3DeepSeek-V4-ProClaude Opus 4.8GPT-5.5Gemini 3.1 Pro
HLE40.531.041.437.037.749.8*41.4*45.0
HLE w/ Tools54.752.353.5-48.257.9*52.2*51.4*
CritPt20.94.613.43.712.920.927.117.7
AIME 202699.295.397.0-94.695.798.398.2
HMMT Nov. 202594.494.095.084.494.496.596.594.8
HMMT Feb. 202692.582.697.184.495.296.796.787.3
IMOAnswerBench91.083.890.0-89.883.5-81.0
GPQA-Diamond91.286.290.093.090.193.693.694.3
SWE-bench Pro62.158.460.659.055.469.258.654.2
NL2Repo48.942.747.242.135.569.750.733.4
DeepSWE46.218.018.020.08.058.070.010.0
ProgramBench63.750.9--47.871.970.839.5
Terminal-Bench 2.1 (Terminus-2)81.063.575.065.064.085.084.074.0
Terminal-Bench 2.1 (Best Harness)82.7 (Claude Code)69 (Claude Code)---78.9 (Claude Code)83.4 (Codex)70.7 (Gemini CLI)
FrontierSWE(Dominance, 2026/06/16)74.430.5--29.075.172.639.6
PostTrainBench34.320.1---37.228.421.6
SWE-Marathon13.01.0---26.012.04.0
MCP-Atlas (Public Set)76.871.876.474.273.677.875.369.2
Tool-Decathlon48.240.7--52.859.955.648.8

(* 为 full set 分数)

长时程三基准(官方口径)

  • FrontierSWE(Proximal 评测,1M 上下文 + Max 档 + 128K 输出):74.4,仅落后 Opus 4.8(75.1)约 1%,领先 GPT-5.5(72.6)约 1%、Opus 4.7 约 11%。

  • PostTrainBench(每个 agent 一台 H100,看能把小模型后训练提升多少):34.3,仅次于 Opus 4.8(37.2)。

  • SWE-Marathon(超长时程:写编译器、优化 kernel、开发生产级服务):13.0,落后 Opus 4.8(26.0)约 13%(原文表述),仍为开源第一。

官方评测方法脚注(可复现性关键)

  • HLE 等推理任务:temperature=1.0, top_p=0.95,最大生成长度 163,840;默认报 text-only 子集。

  • SWE-bench Pro:OpenHands + 定制指令提示词,temperature=1, top_p=1, max_new_tokens=32k,400K 上下文。

  • DeepSWE:官方 pier 评测框架 + mini-swe-agent,temperature=1.0, top_p=1.0, timeout=2h,400K 上下文,隔离容器(2 CPU、8GB RAM、无网络)。

  • Terminal-Bench 2.1:Terminus-2 框架(parser=json, timeout=4h, max_new_tokens=48k, max_episodes=500, 256K 上下文,4 CPU / 8GB RAM 上限);Claude Code 版本用透明代理把 max_new_tokens 提到 128k,去掉墙钟时限,5 次平均。

  • MCP-Atlas:think mode、500 任务公开子集、单任务 10 分钟超时、Gemini-3.0-Pro 作裁判。

  • 用途提示:不同模型可能用不同 harness,跨行对比需谨慎。

配额与成本(Coding Plan 口径)

  • 高峰期 3× 配额消耗、非高峰 2×;限时促销(至 9 月底)非高峰按 1× 计。高峰时段为每日 14:00–18:00(UTC+8)。

  • 编码任务官方推荐 Max 档。

原文关键引文

"Supporting long-horizon tasks starts with making long context engineering-usable: the model must maintain quality acros… 以上为必要节选,完整内容请查看原文。

"A 1M context is easy to claim, but much harder to keep reliable under real engineering pressure."

"Across all three benchmarks, GLM-5.2 is the highest-ranked open-source model, showing that its 1M context has translate… 以上为必要节选,完整内容请查看原文。

适用边界

  • 全部跑分为厂商自报,含第三方评测机构(Proximal / PostTrainBench / Abundant AI)执行的部分;与闭源模型对比时注意各模型所用 harness、上下文与档位不同。

  • 引用外部分数时建议同时给出官方脚注中的评测配置;GLM-5.3 发布时官方公布的 5.2 基线(如 Terminal-Bench 3.0 4.6、DeepSWE v1.1 46.2)与本文 2.x 基准不同,注意区分版本。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GLM-5.2

在 Tabbit 中使用并对比模型

GLM-5.2

相关测评

媒体NIST(美国国家标准与技术研究院)官网新闻2026-07-17

NIST CAISI 对 Z.ai GLM-5.2 的独立能力评估

媒体rentry.org(作者个人提示词库的说明页)2026-03-09

Evening-Truth 对 Z.AI Coding Plan 响应质量的投诉与量化疑云

媒体Hugging Face 官方博客(Security incident disclosure)2026-07

Hugging Face 安全事件取证:GLM-5.2 被用于自托管攻击日志分析(真实项目报告)

媒体Semgrep 官方博客2026-07

Semgrep IDOR 基准:GLM-5.2 在安全代码审计中的裸提示词结果

GLM-5.2

相关提示词

媒体Z.ai 官方开发者文档(docs.z.ai)2026-06-16

GLM-5.2 官方文档 Overview 与 API 快速开始(docs.z.ai)

媒体Z.ai 官方开发者文档(docs.z.ai,Get Started / Migrate)2026-06

从 GLM-5.1 / GLM-5 / GLM-4.x 迁移到 GLM-5.2 的官方配置指南

媒体Z.ai 官方开发者文档(docs.z.ai,Capabilities / Thinking Mode)

GLM-5.2 思考模式配置:默认思考 / 交错思考 / 保留思考 / 回合级思考(官方)

社区X.com(Twitter),@arena(Arena.ai 官方账号)2026-06-27

Arena.ai 前端编码同题对比:GLM-5.2 (Max) vs Claude Opus 4.8 (Thinking) 的 10 个单次生成示例