Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.2 · 媒体来源 · 编辑分析

Semgrep IDOR 基准:GLM-5.2 在安全代码审计中的裸提示词结果

Semgrep 2026-06-22 的 IDOR 基准在相同数据集、评估方法和提示词下给 GLM-5.2 的 Pydantic AI prompt-only harness 39% F1、约 $0.17/漏洞;不是通用网络安全分数。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

媒体来源编辑分析编辑日期 2026-09-20

测试条件速查

条件
版本 GLM-5.2;Semgrep IDOR 真实开源应用数据集;同一 prompt/Pydantic AI harness;单次配置结果,F1 39%、约 $0.17/漏洞,非大规模复跑。

关键数据与适用场景

测试环境

  • 任务:IDOR(不安全直接对象引用)检测;数据集为此前研究使用的真实开源应用。

  • 指标:以已知真阳性计算 precision、recall 和 F1,并记录每个真阳性的成本。

  • 固定项:同一 IDOR 数据集、评估方法和系统提示词。

  • 变量:模型与 harness。GLM-5.2、MiniMax M3、Kimi K2.7 Code 在 Pydantic AI 简单 harness 中只获得提示词和代码库;Claude Code 走 Claude Code SDK;Semgrep Multimodal 另有端点枚举和定向上下文的专用 harness。

输入/配置

  • 模型:GLM-5.2;Pydantic AI;统一 IDOR 系统提示词。

  • 公开描述的提示策略:提供搜索策略和 IDOR 识别要点,但不提供端点发现脚手架。

  • 运行口径:单一数据集/单次实验;作者明确说这是一个 harness 对照实验,不是模型通用排行榜。

结果数据

排名配置HarnessF1
1Semgrep Multimodal + GPT-5.5Semgrep 专用61%
2Semgrep Multimodal + Opus 4.8Semgrep 专用53%
3GLM-5.2Pydantic AI(prompt only)39%
4Claude Code + Opus 4.6Claude Code SDK37%
5Claude Code + Opus 4.8/4.7Claude Code SDK28%
6MiniMax M3Pydantic AI(prompt only)23%
7Kimi K2.7 CodePydantic AI(prompt only)22%
8GPT-5.5Codex20%
10DeepSeek V4Pydantic AI(prompt only)17%
  • GLM-5.2 每发现一个真阳性的成本约 $0.17。

  • GLM-5.2 比 Claude Code 的 32% F1 高 7 个百分点,但仍低于带端点发现的 Semgrep 专用 pipeline。

结论

在同一最小提示词和简单 harness 下,GLM-5.2 在 IDOR 检测上的 F1 高于本次 Claude Code 配置,并以较低成本达到可用结果;更大的差距来自 harness 是否提供端点枚举与定向上下文,因此模型选型不能脱离工作流脚手架。

局限

  • 一个漏洞类别、一个有限数据集、一次运行;作者明确指出 SSRF 等其他漏洞类型可能得到不同排序。

  • GLM-5.2 与 Semgrep Multimodal 不是相同 harness,不能把 39% 与 61% 视为纯模型差异。

  • 博客未公开完整数据集、每个样本的预测、随机种子和全部提示词;适合复核方法,不等于完全开箱复现。

复现步骤

  1. 取得同一公开 IDOR 数据集,固定 Pydantic AI、模型 SDK、超时、重试和输出解析。

  2. 使用统一系统提示词,分别运行 GLM-5.2、其他模型,并保留每个漏洞判断和成本日志。

  3. 用已知真阳性计算 precision、recall、F1;再增加端点枚举 harness,拆分模型贡献与脚手架贡献。

  4. 对第二种漏洞类别和多次随机运行复测,不把单次结果扩展成通用安全排名。

原始证据与数据

  • Semgrep 原文给出 GLM-5.2 39% F1、Claude Code 32%(正文叙述)以及每个真阳性约 $0.17 的成本。

  • 原文同时列出 MiniMax M3 23%、Kimi K2.7 Code 22%、GPT-5.5 Codex 20%、DeepSeek V4 17%,并明确说明开源模型没有获得端点发现脚手架。

来源摘录或观察(仅做合规短引)

  • 原文将问题概括为“模型能力与 harness 能力各贡献多少”,这比单一排行榜更适合指导 Agent 设计。

能支持的判断

  • 支持观察裸 prompt 与 harness 对 IDOR 检测 F1/成本的影响。

不能支持的判断

  • 不支持将一次 IDOR 结果外推到 SSRF、生产审计或所有代码库。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Semgrep 官方博客 · Semgrep Security Research and Engineering(作者 Pablo Estrada) · 原文发布日期 2026-07 · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.2

在 Tabbit 中比较 GLM-5.2

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GLM-5.2 是什么:价格、部署与适用边界

说明 GLM-5.2 的 2026 年 6 月发布、1M 上下文、开源权重、API 计费、编码证据与安全试用边界。

相关评测

NIST CAISI 对 Z.ai GLM-5.2 的独立能力评估NIST CAISI 2026-07-17 发布、2026-07-08 完成的评估认为 GLM-5.2 综合能力接近 GPT-5.2、网络能力接近 Opus 4.6,但 safeguards 对 agentic exploit 与生物问题表现混合。GLM-5.2 官方发布说明与完整跑分表(Z.ai 博客)Z.ai 2026-06-16 发布材料把 GLM-5.2 定位为 1M context 的长时程旗舰,并报告 Terminal-Bench 2.1 81.0、SWE-Bench Pro 62.1;官方还披露训练阶段 reward-hacking 风险。Reddit 盲代码评审:GLM-5.2 的生产就绪评分与多裁判复核Reddit VPS Manager 盲评在同一规格下比较 5 个模型,首轮由 Qwen 3.7 Plus 按固定 25 分表评分,后续增加 GPT Codex 与 Gemini 3.1 Pro 复核;样本为单项目。Evening-Truth 对 Z.AI Coding Plan 响应质量的投诉与量化疑云Evening-Truth 在提示词库中单独开了一页投诉 Z.AI Coding Plan 的响应质量: 主张:订阅 z.ai coding plan 后,"经常甚至永久"看到响应质量大幅下降;作者用同一批测试调用对比 z.ai 与 OpenRouter,差异"大到无法忽视"。GLM-5.2 官方文档 Overview 与 API 快速开始(docs.z.ai)官方给 GLM-5.2 的标准接入配置:模型名 `glm-5.2`、1M 上下文 / 128K 最大输出、`thinking.type: enabled` + `reasoning_effort: max`、`temperature: 1.0`,可直接复制 curl / Python 示例完成首次调用,并了解官方认定的典型使用场景。GLM-5.2 思考模式配置:默认思考 / 交错思考 / 保留思考 / 回合级思考(官方)官方说明 GLM-5.2 思考默认开启(与 GLM-5.1/5/4.7 一致),提供四种思考形态——默认思考、交错思考(工具调用之间思考)、保留思考(跨轮保留推理内容,`clear_thinking: false`)、回合级思考(每回合独立开关),并给出"必须把历史 `reasoning_content` 原样回传"的 Agent 集成关键约束。从 GLM-5.1 / GLM-5 / GLM-4.x 迁移到 GLM-5.2 的官方配置指南官方给出的 GLM-5.2 迁移清单与参数配置:模型 ID 改为 `glm-5.2`、`temperature` 默认 1.0 / `top_p` 默认 0.95(二选一调参)、思考默认开启、`reasoning_effort` 用 `high` 或 `max`、流式与工具流式(`stream=true` + `tool_stream=true`)需按官方方式拼接,并附可直接使用的 Python 迁移示例。通过 Mistral 平台使用 GLM-5.2(zai-glm-5-2):第三方托管配置与定价GLM-5.2 已由 Mistral 作为第三方开源模型托管(Public Preview,模型 ID `zai-glm-5-2`,1M 上下文 / 128k 输出,未做任何修改),可直接在 Mistral 生态(Vibe CLI 等)中用该 ID 接入,价格为 $1.4 / $0.14(缓存输入)/ $4.4(输出)每百万 token。