Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
媒体GLM-5.2

Semgrep IDOR 基准:GLM-5.2 在安全代码审计中的裸提示词结果

原始来源

Semgrep 官方博客

作者Semgrep Security Research and Engineering(作者 Pablo Estrada)

原文日期2026-07

Tabbit 整理2026-08-19

查看原文

测试环境

  • 任务:IDOR(不安全直接对象引用)检测;数据集为此前研究使用的真实开源应用。

  • 指标:以已知真阳性计算 precision、recall 和 F1,并记录每个真阳性的成本。

  • 固定项:同一 IDOR 数据集、评估方法和系统提示词。

  • 变量:模型与 harness。GLM-5.2、MiniMax M3、Kimi K2.7 Code 在 Pydantic AI 简单 harness 中只获得提示词和代码库;Claude Code 走 Claude Code SDK;Semgrep Multimodal 另有端点枚举和定向上下文的专用 harness。

输入/配置

  • 模型:GLM-5.2;Pydantic AI;统一 IDOR 系统提示词。

  • 公开描述的提示策略:提供搜索策略和 IDOR 识别要点,但不提供端点发现脚手架。

  • 运行口径:单一数据集/单次实验;作者明确说这是一个 harness 对照实验,不是模型通用排行榜。

结果数据

排名配置HarnessF1
1Semgrep Multimodal + GPT-5.5Semgrep 专用61%
2Semgrep Multimodal + Opus 4.8Semgrep 专用53%
3GLM-5.2Pydantic AI(prompt only)39%
4Claude Code + Opus 4.6Claude Code SDK37%
5Claude Code + Opus 4.8/4.7Claude Code SDK28%
6MiniMax M3Pydantic AI(prompt only)23%
7Kimi K2.7 CodePydantic AI(prompt only)22%
8GPT-5.5Codex20%
10DeepSeek V4Pydantic AI(prompt only)17%
  • GLM-5.2 每发现一个真阳性的成本约 $0.17。

  • GLM-5.2 比 Claude Code 的 32% F1 高 7 个百分点,但仍低于带端点发现的 Semgrep 专用 pipeline。

结论

在同一最小提示词和简单 harness 下,GLM-5.2 在 IDOR 检测上的 F1 高于本次 Claude Code 配置,并以较低成本达到可用结果;更大的差距来自 harness 是否提供端点枚举与定向上下文,因此模型选型不能脱离工作流脚手架。

局限

  • 一个漏洞类别、一个有限数据集、一次运行;作者明确指出 SSRF 等其他漏洞类型可能得到不同排序。

  • GLM-5.2 与 Semgrep Multimodal 不是相同 harness,不能把 39% 与 61% 视为纯模型差异。

  • 博客未公开完整数据集、每个样本的预测、随机种子和全部提示词;适合复核方法,不等于完全开箱复现。

复现步骤

  1. 取得同一公开 IDOR 数据集,固定 Pydantic AI、模型 SDK、超时、重试和输出解析。

  2. 使用统一系统提示词,分别运行 GLM-5.2、其他模型,并保留每个漏洞判断和成本日志。

  3. 用已知真阳性计算 precision、recall、F1;再增加端点枚举 harness,拆分模型贡献与脚手架贡献。

  4. 对第二种漏洞类别和多次随机运行复测,不把单次结果扩展成通用安全排名。

原始证据与数据

  • Semgrep 原文给出 GLM-5.2 39% F1、Claude Code 32%(正文叙述)以及每个真阳性约 $0.17 的成本。

  • 原文同时列出 MiniMax M3 23%、Kimi K2.7 Code 22%、GPT-5.5 Codex 20%、DeepSeek V4 17%,并明确说明开源模型没有获得端点发现脚手架。

来源摘录或观察(仅做合规短引)

  • 原文将问题概括为“模型能力与 harness 能力各贡献多少”,这比单一排行榜更适合指导 Agent 设计。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GLM-5.2

在 Tabbit 中使用并对比模型

GLM-5.2

相关测评

官方Z.ai 官方博客2026-06-16

GLM-5.2 官方发布说明与完整跑分表(Z.ai 博客)

媒体NIST(美国国家标准与技术研究院)官网新闻2026-07-17

NIST CAISI 对 Z.ai GLM-5.2 的独立能力评估

媒体rentry.org(作者个人提示词库的说明页)2026-03-09

Evening-Truth 对 Z.AI Coding Plan 响应质量的投诉与量化疑云

媒体Hugging Face 官方博客(Security incident disclosure)2026-07

Hugging Face 安全事件取证:GLM-5.2 被用于自托管攻击日志分析(真实项目报告)

GLM-5.2

相关提示词

媒体Z.ai 官方开发者文档(docs.z.ai)2026-06-16

GLM-5.2 官方文档 Overview 与 API 快速开始(docs.z.ai)

媒体Z.ai 官方开发者文档(docs.z.ai,Get Started / Migrate)2026-06

从 GLM-5.1 / GLM-5 / GLM-4.x 迁移到 GLM-5.2 的官方配置指南

媒体Z.ai 官方开发者文档(docs.z.ai,Capabilities / Thinking Mode)

GLM-5.2 思考模式配置:默认思考 / 交错思考 / 保留思考 / 回合级思考(官方)

社区X.com(Twitter),@arena(Arena.ai 官方账号)2026-06-27

Arena.ai 前端编码同题对比:GLM-5.2 (Max) vs Claude Opus 4.8 (Thinking) 的 10 个单次生成示例