一份真实跑通的"多模型分工审计工作流":GLM-5.2 承担代码审计、GPT-5.5 承担上下文采集,扫描固件源码发现 high/critical 漏洞、成本约 ¥1000;作者随后用 dsh minimal mode + DeepSeek-V4-Pro-0813 复现出几乎相同的漏洞集合(仅缺 2 个),成本降至 ¥4——可复用于"大模型辅助源码审计"的选型与成本参考。
适合的任务:固件/源码漏洞审计(发现 high、critical 级漏洞);"代码审计 + 上下文采集"分工的多模型 Agent 工作流;需要对照不同模型组合在安全审计任务上性价比的选型。
不适合的任务:对成本极其敏感的日常迭代(同任务有更便宜替代:DeepSeek-V4-Pro-0813 + dsh minimal mode 成本约 1/250);需要完整可复制提示词/脚本的场景(作者未公开 workflow 细节与提示词)。
适用的模型版本:GLM-5.2(代码审计角色);GPT-5.5(上下文采集角色);对照组 DeepSeek-V4-Pro-0813(dsh minimal mode)。
适用的客户端、Agent 或 API:任意支持多模型编排的 Agent 框架/客户端(作者未指明具体实现,推测为自建 workflow);dsh minimal mode(对照组)。
推荐的推理档位和参数:未公开;安全审计类任务建议按官方编码推荐使用 GLM-5.2 高/最高思考档位(见提示词目录 01/02 号文档)。
任务:固件源码漏洞审计(目标:high / critical 级漏洞)
工作流(作者两个月前的版本):
1. 上下文采集(GPT-5.5):负责把固件源码中与目标相关的上下文提取、整理并喂给审计模型
2. 代码审计(GLM-5.2):基于采集到的上下文执行漏洞审计
3. 产出:high、critical 级漏洞集合;总成本约 ¥1000
对照组(作者 8/16 的复测):
1. dsh minimal mode + deepseek-v4-pro-0813
2. 产出:几乎完全一致的漏洞集合(仅缺失 2 个);成本 ¥4(注:作者未公开具体提示词、审计脚本与漏洞细节;上表为帖文信息的结构化转述,用于说明分工与成本。)
结论指向:GLM-5.2 在"代码审计"角色上有真实产出(发现 high/critical 漏洞);但其结果可被便宜得多的 DeepSeek-V4-Pro-0813 在近似场景复现(仅差 2 个漏洞)——选型时 GLM-5.2 不是审计任务唯一的或最便宜的选择。
环境:作者自建 workflow,未公开环境细节(上下文窗口使用、API 渠道、审计范围);成本为作者口径(约 ¥1000 vs ¥4)。
边界:单一案例、单一目标(某固件源码);"缺 2 个"未说明严重性;不构成受控对比;具体提示词不可复用(作者未公开)。
佐证:GLM-5.2 在安全/审计类任务上的能力与风险同时见本目录 02(NIST CAISI:护栏允许协助 agentic 漏洞利用)与 09(Hugging Face 取证使用)号文档。
"用GLM-5.2(代码审计) + GPT-5.5(Context采集)组了个巨大的workflow,扫某固件源码,发现了些high、critical的漏洞,成本¥1k"
"今天试了下dsh minimal mode + deepseek-v4-pro-0813,发现了几乎完全一样的漏洞集合(只缺了2个),成本4¥"
GLM-5.2