Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
简体中文
简体中文English
测评与证据

GLM-5.2 · 社区来源 · 个人体验

Reddit 盲代码评审:GLM-5.2 的生产就绪评分与多裁判复核

Reddit VPS Manager 盲评在同一规格下比较 5 个模型,首轮由 Qwen 3.7 Plus 按固定 25 分表评分,后续增加 GPT Codex 与 Gemini 3.1 Pro 复核;样本为单项目。

待验证:本次未能重新核实原文。下方历史数字不代表已核实的当前结果。

社区来源个人体验编辑日期 2026-09-20

测试条件速查

条件
版本 GLM-5.2;同一 VPS Manager 规格、5 个实现;首轮 Qwen 3.7 Plus 评分,后续 GPT Codex/Gemini 3.1 Pro 复核;项目数、prompt 和重复有限。

关键数据与适用场景

测试环境

  • 任务:同一 VPS Manager 规格下的规划与代码实现;共 5 个模型实现。

  • 盲评:首轮由 Qwen 3.7 Plus 按固定 25 分网格评分;后续增加 GPT Codex、Gemini 3.1 Pro 两个独立评审。

  • 对照实现:BigPickle、Claude Code + Haiku 4.5、DeepSeek V4 Pro、Kimi K2.7 Code、GLM-5.2。

  • 评估重点:代码质量、完成度和是否 production-ready;帖子承认一次任务仍有偶然性。

输入/配置

  • 计划阶段记录模型 token 与成本;代码阶段按统一规格实现,再把实现匿名化给评审。

  • GLM-5.2:计划阶段约 43K tokens、$0.06;代码阶段约 4.42M tokens、总成本 $1.73。

  • 评审:第一轮 Qwen 3.7 Plus;复核加入 GPT Codex 与 Gemini 3.1 Pro,三者独立盲评后比较排序。

结果数据

首轮 Qwen 3.7 Plus 盲评:

模型代码阶段成本得分Production-ready
BigPickle$015/25否
Claude Code + Haiku 4.5$20/月12/25否
DeepSeek V4 Pro$0.2412/25否
Kimi K2.7 Code$0.8619/25否
GLM-5.2$1.7325/25是

多裁判复核:

实现Qwen 3.7 PlusGPT CodexGemini 3.1 Pro
BigPickle15/2513/2511/25
Claude + Haiku12/2512/2518/25
GLM 5.225/2517/2525/25
DeepSeek12/2514/2514/25
Kimi K2.719/2513/2521/25

结论

在这一个 VPS Manager 任务中,GLM-5.2 的实现被三名盲评者给出最高或并列最高分,并在两名评审下达到 25/25;结果支持其在从零规划到生产化代码交付上的潜力,但不能替代多任务、多轮运行的受控 benchmark。

局限

  • 单任务、单次实现,且评审本身是模型;Qwen、GPT、Gemini 的评分存在明显分歧。

  • 原帖成本和“production-ready”定义来自作者,未公开完整规格、所有代码和评分 rubric 的逐项证据。

  • 4.42M token 的 GLM 成本并不能与订阅价模型直接比较;不得把 25/25 泛化为所有编码任务。

复现步骤

  1. 从原帖取得 VPS Manager 规格、五个实现与 25 分评分网格,匿名化实现顺序。

  2. 固定同一模型版本、harness、最大 token、工具权限和测试命令,至少重复三次。

  3. 让三个不同模型独立盲评每个实现,预先固定评分规则,再用简单平均/中位数汇总。

  4. 把代码测试通过率、人工修订量和 token 成本与模型评审分开报告。

原始证据与数据

  • 帖子公开了五个实现的成本/分数表,以及 Qwen、GPT Codex、Gemini 三裁判的复核矩阵。

  • 评论区明确承认“一个任务、一次运行”会受偶然性影响,并建议使用多裁判和多任务复核。

来源摘录或观察(仅做合规短引)

  • 该案例的可复用方法是匿名化实现、固定评分网格和多评审交叉核对,而不是单看 GLM-5.2 的 25/25。

能支持的判断

  • 支持把规划、实现和多裁判评分流程作为一个案例阅读。

不能支持的判断

  • 不支持将单项目盲评当作总体代码质量或生产就绪率。

方法、局限和复现

本文中的数字、任务集、推理档位和客户端条件只在所列来源及采集时点内成立。不同版本、不同 harness 或不同提供商的数据不能直接并排比较;未公开的参数保持未知。

需要复测时,请固定模型版本、提供商或客户端、推理档位、工具、任务集版本、样本数和采集日期,并记录失败、重试与人工修正。完整方法和复现步骤见下方来源笔记。

原始来源

Reddit,r/ZaiGLM · u/DifficultHand3046;评论区补充多裁判复核 · 原文发布日期 Unknown · 本站编辑日期 2026-09-20

打开原始来源

GLM-5.2

在 Tabbit 中比较 GLM-5.2

下载 Tabbit 客户端后检查模型可用性

模型深度阅读

总览 · 简体中文

GLM-5.2 是什么:价格、部署与适用边界

说明 GLM-5.2 的 2026 年 6 月发布、1M 上下文、开源权重、API 计费、编码证据与安全试用边界。

相关评测

GLM-5.2 官方发布说明与完整跑分表(Z.ai 博客)Z.ai 2026-06-16 发布材料把 GLM-5.2 定位为 1M context 的长时程旗舰,并报告 Terminal-Bench 2.1 81.0、SWE-Bench Pro 62.1;官方还披露训练阶段 reward-hacking 风险。NIST CAISI 对 Z.ai GLM-5.2 的独立能力评估NIST CAISI 2026-07-17 发布、2026-07-08 完成的评估认为 GLM-5.2 综合能力接近 GPT-5.2、网络能力接近 Opus 4.6,但 safeguards 对 agentic exploit 与生物问题表现混合。Semgrep IDOR 基准:GLM-5.2 在安全代码审计中的裸提示词结果Semgrep 2026-06-22 的 IDOR 基准在相同数据集、评估方法和提示词下给 GLM-5.2 的 Pydantic AI prompt-only harness 39% F1、约 $0.17/漏洞;不是通用网络安全分数。Arena.ai 独立评测:GLM-5.2 (Max) 在 Code Arena / Agent Arena / Text Arena 的排名Arena.ai 在 2026 年 6 月对 GLM-5.2 (Max) 做了三类平台内评测,结论如下。GLM-5.2 官方文档 Overview 与 API 快速开始(docs.z.ai)官方给 GLM-5.2 的标准接入配置:模型名 `glm-5.2`、1M 上下文 / 128K 最大输出、`thinking.type: enabled` + `reasoning_effort: max`、`temperature: 1.0`,可直接复制 curl / Python 示例完成首次调用,并了解官方认定的典型使用场景。GLM-5.2 思考模式配置:默认思考 / 交错思考 / 保留思考 / 回合级思考(官方)官方说明 GLM-5.2 思考默认开启(与 GLM-5.1/5/4.7 一致),提供四种思考形态——默认思考、交错思考(工具调用之间思考)、保留思考(跨轮保留推理内容,`clear_thinking: false`)、回合级思考(每回合独立开关),并给出"必须把历史 `reasoning_content` 原样回传"的 Agent 集成关键约束。从 GLM-5.1 / GLM-5 / GLM-4.x 迁移到 GLM-5.2 的官方配置指南官方给出的 GLM-5.2 迁移清单与参数配置:模型 ID 改为 `glm-5.2`、`temperature` 默认 1.0 / `top_p` 默认 0.95(二选一调参)、思考默认开启、`reasoning_effort` 用 `high` 或 `max`、流式与工具流式(`stream=true` + `tool_stream=true`)需按官方方式拼接,并附可直接使用的 Python 迁移示例。通过 Mistral 平台使用 GLM-5.2(zai-glm-5-2):第三方托管配置与定价GLM-5.2 已由 Mistral 作为第三方开源模型托管(Public Preview,模型 ID `zai-glm-5-2`,1M 上下文 / 128k 输出,未做任何修改),可直接在 Mistral 生态(Vibe CLI 等)中用该 ID 接入,价格为 $1.4 / $0.14(缓存输入)/ $4.4(输出)每百万 token。