Tabbit
活动资源博客模型
Tabbit LogoTabbit

Tabbit — 为你工作的 AI 浏览器

主题资源

  • AI Browser Resources
  • Agentic Browser Resources
  • Browser Downloads and Install Guides
  • Browser Comparisons
  • AI Browser Alternatives
  • Browser Productivity Resources

热门指南

  • AI Browser
  • Agentic Browser Download
  • Best AI Browser 2026: Top 9 Tested & Ranked
  • AI Browser Download
  • Free AI Browser
  • Best AI Browser 2026
  • AI Browser Comparison 2026
  • AI Browser for Windows
  • AI Browser for Mac
  • Chrome Alternative 2026

活动

  • 别装了,你在《牛来》里早有原型
  • Tabbit 妙招大赛
  • KPOP SBTI 饭圈人格测试
  • Tabbit 校园共创者计划
  • fifi 的论文文献妙招精选
  • 用户问卷

关于

  • Tabbit 博客
  • 媒体报道
测评
社区GLM-5.2

Reddit 盲代码评审:GLM-5.2 的生产就绪评分与多裁判复核

原始来源

Reddit,r/ZaiGLM

作者u/DifficultHand3046;评论区补充多裁判复核

Tabbit 整理2026-08-19

查看原文

测试环境

  • 任务:同一 VPS Manager 规格下的规划与代码实现;共 5 个模型实现。

  • 盲评:首轮由 Qwen 3.7 Plus 按固定 25 分网格评分;后续增加 GPT Codex、Gemini 3.1 Pro 两个独立评审。

  • 对照实现:BigPickle、Claude Code + Haiku 4.5、DeepSeek V4 Pro、Kimi K2.7 Code、GLM-5.2。

  • 评估重点:代码质量、完成度和是否 production-ready;帖子承认一次任务仍有偶然性。

输入/配置

  • 计划阶段记录模型 token 与成本;代码阶段按统一规格实现,再把实现匿名化给评审。

  • GLM-5.2:计划阶段约 43K tokens、$0.06;代码阶段约 4.42M tokens、总成本 $1.73。

  • 评审:第一轮 Qwen 3.7 Plus;复核加入 GPT Codex 与 Gemini 3.1 Pro,三者独立盲评后比较排序。

结果数据

首轮 Qwen 3.7 Plus 盲评:

模型代码阶段成本得分Production-ready
BigPickle$015/25否
Claude Code + Haiku 4.5$20/月12/25否
DeepSeek V4 Pro$0.2412/25否
Kimi K2.7 Code$0.8619/25否
GLM-5.2$1.7325/25是

多裁判复核:

实现Qwen 3.7 PlusGPT CodexGemini 3.1 Pro
BigPickle15/2513/2511/25
Claude + Haiku12/2512/2518/25
GLM 5.225/2517/2525/25
DeepSeek12/2514/2514/25
Kimi K2.719/2513/2521/25

结论

在这一个 VPS Manager 任务中,GLM-5.2 的实现被三名盲评者给出最高或并列最高分,并在两名评审下达到 25/25;结果支持其在从零规划到生产化代码交付上的潜力,但不能替代多任务、多轮运行的受控 benchmark。

局限

  • 单任务、单次实现,且评审本身是模型;Qwen、GPT、Gemini 的评分存在明显分歧。

  • 原帖成本和“production-ready”定义来自作者,未公开完整规格、所有代码和评分 rubric 的逐项证据。

  • 4.42M token 的 GLM 成本并不能与订阅价模型直接比较;不得把 25/25 泛化为所有编码任务。

复现步骤

  1. 从原帖取得 VPS Manager 规格、五个实现与 25 分评分网格,匿名化实现顺序。

  2. 固定同一模型版本、harness、最大 token、工具权限和测试命令,至少重复三次。

  3. 让三个不同模型独立盲评每个实现,预先固定评分规则,再用简单平均/中位数汇总。

  4. 把代码测试通过率、人工修订量和 token 成本与模型评审分开报告。

原始证据与数据

  • 帖子公开了五个实现的成本/分数表,以及 Qwen、GPT Codex、Gemini 三裁判的复核矩阵。

  • 评论区明确承认“一个任务、一次运行”会受偶然性影响,并建议使用多裁判和多任务复核。

来源摘录或观察(仅做合规短引)

  • 该案例的可复用方法是匿名化实现、固定评分网格和多评审交叉核对,而不是单看 GLM-5.2 的 25/25。

Tabbit 小编提醒

本文是第三方资料导航。测试环境、模型版本和主观体验可能不同,请以原文为准。

GLM-5.2

在 Tabbit 中使用并对比模型

GLM-5.2

相关测评

官方Z.ai 官方博客2026-06-16

GLM-5.2 官方发布说明与完整跑分表(Z.ai 博客)

媒体NIST(美国国家标准与技术研究院)官网新闻2026-07-17

NIST CAISI 对 Z.ai GLM-5.2 的独立能力评估

媒体rentry.org(作者个人提示词库的说明页)2026-03-09

Evening-Truth 对 Z.AI Coding Plan 响应质量的投诉与量化疑云

媒体Hugging Face 官方博客(Security incident disclosure)2026-07

Hugging Face 安全事件取证:GLM-5.2 被用于自托管攻击日志分析(真实项目报告)

GLM-5.2

相关提示词

媒体Z.ai 官方开发者文档(docs.z.ai)2026-06-16

GLM-5.2 官方文档 Overview 与 API 快速开始(docs.z.ai)

媒体Z.ai 官方开发者文档(docs.z.ai,Get Started / Migrate)2026-06

从 GLM-5.1 / GLM-5 / GLM-4.x 迁移到 GLM-5.2 的官方配置指南

媒体Z.ai 官方开发者文档(docs.z.ai,Capabilities / Thinking Mode)

GLM-5.2 思考模式配置:默认思考 / 交错思考 / 保留思考 / 回合级思考(官方)

社区X.com(Twitter),@arena(Arena.ai 官方账号)2026-06-27

Arena.ai 前端编码同题对比:GLM-5.2 (Max) vs Claude Opus 4.8 (Thinking) 的 10 个单次生成示例