任务:同一 VPS Manager 规格下的规划与代码实现;共 5 个模型实现。
盲评:首轮由 Qwen 3.7 Plus 按固定 25 分网格评分;后续增加 GPT Codex、Gemini 3.1 Pro 两个独立评审。
对照实现:BigPickle、Claude Code + Haiku 4.5、DeepSeek V4 Pro、Kimi K2.7 Code、GLM-5.2。
评估重点:代码质量、完成度和是否 production-ready;帖子承认一次任务仍有偶然性。
计划阶段记录模型 token 与成本;代码阶段按统一规格实现,再把实现匿名化给评审。
GLM-5.2:计划阶段约 43K tokens、$0.06;代码阶段约 4.42M tokens、总成本 $1.73。
评审:第一轮 Qwen 3.7 Plus;复核加入 GPT Codex 与 Gemini 3.1 Pro,三者独立盲评后比较排序。
首轮 Qwen 3.7 Plus 盲评:
| 模型 | 代码阶段成本 | 得分 | Production-ready |
|---|---|---|---|
| BigPickle | $0 | 15/25 | 否 |
| Claude Code + Haiku 4.5 | $20/月 | 12/25 | 否 |
| DeepSeek V4 Pro | $0.24 | 12/25 | 否 |
| Kimi K2.7 Code | $0.86 | 19/25 | 否 |
| GLM-5.2 | $1.73 | 25/25 | 是 |
多裁判复核:
| 实现 | Qwen 3.7 Plus | GPT Codex | Gemini 3.1 Pro |
|---|---|---|---|
| BigPickle | 15/25 | 13/25 | 11/25 |
| Claude + Haiku | 12/25 | 12/25 | 18/25 |
| GLM 5.2 | 25/25 | 17/25 | 25/25 |
| DeepSeek | 12/25 | 14/25 | 14/25 |
| Kimi K2.7 | 19/25 | 13/25 | 21/25 |
在这一个 VPS Manager 任务中,GLM-5.2 的实现被三名盲评者给出最高或并列最高分,并在两名评审下达到 25/25;结果支持其在从零规划到生产化代码交付上的潜力,但不能替代多任务、多轮运行的受控 benchmark。
单任务、单次实现,且评审本身是模型;Qwen、GPT、Gemini 的评分存在明显分歧。
原帖成本和“production-ready”定义来自作者,未公开完整规格、所有代码和评分 rubric 的逐项证据。
4.42M token 的 GLM 成本并不能与订阅价模型直接比较;不得把 25/25 泛化为所有编码任务。
从原帖取得 VPS Manager 规格、五个实现与 25 分评分网格,匿名化实现顺序。
固定同一模型版本、harness、最大 token、工具权限和测试命令,至少重复三次。
让三个不同模型独立盲评每个实现,预先固定评分规则,再用简单平均/中位数汇总。
把代码测试通过率、人工修订量和 token 成本与模型评审分开报告。
帖子公开了五个实现的成本/分数表,以及 Qwen、GPT Codex、Gemini 三裁判的复核矩阵。
评论区明确承认“一个任务、一次运行”会受偶然性影响,并建议使用多裁判和多任务复核。
该案例的可复用方法是匿名化实现、固定评分网格和多评审交叉核对,而不是单看 GLM-5.2 的 25/25。
GLM-5.2