汇总 GLM-5.1 的官方基准、媒体分析和社区实测,不把第三方观点包装成 Tabbit 自测。
官方数据把 GLM-5.1 的强项集中在长程代码优化和 Agent 工具循环,但分数高度依赖 OpenHands/Terminus/Claude Code 等 harness、上下文管理和特定参数,不能直接视作裸模型排名。
这篇完整评测最有价值的不是“94.6% of Opus”标题,而是把早期 45.3 分的 Claude Code 自报结果与后续 58.4 SWE-Bench Pro 更新区分开,并明确提醒二者不能当作同一测试。
在第三方独立评测体系中,GLM-5.1 (Reasoning) 综合智能指数得分 41,吞吐达 82.7 tokens/s,位列同类模型前 20%,展现出高智能与高生成速度,但相对其他开源权重模型生成长度偏长且价格偏高。
社区体验把 GLM-5.1 描述为成本友好的 C++/日常编码和长程项目候选,但大型 monorepo、复杂调试、延迟和上下文稳定性仍有明显分歧,必须记录 provider 与 harness。
在工业运维看板单次生成对照测试中,GLM-5.1 视觉 UI 表现最佳且速度与 DeepSeek-V4-Pro 相当,但需要二次调试修复小 bug;在 Kubernetes YAML 与 100k+ 上下文场景下存在明确的格式与稳定性边界。
GLM-5.1