在包含 992 张 AI 生成图像和 1500 张手绘草图的零样本视觉创造力评分独立实验中,GLM-5V-Turbo 展现出与人类评分显著中高程度的相关性(AI 图 r=0.57,手绘草图综合 r=0.49,特定形状草图最高达 r=0.66);开启思考链(Reasoning)对总体评分对齐度基本持平(AI 图 Delta=-0.002,草图 Delta=-0.018),但大幅增强了多模态感知与质量评判的可解释性。
适合的任务:UI / 图像视觉审美与创造力初筛、零样本多模态评审、图文感知与质量可解释性分析、设计方案的结构化点评。
不适合的任务:极度简陋、高抽象度草图(如 Shape 11 相关性下降至 0.36)的严格定量定级,此时仍需人工专家复核。
适用的模型版本:glm-5v-turbo(通过 OpenRouter 接口接入)。
适用的客户端、Agent 或 API:OpenRouter API、官方 Scoring App (https://review-visual-eval-scoring.hf.space)。
推荐的推理档位和参数:评测固定使用 temperature = 0;如需可解释的评审依据建议开启 reasoning,若仅需快速离散打分可关闭 reasoning 以节省延迟。
模型横向对比列表:
Gemini 3 Flash (gemini-3-flash-preview,直接调 Google AI API)
Gemma 4 31B IT (gemma-4-31b-it)
GPT-5.4 Mini (gpt-5.4-mini-20260317)
GLM-5V-Turbo (glm-5v-turbo)
Kimi K2.5 (kimi-k2.5)
Qwen 3.6 Plus (qwen3.6-plus)
评测数据集:
Dataset 1:992 张 AI 生成图像(基于人类真实创意 Prompt 生成)。
Dataset 2:1,500 张人类手绘草图(包含 Shape 4、Shape 11、Shape 12 等不同几何启发形状)。
标注基准:均有由多位人类专家独立给出的 1-5 分创造力评分作为真值(Ground Truth)。
评测工具:开源可复现应用 Harness (https://review-visual-eval-scoring.hf.space)。
任务提示:向模型输入单张图像及标准化打分指令,要求在 1-5 分范围内给出创造力评分。
参数控制:所有请求统一设定 temperature = 0,最大程度保证测试结果的可复现性与确定性。
Study 1 vs Study 2:Study 1 关闭 extended-reasoning;Study 2 在支持思考的模型(GLM-5V-Turbo, Kimi K2.5, Qwen 3.6 Plus)上开启 reasoning,记录完整思考链与最终打分。
| 模型名称 | AI 生成图像 (N=992) | 手绘草图 Shape 4 | 手绘草图 Shape 11 | 手绘草图 Shape 12 | 手绘草图综合 (N=1500) |
|---|---|---|---|---|---|
| Gemini 3 Flash | 0.68 | 0.70 | 0.67 | 0.67 | 0.68 |
| Gemma 4 31B IT | 0.66 | 0.59 | 0.57 | 0.51 | 0.55 |
| Kimi K2.5 | 0.64 | 0.69 | 0.58 | 0.55 | 0.60 |
| Qwen 3.6 Plus | 0.64 | 0.65 | 0.50 | 0.56 | 0.57 |
| GPT-5.4 Mini | 0.61 | 0.30 | 0.26 | 0.34 | 0.29 |
| GLM-5V-Turbo | 0.57 | 0.66 | 0.36 | 0.42 | 0.49 |
| 模型名称 | 测试数据集 | Reasoning ON (r) | Reasoning OFF (r) | 变化量 (Delta) |
|---|---|---|---|---|
| GLM-5V-Turbo | AI 生成图像 | 0.570 | 0.572 | -0.002 |
| GLM-5V-Turbo | 手绘草图 | 0.444 | 0.462 | -0.018 |
| Kimi K2.5 | AI 生成图像 | 0.648 | 0.636 | +0.012 |
| Kimi K2.5 | 手绘草图 | 0.544 | 0.550 | -0.005 |
| Qwen 3.6 Plus | AI 生成图像 | 0.562 | 0.637 | -0.075 |
| Qwen 3.6 Plus | 手绘草图 | 0.470 | 0.535 | -0.065 |
零样本视觉审美能力显著:GLM-5V-Turbo 在未经任何人类评分微调的情况下,在 AI 复杂图与手绘草图上均表现出明确的审美判断能力,草图综合表现(r=0.49)大幅领先 GPT-5.4 Mini(r=0.29)。
思考链表现稳定:与 Qwen 3.6 Plus 开启思考链后出现明显对齐衰减(-0.075 / -0.065)不同,GLM-5V-Turbo 的思考链对最终数值评分影响极小(-|Delta| <= 0.018),且生成的思考链在 Perception(感知描述)、Originality(新颖度)、Quality(质量)、Justification(理由陈述)四维度上表现出高度可解释性。
局限:模型在极端抽象或笔画极其简略的手绘图案(Shape 11)上相关性会有所回落(r=0.36),对极度稀疏线条的几何拓扑理解仍有提升空间。
复现步骤:
访问 HuggingFace Space 评测工具:https://review-visual-eval-scoring.hf.space;
配置 OpenRouter API Key 并指定模型为 glm-5v-turbo;
上传 992 张标准图像集或单张测试图,设置 temperature = 0;
分别开启/关闭 extended_reasoning 导出评分并计算与人工基准的 Pearson r。
论文提供了详尽的 21 页报告、9 张图表和公开代码库,记录了完整的 API 调用 identifier、温度、Token 长度与详细统计数据。
论文 Figure 4 与 Figure 5 完整展示了 GLM-5V-Turbo 在图像与手绘草图评估时的原始逐句思考链,证实其感知与理由生成结构完整。
该测评专注视觉创造力与审美评审维度,不直接反映代码生成或系统工具调用的成功率;
评测基于 2026 年 4-6 月的 snapshot 版本,不同供应商的量化部署可能存在微小打分浮动。
论文结论:“For two of the three models (Kimi K2.5 and GLM-5v Turbo) reasoning was essentially neutral on both datasets... making model evaluations interpretable—showing what they attend to, how they balance originality vs. quality, and how they justify their ratings.”(arXiv:2606.29672 Study 2)。
GLM-5V Turbo