作者自测结论与多数社区口碑相反:LongCat 2.0 做的游戏"可玩但粗糙有 bug"(一个构建甚至全黑屏),同任务下 GLM 5.2 的产物"更干净、更流畅、更精致",因此他的建议是"值得玩玩、不值得切换"——这是对 LongCat 2.0 偏负面的独立样本,需与正面证据并读。
让 LongCat 2.0 构建多个游戏 demo:Dragon Realm、Skyrim 风格开放世界、VoxelCraft;结论"可玩,但 buggy、粗糙——一个构建甚至在某些点全黑"。
与 GLM 5.2 跑同样的游戏构建(crypt game、Dragon Realm、Skyrim 风格世界、VoxelCraft):GLM 5.2 版本全部更干净、更流畅、更精致;"LongCat 的 VoxelCraft 尤其不在一个量级。每一组并排对比 GLM 5.2 都赢"。
官方 API 体验:官方 API 区块"看起来是坏的",充值似乎需要中国区设置,所以改走网站聊天测试。
"它是个真的很酷、免费、开源的发布,美团从常规 AI 实验室之外推出严肃模型值得称赞。但如果你今天要在开源中国模型里选一个真正用来构建的,我仍会选 GLM 5.2——它是我测过的最强开源选项。LongCat 2.0 值得玩,不值得切换。"
背景信息:确认 LongCat 2.0 是免费 API "AoAlpha"(Owl Alpha)背后的模型;1.6T 参数;完全在美团自家芯片训练、零 Nvidia;配 LSA、零计算专家、MIPD(原文如此,应为 MOPD)。
利益相关警示:作者以销售 AI Profit Boardroom 订阅为生(文内多处引导加入社区),文章同时是营销内容;其"GLM 5.2 更强"的结论与其他证据(AlphaSignal 称 GLM-5.2 SWE-bench Pro 62.1 > LongCat 59.5,测评 04)方向一致,但"LongCat 游戏构建粗糙"与官方/社区正面演示(提示词目录 07/08、测评 09)冲突,说明该类任务结果方差大、依赖提示词与档位。
测试未公开提示词、档位与复现链接,仅凭文字描述,无法复核到产物级别;日期字段异常,发布时点不确。
任务适用判断:若以该文为准,LongCat 2.0 不适合对产物完成度要求高的创意编程任务;若以官方与 r/opencodeCLI 证据为准则适合。综合判断:创意编程任务上 LongCat 2.0 方差大,建议先小样自测。
LongCat 2.0