一周角色扮演实测显示 LongCat 2.0 在创意写作上"中了大奖":指令遵循忠实、故事连贯、无硬性拒答、叙述中立不煽情,但有两个明显毛病——对给定信息过度忠实导致重复惯性、以及需要非常具体的要求才能触达越狱内容(作者被迫使用极强的 jailbreak 提示词)。
指令遵循忠实且准确:能优雅驾驭非常复杂的世界观设定。
故事连贯:任何场景下都没有读到破碎文本或乱码的感觉。
零硬性审查:任何性质的内容都不会抛出 "I'm sorry, but I cannot...";作者测试了大多数人都看不下去的场景,模型给"绝对自由"。
无夸张/煽情的旁白:叙述保持干燥中立,不强行塞入叙述者视角(作者对比:GLM 系列散文充满叙述者的文学腔,是其不喜欢 GLM 的原因)。
出奇地懂小众偏好:正确指示下能复现成人媒体中的极细细节。
(关键)对给定信息太忠实:长故事不强力防重复的话,会出现近乎相同的短语和场景反复出现;对写进世界观和指令里的内容有很强的"复制粘贴"惯性——连低优先级指令都会意外渗透进来,需要小心设计 worldbuilding 与指令。
(关键)奇怪的审查机制:极端内容并非不给,但你必须非常具体地说明想要什么——"像图书馆:通常你得和图书管理员的门禁搏斗;对 Longcat 来说,极端内容的书只是放在走廊深处,没有东西拦你,但要够得着需要费力伸展"。作者为此不得不使用极强的 jailbreak 提示词。
重复问题在不同 provider 上表现不同(作者取消了 NanoGPT 订阅,改用 OpenRouter 为主)。
作者使用的是非推理/非思考版本(non-reasoning / non-thinking version)。
评论补充:Owl Alpha 与 Longcat 2.0 是唯一能区分阿尔及利亚/摩洛哥 darija 方言、且了解某些近乎地图上消失的沿海小镇与区域文化/区域冲突的模型(r 北非方言角色扮演场景)。
单一匿名用户、单一场景(SillyTavern 角色扮演、非思考档位),结论不代表全部任务;"零审查"发生在该档位与提示设置下,官方 API 渠道(需手机号注册)与 OpenRouter 渠道的审查差异评论区也在讨论、无定论。
与官方定位一致处:指令遵循强、Agent/长程任务好(官方 SWE-bench 等);与官方宣传不一致处:官方未提"审查需非常具体要求"这一使用摩擦。
任务适用判断:适合创意写作、RP、长文叙事(需自行加防重复指令);不适合需要明确审查边界的合规场景。
关联:r/SillyTavernAI 另帖(1u4ts39)报告"多角色 RP 时爱插入不在场角色",可作为多角色场景的补充负面观察。
LongCat 2.0