这条讨论没有给出统一答案:CptPhantasmic 在 Janitor 的短测中认为 V4.1 Flash 的文风、指令遵循和细节处理有潜力,MikabellStarfall 却遇到单条回复超过 2000 词、角色失控和遗忘。两者都强调需要调整提示或角色卡。
适合判断的任务:Janitor 角色扮演中的文风、提示适配、指令遵循、角色控制和情节连续性风险。
不适合外推的任务:通用模型质量、V4 Pro 的严格优劣或所有客户端的一致表现。
适用的模型版本:DeepSeek V4.1 Flash。
测试环境或客户端:CptPhantasmic、MikabellStarfall 均提到 Janitor;CptPhantasmic 另称准备在 SillyTavern(ST)测试修改版 FF4 MAX+ 提示。提供商、预设全文和 API 配置未注明。
推理档位和参数:未注明。
正文只是询问 V4.1 Flash 是否比 V4 Pro 更好,没有定义任务集。CptPhantasmic 称在 Janitor 的少量机器人上做了快速测试,MikabellStarfall 描述的是一个 starter prompt 的使用经历;评论还建议按模型调整 preset、提示和角色卡。没有统一提示词、样本量、重复次数、基线或独立复核,因此只能视为社区意见。
正向体验:CptPhantasmic 认为微调提示后表现“相当好”,文风不同于 Pro-0813,能适应不同类型,较好遵循指令和细节;他称没有像 V4 Flash 那样跳过或略读提示和回复,也未遇到常见的 DeepSeek 固定措辞。该结论来自少量 Janitor 快速测试,尚未覆盖深度剧情或 positivity bias。
负向体验:MikabellStarfall 说 Janitor 会把开场提示扩展成 2000+ 词的小故事,只松散遵循开场,并增加地点、人物细节和情节;即使提示不要代替用户推进,也会接管整个场景,难以继续来回共写。她还称模型很健忘:提示中写的是《胡桃夹子》的 Grand Pas de Deux,却被写成 Sugar Plum Fairy,并在同一条消息倒退到第一幕。
其他信号:Kahvana 认为应为新模型调整 preset 和角色卡;PhysicalKnowledge 也称需要略微改提示。ForwardMastodon 认为它比 V4 Flash 更差;SleepBaobei 报告简单情节中频繁出现逻辑错误和幻觉。上述意见互相矛盾,不能合并成单一评分。
| 观察者 | 客户端与范围 | 现象 |
|---|---|---|
| CptPhantasmic | Janitor;少量机器人快速测试 | 文风变化、类型适应、指令和细节遵循较好;提示仍需微调 |
| MikabellStarfall | Janitor;单个 starter prompt | 2000+ 词、额外细节、接管场景、连续性与记忆问题 |
| Kahvana、PhysicalKnowledge | 客户端未完整注明 | 建议调整 preset、角色卡或提示 |
| 线程快照 | 5 个赞同、16 条评论 | 社区讨论规模,不是测评分数 |
该帖支持一个较窄的判断:V4.1 Flash 的角色扮演体验可能高度依赖 Janitor 的 preset、角色卡和提示设计,既可能改善文风与指令遵循,也可能因过度生成而破坏共同写作。MikabellStarfall 的《胡桃夹子》混淆是单次连续性案例,不足以证明普遍记忆缺陷;CptPhantasmic 的正面结论也只覆盖短测。原帖没有公开完整 preset 或提示词,不能声称存在可直接复制的配置。
固定同一 Janitor 角色卡、preset、开场提示和温度等参数,分别运行 V4.1 Flash 与明确版本的对照模型;重复记录回复字数、额外事实、是否接管用户角色、指令遵循和跨轮情节一致性。若在 ST 使用修改版 FF4 MAX+ 提示,必须取得完整文本并记录配置;本帖本身未提供,无法据此直接复现。
DeepSeek V4.1 Flash