本指南的模型
`TheDrummer/Skyfall-31B-v4.2` 是 safetensors 仓库。模型卡署名 TheDrummer,并列出 Mistral v7 Tekken 聊天模板。
SKYFALL 31B × SILLYTAVERN
Skyfall 31B 这个名称对应多个版本和格式。本指南针对 TheDrummer/Skyfall-31B-v4.2。调整角色卡前,先确认完整 ID、base、Mistral v7 模板和量化。

核对仓库 ID
把完整仓库名写进笔记,区分 v4.2、v4.1、旧版 Skyfall 和搜索结果中的同名项目。
`TheDrummer/Skyfall-31B-v4.2` 是 safetensors 仓库。模型卡署名 TheDrummer,并列出 Mistral v7 Tekken 聊天模板。
模型元数据将 `mistralai/Magistral-Small-2509` 列为 base。不要用名字相近的 Mistral Small 版本替换它。
HF API 元数据显示 BF16 参数为 31,352,980,480,架构为 Mistral,最大 position 设置为 131,072。这是元数据,不等于你的运行环境能使用同样上下文。
本次核对的 API 元数据没有公开 license 字段。重新分发或商业使用前,请阅读仓库模型卡和上游条款。
量化与硬件
官方仓库很大。GGUF companion 提供多种取舍,文件大小适合做第一轮筛选,但不等于实际显存需求。
GGUF tree 列出的 Q4_K_M 约 18.98 GB。还要给运行时开销、上下文和系统留空间。24 GB 显卡不一定能轻松全 GPU 加载。
Q5_K_M 约 22.25 GB,Q6_K 约 25.73 GB,Q8_0 约 33.32 GB。CPU 或系统内存 offload 可能可用,但速度会明显下降。
Q2_K 约 11.73 GB,Q3_K_M 约 15.20 GB。改变量化后,用同一段短场景测试,分清文件质量和提示词或采样变化。
GGUF 卡记录了 llama.cpp 和 Ollama 路径。下载准确文件,启动后端,再把 endpoint 和 model ID 复制进 SillyTavern。
SILLYTAVERN RP 设置
Skyfall v4.2 使用定制的 Mistral v7 Tekken 模板。让一个层负责格式化,再用可重复的两轮测试调输出。
尽量让 tokenizer 或后端应用模型模板。如果 SillyTavern 也包装 prompt,检查原始 prompt 是否重复角色标记。
模型卡模板会查找 system message 中的 `/think`,并可能加入 `[THINK]...[/THINK]`。请有意测试,不要把隐藏推理标记意外放进角色卡。
第一次 RP 可以从 temperature 0.7、top_p 0.9 和适中的最大回复长度开始,再一次只改一个值。这些是起点,不是 Skyfall 官方 benchmark 数值。
说明模型控制哪个说话者。角色卡示例保持短小,删掉要求模型同时替用户、旁白和角色写作的指令。
社区评论提到自然对话、角色一致性和语气遵循,也有人遇到回复过长、叙述不均、替用户说话或 swipe 后重复错误。这些是症状,不是受控评测。
症状 → 检查 → 修复
重复同一条短提示,一次只改一个设置,这样才能把模板问题和模型、硬件问题分开。
| 症状 | 检查 | 下一步 |
|---|---|---|
| 空回复或标记泄露 | endpoint、Mistral 模板负责人、`/think` 开关和 stop string。 | 发送一行短提示,只保留一个模板负责人,先清理泄露标记。 |
| 模型替 {{user}} 说话 | 角色卡示例、system prompt 和上一条 assistant 消息。 | 写清说话边界,缩短示例,用两选一场景测试。 |
| 回复很长且复读 | 上下文、重复 lore、最大 token 和采样。 | 精简角色卡,降低回复预算,再一次改一个采样值。 |
| 速度慢或崩溃 | 量化大小、GPU offload、RAM/显存余量和上下文。 | 换小量化或缩短上下文,每次改变后比较 tokens/sec。 |
| 行为和模型卡不符 | v4.2/v4.1、safetensors/GGUF 和完整 model ID。 | 重新复制仓库 ID,按准确文件的模型卡设置。 |
TABBIT 资料工作台
Tabbit 不运行 Skyfall,也不替代 SillyTavern。它适合处理模型卡、GGUF tree 和社区讨论分散在多个页面的情况。
把官方模型卡、GGUF tree 和 SillyTavern 文档放在一起,让 Tabbit 只提取 ID、大小和模板说明。
用 @ 引用页面、截图或本地笔记,让 Tabbit 生成标注已确认事实与待查问题的清单。
用多模型对话比较设置说明。Tabbit 整理证据,本地后端仍是 Skyfall 运行的位置。




选择合适的工具
两者解决不同环节。把生成控制留在 SillyTavern,用 Tabbit 减少在资料页面之间切换。
| SillyTavern + 后端 | Tabbit | |
|---|---|---|
| 本地运行 Skyfall | 可以,需要兼容后端 | 不作此承诺 |
| 角色卡和采样 | 细致控制 | 参考笔记 |
| 阅读模型和量化卡 | 切换标签或应用 | @ 页面、文件和截图 |
| 比较设置说明 | 切换预设或 endpoint | 比较可用模型 |
| 硬件排错 | 观察显存、offload 和速度 | 收集证据 |
常见问题
TheDrummer/Skyfall-31B-v4.2。旧版 v4.1 或其他包含 Skyfall 名称的项目可能使用不同模板和行为。
模型卡元数据将 mistralai/Magistral-Small-2509 列为 base。请复制完整 ID,不要只依赖搜索标签。
官方 GGUF tree 中 Q4_K_M 约 18.98 GB,适合做起点。根据运行时开销测试 Q3 或 Q5。
模型卡列出 Mistral v7 Tekken,定制模板还会检查 system prompt 中的 /think。请确认后端怎样处理这个开关。
本页不作此承诺。Tabbit 用来整理模型卡、量化文件和对比资料。请通过兼容的本地后端运行模型,再把后端接入 SillyTavern。
确认 v4.2,选择量化,让 Mistral 格式只有一个负责人,再用短场景调参。资料分散在不同页面和文件时,用 Tabbit 收拢它们。
支持 macOS 和 Windows。Tabbit 的模型可用性会变化。