本指南的模型
`TheDrummer/Skyfall-31B-v4.2` 是 safetensors 儲存庫。模型卡署名 TheDrummer,並列出 Mistral v7 Tekken 聊天模板。
SKYFALL 31B × SILLYTAVERN
Skyfall 31B 這個名稱對應多個版本和格式。本指南針對 TheDrummer/Skyfall-31B-v4.2。調整角色卡前,先確認完整 ID、base、Mistral v7 模板與量化。

核對儲存庫 ID
將完整儲存庫名稱寫進筆記,區分 v4.2、v4.1、舊版 Skyfall 和搜尋結果中的同名專案。
`TheDrummer/Skyfall-31B-v4.2` 是 safetensors 儲存庫。模型卡署名 TheDrummer,並列出 Mistral v7 Tekken 聊天模板。
模型中繼資料將 `mistralai/Magistral-Small-2509` 列為 base。不要用名稱相近的 Mistral Small 版本取代它。
HF API 中繼資料顯示 BF16 參數為 31,352,980,480,架構為 Mistral,最大 position 設定為 131,072。這是中繼資料,不等於你的執行環境能使用同樣上下文。
這次核對的 API 中繼資料沒有公開 license 欄位。重新發佈或商業使用前,請閱讀儲存庫模型卡與上游條款。
量化與硬體
官方儲存庫很大。GGUF companion 提供多種取捨,檔案大小適合做第一輪篩選,但不等於實際顯存需求。
GGUF tree 列出的 Q4_K_M 約 18.98 GB。還要為執行時開銷、上下文和系統保留空間。24 GB 顯卡不一定能輕鬆全 GPU 載入。
Q5_K_M 約 22.25 GB,Q6_K 約 25.73 GB,Q8_0 約 33.32 GB。CPU 或系統記憶體 offload 可能可用,但速度會明顯下降。
Q2_K 約 11.73 GB,Q3_K_M 約 15.20 GB。改變量化後,用同一段短場景測試,分清檔案品質和提示詞或採樣變化。
GGUF 卡記錄了 llama.cpp 和 Ollama 路徑。下載準確檔案,啟動後端,再把 endpoint 和 model ID 複製進 SillyTavern。
SILLYTAVERN RP 設定
Skyfall v4.2 使用定製的 Mistral v7 Tekken 模板。讓一個層負責格式化,再用可重複的兩輪測試調整輸出。
盡量讓 tokenizer 或後端套用模型模板。如果 SillyTavern 也包裝 prompt,檢查原始 prompt 是否重複角色標記。
模型卡模板會尋找 system message 中的 `/think`,並可能加入 `[THINK]...[/THINK]`。請有意測試,不要把隱藏推理標記意外放進角色卡。
第一次 RP 可以從 temperature 0.7、top_p 0.9 和適中的最大回覆長度開始,再一次只改一個值。這些是起點,不是 Skyfall 官方 benchmark 數值。
說明模型控制哪個說話者。角色卡範例保持短小,刪掉要求模型同時替使用者、旁白和角色寫作的指令。
社群評論提到自然對話、角色一致性和語氣遵循,也有人遇到回覆過長、敘述不均、替使用者說話或 swipe 後重複錯誤。這些是症狀,不是受控評測。
症狀 → 檢查 → 修復
重複同一條短提示,一次只改一個設定,才能把模板問題和模型、硬體問題分開。
| 症狀 | 檢查 | 下一步 |
|---|---|---|
| 空回覆或標記洩露 | endpoint、Mistral 模板負責人、`/think` 開關和 stop string。 | 傳送一行短提示,只保留一個模板負責人,先清理洩露標記。 |
| 模型替 {{user}} 說話 | 角色卡範例、system prompt 和上一則 assistant 訊息。 | 寫清說話邊界,縮短範例,用兩選一場景測試。 |
| 回覆很長且重複 | 上下文、重複 lore、最大 token 和採樣。 | 精簡角色卡,降低回覆預算,再一次改一個採樣值。 |
| 速度慢或當機 | 量化大小、GPU offload、RAM/顯存餘量和上下文。 | 換小量化或縮短上下文,每次改變後比較 tokens/sec。 |
| 行為和模型卡不符 | v4.2/v4.1、safetensors/GGUF 和完整 model ID。 | 重新複製儲存庫 ID,按準確檔案的模型卡設定。 |
TABBIT 資料工作台
Tabbit 不執行 Skyfall,也不取代 SillyTavern。它適合處理模型卡、GGUF tree 和社群討論分散在多個頁面的情況。
把官方模型卡、GGUF tree 和 SillyTavern 文件放在一起,讓 Tabbit 只擷取 ID、大小和模板說明。
用 @ 引用頁面、截圖或本地筆記,讓 Tabbit 產生標注已確認事實與待查問題的清單。
用多模型對話比較設定說明。Tabbit 整理證據,本地後端仍是 Skyfall 執行的位置。




選擇合適的工具
兩者解決不同環節。把生成控制留在 SillyTavern,用 Tabbit 減少在資料頁面之間切換。
| SillyTavern + 後端 | Tabbit | |
|---|---|---|
| 本地執行 Skyfall | 可以,需要相容後端 | 不作此承諾 |
| 角色卡和採樣 | 細緻控制 | 參考筆記 |
| 閱讀模型和量化卡 | 切換分頁或應用程式 | @ 頁面、檔案和截圖 |
| 比較設定說明 | 切換預設或 endpoint | 比較可用模型 |
| 硬體排錯 | 觀察顯存、offload 和速度 | 收集證據 |
常見問題
TheDrummer/Skyfall-31B-v4.2。舊版 v4.1 或其他包含 Skyfall 名稱的專案可能使用不同模板和行為。
模型卡中繼資料將 mistralai/Magistral-Small-2509 列為 base。請複製完整 ID,不要只依賴搜尋標籤。
官方 GGUF tree 中 Q4_K_M 約 18.98 GB,適合做起點。根據執行時開銷測試 Q3 或 Q5。
模型卡列出 Mistral v7 Tekken,定製模板還會檢查 system prompt 中的 /think。請確認後端如何處理這個開關。
本頁不作此承諾。Tabbit 用來整理模型卡、量化檔案和比較資料。請透過相容的本地後端執行模型,再將後端接入 SillyTavern。
確認 v4.2,選擇量化,讓 Mistral 格式只有一個負責人,再用短場景調參。資料分散在不同頁面和檔案時,用 Tabbit 收攏它們。
支援 macOS 和 Windows。Tabbit 的模型可用性會變化。