SKYFALL 31B × SILLYTAVERN

先找對 Skyfall 檔案

Skyfall 31B 這個名稱對應多個版本和格式。本指南針對 TheDrummer/Skyfall-31B-v4.2。調整角色卡前,先確認完整 ID、base、Mistral v7 模板與量化。

閱讀 v4.2 模型卡
Tabbit 桌面瀏覽器顯示垂直分頁、輸入框與資料研究側欄。

核對儲存庫 ID

31B 是規模,不是 checkpoint

將完整儲存庫名稱寫進筆記,區分 v4.2、v4.1、舊版 Skyfall 和搜尋結果中的同名專案。

01

本指南的模型

`TheDrummer/Skyfall-31B-v4.2` 是 safetensors 儲存庫。模型卡署名 TheDrummer,並列出 Mistral v7 Tekken 聊天模板。

02

Base 模型

模型中繼資料將 `mistralai/Magistral-Small-2509` 列為 base。不要用名稱相近的 Mistral Small 版本取代它。

03

參數數量

HF API 中繼資料顯示 BF16 參數為 31,352,980,480,架構為 Mistral,最大 position 設定為 131,072。這是中繼資料,不等於你的執行環境能使用同樣上下文。

04

授權條款

這次核對的 API 中繼資料沒有公開 license 欄位。重新發佈或商業使用前,請閱讀儲存庫模型卡與上游條款。

量化與硬體

選擇機器真的載得動的檔案

官方儲存庫很大。GGUF companion 提供多種取捨,檔案大小適合做第一輪篩選,但不等於實際顯存需求。

01

從 Q4_K_M 開始

GGUF tree 列出的 Q4_K_M 約 18.98 GB。還要為執行時開銷、上下文和系統保留空間。24 GB 顯卡不一定能輕鬆全 GPU 載入。

02

更大量化需要餘量

Q5_K_M 約 22.25 GB,Q6_K 約 25.73 GB,Q8_0 約 33.32 GB。CPU 或系統記憶體 offload 可能可用,但速度會明顯下降。

03

小量化會換取品質

Q2_K 約 11.73 GB,Q3_K_M 約 15.20 GB。改變量化後,用同一段短場景測試,分清檔案品質和提示詞或採樣變化。

04

只選一個服務層

GGUF 卡記錄了 llama.cpp 和 Ollama 路徑。下載準確檔案,啟動後端,再把 endpoint 和 model ID 複製進 SillyTavern。

SILLYTAVERN RP 設定

先修模板,再調採樣

Skyfall v4.2 使用定製的 Mistral v7 Tekken 模板。讓一個層負責格式化,再用可重複的兩輪測試調整輸出。

01

使用 Mistral v7 Tekken

盡量讓 tokenizer 或後端套用模型模板。如果 SillyTavern 也包裝 prompt,檢查原始 prompt 是否重複角色標記。

02

決定是否啟用 thinking

模型卡模板會尋找 system message 中的 `/think`,並可能加入 `[THINK]...[/THINK]`。請有意測試,不要把隱藏推理標記意外放進角色卡。

03

先記錄一組基線

第一次 RP 可以從 temperature 0.7、top_p 0.9 和適中的最大回覆長度開始,再一次只改一個值。這些是起點,不是 Skyfall 官方 benchmark 數值。

04

保護使用者主動權

說明模型控制哪個說話者。角色卡範例保持短小,刪掉要求模型同時替使用者、旁白和角色寫作的指令。

社群評論提到自然對話、角色一致性和語氣遵循,也有人遇到回覆過長、敘述不均、替使用者說話或 swipe 後重複錯誤。這些是症狀,不是受控評測。

症狀 → 檢查 → 修復

排查真正失敗的那一層

重複同一條短提示,一次只改一個設定,才能把模板問題和模型、硬體問題分開。

症狀檢查下一步
空回覆或標記洩露endpoint、Mistral 模板負責人、`/think` 開關和 stop string。傳送一行短提示,只保留一個模板負責人,先清理洩露標記。
模型替 {{user}} 說話角色卡範例、system prompt 和上一則 assistant 訊息。寫清說話邊界,縮短範例,用兩選一場景測試。
回覆很長且重複上下文、重複 lore、最大 token 和採樣。精簡角色卡,降低回覆預算,再一次改一個採樣值。
速度慢或當機量化大小、GPU offload、RAM/顯存餘量和上下文。換小量化或縮短上下文,每次改變後比較 tokens/sec。
行為和模型卡不符v4.2/v4.1、safetensors/GGUF 和完整 model ID。重新複製儲存庫 ID,按準確檔案的模型卡設定。

TABBIT 資料工作台

把角色卡、量化檔案和筆記放在一起

Tabbit 不執行 Skyfall,也不取代 SillyTavern。它適合處理模型卡、GGUF tree 和社群討論分散在多個頁面的情況。

  1. 1

    開啟來源分頁

    把官方模型卡、GGUF tree 和 SillyTavern 文件放在一起,讓 Tabbit 只擷取 ID、大小和模板說明。

  2. 2

    用 @ 帶入上下文

    用 @ 引用頁面、截圖或本地筆記,讓 Tabbit 產生標注已確認事實與待查問題的清單。

  3. 3

    修改前先比較

    用多模型對話比較設定說明。Tabbit 整理證據,本地後端仍是 Skyfall 執行的位置。

Tabbit Deep Research 將搜尋結果和執行步驟並列顯示。
Tabbit 在來源文章旁顯示 AI 摘要側欄。
Tabbit 多模型對話並列顯示同一問題的多份回答。
Tabbit Agent 在 Google Sheets 中操作頁面,右側顯示執行步驟。

選擇合適的工具

SillyTavern 執行聊天,Tabbit 整理證據

兩者解決不同環節。把生成控制留在 SillyTavern,用 Tabbit 減少在資料頁面之間切換。

SillyTavern + 後端Tabbit
本地執行 Skyfall可以,需要相容後端不作此承諾
角色卡和採樣細緻控制參考筆記
閱讀模型和量化卡切換分頁或應用程式@ 頁面、檔案和截圖
比較設定說明切換預設或 endpoint比較可用模型
硬體排錯觀察顯存、offload 和速度收集證據

常見問題

Skyfall 31B 與 SillyTavern 問答

本指南對應哪個 Skyfall 31B?+

TheDrummer/Skyfall-31B-v4.2。舊版 v4.1 或其他包含 Skyfall 名稱的專案可能使用不同模板和行為。

Skyfall v4.2 基於什麼?+

模型卡中繼資料將 mistralai/Magistral-Small-2509 列為 base。請複製完整 ID,不要只依賴搜尋標籤。

該下載哪個量化?+

官方 GGUF tree 中 Q4_K_M 約 18.98 GB,適合做起點。根據執行時開銷測試 Q3 或 Q5。

Skyfall 使用什麼 chat template?+

模型卡列出 Mistral v7 Tekken,定製模板還會檢查 system prompt 中的 /think。請確認後端如何處理這個開關。

Tabbit 會執行 Skyfall 31B 嗎?+

本頁不作此承諾。Tabbit 用來整理模型卡、量化檔案和比較資料。請透過相容的本地後端執行模型,再將後端接入 SillyTavern。

把 model ID 當作第一項設定

確認 v4.2,選擇量化,讓 Mistral 格式只有一個負責人,再用短場景調參。資料分散在不同頁面和檔案時,用 Tabbit 收攏它們。

支援 macOS 和 Windows。Tabbit 的模型可用性會變化。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生瀏覽器。