官方 3.2 instruct
`mistralai/Mistral-Small-3.2-24B-Instruct-2506` 是 3.1 的小版本更新,官方模型卡提到指令遵循、覆誦和 function calling 有改善。
MISTRAL 24B × SILLYTAVERN
「Mistral 24B」可能指 Mistral Small 3.2、較早的 3.1,或 Magistry 這類社群 RP merge。這些檔案不共用預設模板和取樣值。先確認型號,再逐層接入 SillyTavern。

先看 MODEL ID
修改設定前先記下儲存庫或供應商的完整 slug,避免把 3.2 模板套到 3.1 檔案,也不會把社群 merge 當成官方 checkpoint。
`mistralai/Mistral-Small-3.2-24B-Instruct-2506` 是 3.1 的小版本更新,官方模型卡提到指令遵循、覆誦和 function calling 有改善。
`mistralai/Mistral-Small-3.1-24B-Instruct-2503` 是另一個 2025 年 3 月的 checkpoint,不要從 3.2 推測它的模板或行為。
Magistry、Cydonia、Magidonia 等是微調或 merge,請以各自模型卡的授權、提示格式和取樣說明為準。
base 和 instruct 是不同 checkpoint。GGUF、AWQ 與 Q4/Q5/Q6 是格式或量化,不是新的官方 Mistral 型號。
清楚的設定路徑
SillyTavern 是聊天前端,模型仍需要本機伺服器或供應商端點。依硬體和隱私需求選擇路徑。
官方 3.2 模型卡記錄 BF16/FP16 約需 55GB GPU 記憶體。較小的 GGUF 量化會用速度和品質換記憶體,先看檔案大小和上下文限制。
Mistral 建議 vLLM 0.9.1 以上與 `mistral_common` 1.6.2 以上,依模型卡使用 Mistral tokenizer、config、load 格式和準確 ID。
供應商若提供該 checkpoint,請複製準確的 model slug 和 endpoint。只看到「Mistral 24B」不足以決定 SillyTavern 模板。
後端接受 role messages 時使用 Chat Completion。只有後端和模型卡指定文字格式時才使用 Text Completion,並仔細設定 endpoint、API key、模型名稱和上下文。
角色扮演調校
模板錯誤會看起來像模型能力不足。先修格式與上下文,再用可重複的短測試調整生成。
盡量讓 tokenizer 或服務堆疊套用模型 chat template。回覆出現 `<s>`、角色標記或工具 token 時,先修格式。
分開固定事實、目前目標和臨時場景狀態,刪除重複 lore 及要求模型替使用者寫作的衝突指令。
先用模型卡或微調卡的數值。官方 3.2 卡對一般用途建議較低 temperature,例如 0.15;RP 微調可能有不同建議。
Llama 或 ChatML 的 stop string 可能截斷 Mistral 回覆或露出標記,請使用 checkpoint 的準確建議並測試兩輪對話。
社群討論提到替使用者說話、敘述異常、空回覆、覆誦和量化速度慢。這些是症狀,不代表所有 Mistral 24B 檔案都一樣。
症狀 → 檢查 → 修復
一次只改一個變數,保存結果並重跑同一條短提示。最快的修復通常是名稱、endpoint 或模板不匹配。
| 症狀 | 檢查 | 下一步 |
|---|---|---|
| 空回覆或 null | endpoint 狀態、model slug、上下文模板和 stop string。 | 先發一條短訊息,再換成後端提供的準確 Mistral 模板。 |
| 角色標記出現在正文 | chat template 由 SillyTavern、伺服器還是 tokenizer 套用? | 只保留一個模板負責者,刪除重複格式並查看原始 prompt。 |
| 模型替使用者寫話 | 角色卡指令和示例對話。 | 說清楚使用者主動權,刪除衝突示例,以短選擇題測試。 |
| 覆誦或循環 | 重複 lore、上下文長度、取樣和量化檔案。 | 減少提示噪音,回到卡片基線,一次只改一個取樣值。 |
| 速度很慢或逐漸下降 | 量化類型、GPU offload、RAM/顯存壓力和上下文長度。 | 將檔案需求與硬體比較,部分 CPU offload 可能明顯慢於全 GPU。 |
| 行為和預期不同 | base/instruct、3.1/3.2、官方/社群儲存庫。 | 把完整 ID 寫入筆記,再依該儲存庫的模型卡重新設定。 |
資料工作區,不是 RUNNER
Tabbit 不取代 SillyTavern,也不執行這個本機 checkpoint。本頁檢查時 Tabbit 公開模型目錄沒有列出 Mistral。你可以用它收集模型卡、比較量化檔、保存提示筆記和閱讀社群討論。
把準確 ID、硬體說明和模板指令放在眼前,確認官方 checkpoint 後再加入社群微調卡。
用 @ 把頁面、截圖或本地筆記帶進提示,讓模型產生保留 model ID、標出未知假設的檢查清單。
Tabbit 可以比較選擇器中實際可用的模型並整理來源差異。清單會變動,安裝後請重新確認。





選對工作面
兩種工具解決不同問題。SillyTavern 負責角色卡、取樣和後端,Tabbit 適合跨網頁和檔案整理資料。
| SillyTavern + 後端 | Tabbit | |
|---|---|---|
| 本機執行 Mistral 24B | 可以,需要相容伺服器 | 不作承諾 |
| 角色卡和取樣 | 細緻控制 | 引用筆記和角色卡 |
| 官方與社群資料 | 貼上或切換應用程式 | @ 分頁、檔案和頁面 |
| 模型比較 | 切換 endpoint 或 preset | 比較選擇器中的模型 |
| 硬體診斷 | 顯存、offload、tokens/sec | 整理證據 |
常見問題
通常指 240 億參數的 Mistral Small checkpoint,但搜尋結果也可能指 3.1、3.2、量化檔案和社群 RP merge,請使用完整儲存庫 ID。
本頁對應的官方頁面是 `mistralai/Mistral-Small-3.2-24B-Instruct-2506`,它是 3.1 的小版本更新,請以伺服器或供應商實際提供的版本為準。
3.1 公告稱可在單張 RTX 4090 或 32GB Mac 執行;3.2 模型卡記錄 BF16/FP16 約需 55GB GPU 記憶體。量化檔案需求不同,必須查看實際檔案。
依後端和模型卡決定。SillyTavern 文件說明,差異在於訊息如何組成 prompt,不在於本地或雲端。
依序檢查 model ID、chat template、重複角色卡和 sampler。社群回報有這些症狀,但前端不匹配也會造成相同結果。
不要預設可以。本頁檢查時 Tabbit 公開模型目錄沒有顯示 Mistral,這裡推薦 Tabbit 用於資料收集、比較和瀏覽器研究。
先確認準確的 Mistral ID,接好服務層,再用短測試調整 SillyTavern。模型卡、量化頁和社群討論散落各處時,用 Tabbit 收攏資料。
支援 macOS 和 Windows,Tabbit 模型清單可能變動。