選 26B A4B 還是 31B?
依照 model card 和自己的硬體來決定。26B A4B 只啟用部分參數,執行時可能比較省資源;31B 通常需要更多記憶體。兩者架構不同,不要只看數字比較。
Gemma 4 31B × SillyTavern
想用 Gemma 4 31B 跑角色對話,先把官方型號和社群量化檔分開。接著依序檢查介面、chat template、tokenizer 和 thinking 標記。
核對官方型號與模板 ↗
先認清模型
Google 列出 E2B、E4B、12B、26B A4B 和 31B。26B A4B 是混合專家模型,31B 是 dense 模型。Q4、Q6 是量化版本,不是新的官方型號。
依照 model card 和自己的硬體來決定。26B A4B 只啟用部分參數,執行時可能比較省資源;31B 通常需要更多記憶體。兩者架構不同,不要只看數字比較。
Ollama、LM Studio、KoboldCpp 和 llama.cpp server 處理模板與上下文的方式不同。使用 OpenRouter 等 API 可能比較省事,但模型 ID 和 alias 要以供應商清單為準。
角色卡、system prompt、採樣方式和上下文都會影響結果,不只是 checkpoint。社群有人用 DRY 和預設來減少覆誦,但那只是起點,不是官方預設值。
SillyTavern 路徑
一次只改一層,不要同時換掉所有參數。這樣才能看出一則錯誤回覆究竟是哪一層出了問題。
選擇符合後端的連接器,確認清單中有準確的 Gemma 4 checkpoint。使用供應商時,直接複製它提供的 model slug,不要憑記憶輸入 alias。
API 或本地服務支援時,先使用 Chat Completions。Text Completion 也可能可用,但需要自行處理更多模板細節,舊格式更容易混進來。
使用後端提供的 Gemma 4 或 Gemini tokenizer/template。舊版 Gemma 模板可能會把 header 和 thinking 標記放在錯誤的位置。
先載入角色卡,再加入簡潔的 system prompt。社群預設一次只試一份,保留作者原始檔案,也記下自己改了哪些地方。
FF、Moonlight 等名稱來自社群討論,不是 Google 預設值。本頁不轉載預設檔案。
回覆不對時
先檢查模型模板、tokenizer 和 thinking 設定。Reddit 上有人建議在系統提示前放入 <|think|>,但這取決於後端;模板不相容時,反而會顯示原始 token。
供應商和本地版本呈現 reasoning 的方式可能不同。不要直接硬加標記。用簡短請求分別測試 thinking 開關,再對照供應商或 model card 的說明。
先減少上下文雜訊,再調整 temperature。刪除重複的角色卡內容,確認上下文上限,接著試試社群 sampler 或 DRY。Temperature 1.0、Top-K 64、Top-P 0.95 是 Reddit 上的經驗值,並非硬性規則。
瀏覽器路徑
Tabbit 不取代 SillyTavern 的角色卡和 lorebook。它處理的是另一段流程:一邊看 wiki、文件或參考頁,一邊在瀏覽器裡和目前可用的模型聊天。
下載 macOS 或 Windows 版 Chromium 瀏覽器。這條路徑不需要本地模型檔案或 SillyTavern 伺服器。
安裝後開啟模型選擇器,選擇實際顯示的模型,例如 GPT-5.4、GPT-5.2-Chat 或 Gemini-3-Flash。清單可能變動,選擇器才是準確來源。
把角色 wiki 或設定文件留在分頁中。使用 @ 引用頁面、螢幕截圖或檔案,請模型整理設定、記下場景重點,或提供另一種寫法。

選對工具
看你卡在哪裡。瀏覽器捷徑不是角色卡管理器,本地前端也不代表模型會自動變好。
| SillyTavern | Tabbit | |
|---|---|---|
| 角色卡和 lorebook | 內建 | 開著來源頁面 |
| 本地 Gemma 4 checkpoint | 自行準備後端 | 選擇模型清單中的項目 |
| 模板和採樣控制 | 細緻 | 由所選模型管理 |
| 網頁上下文 | 貼上或使用擴充功能 | @ 目前分頁或檔案 |
| 第一則可用回覆 | 安裝 + 端點 + 預設 | 安裝 + 選擇清單中的模型 |

把角色 wiki 或設定文件留在分頁中。使用 @ 引用頁面、螢幕截圖或檔案,請模型整理設定、記下場景重點,或提供另一種寫法。

@ 目前分頁或檔案
常見問題
不是。Google 將 26B A4B 描述為混合專家模型,31B 則是 dense。請依照 model card 和手上的硬體選擇。
沒有適用所有人的答案。根據可用記憶體、上下文需求和發佈者的 model card,在 Q4、Q5、Q6 中選擇。量化檔案不是新的官方 Gemma 名稱。
tokenizer、模板、後端或供應商對格式的理解可能不一致。先核對這些部分,再嘗試 <|think|>;標記放錯模板只會讓輸出更亂。
不要預設它能執行。安裝後開啟目前的模型選擇器,只使用實際列出的模型。本頁截圖中沒有 Gemma 4。
不能。角色卡、lorebook 和細緻的預設控制仍然適合 SillyTavern。Tabbit 適合對著網頁和檔案聊天。
要在本地執行 Gemma 4,就照著 model card 檢查模板鏈。想馬上對著角色 wiki 聊,就安裝 Tabbit,從目前的模型選擇器中挑選可用模型。
支援 macOS 和 Windows,模型清單可能變動。