使用正確的模型 ID
Hugging Face 模型卡中的指令版本 ID 是 `google/gemma-4-26B-A4B-it`。Q4、Q5、Q6 是量化分發,不是 Google 新的模型家族。
Gemma 4 uncensored × SillyTavern
uncensored 不是 Google 公布的 Gemma 4 型號。它可能是社群微調、去拒答 checkpoint、供應商標籤,或只是使用者對角色扮演體驗的描述。先核對模型卡、基座、許可、模板與供應商政策,再判斷拒答或出戲的原因。
核對官方模型資訊 ↗
先確認名稱與硬體
Google 的正式名稱是 Gemma 4 26B A4B。模型卡列出 252 億總參數、38 億 active parameters、30 層、圖片輸入與 256K context。社群 GGUF 檔名中的 IT、Q4、Q5 或作者名稱都是發佈標籤。
Hugging Face 模型卡中的指令版本 ID 是 `google/gemma-4-26B-A4B-it`。Q4、Q5、Q6 是量化分發,不是 Google 新的模型家族。
active 參數可以解釋速度,但不代表每個檔案都是 4 GB。權重、runtime buffer、約 5.5 億參數的 vision encoder、KV cache 和 context 長度都會佔用記憶體。
31B 是約 307 億參數的 dense 模型。26B A4B 會把 token 路由到 experts。為 31B 寫的量化或硬體估算不一定適用。
SillyTavern 連線順序
逐層測試,才知道問題來自 template、sampler、社群微調行為還是角色卡。
記錄完整的社群模型 ID、基座 checkpoint、變體、量化檔案與模型卡連結。不要把 uncensored 標籤或 `gemma-4-26b` 記憶輸入當成官方身份。
KoboldCpp、llama.cpp、LM Studio 與 OpenAI 相容供應商的 endpoint 各不相同。支援時先使用 Chat Completions,Text Completion 需要自行管理更多格式。
Google 格式使用 `system`、`user`、`model`、`<|turn>` 與 `<turn|>`。採用 backend 提供的 Gemma 4 或 Gemini tokenizer 與 chat template,不要換回 Gemma 3 模板。
Google 說明可在 system prompt 開頭加入 `<|think|>` 開啟 thinking。先用短提示測試,再加入角色卡和 preset。一般多輪歷史只保留最終答案。
社群討論提到 SillyTavern 1.17、KoboldCpp `--jinja`、Gemma4/Gemini tokenizer 和 `<|think|>`。這些是排錯線索,不是每個 backend 都適用的 Google 預設值。
回覆不對時
先檢查 tokenizer、chat template 與 backend 生成模式。若 backend 已經套用模板,手動加入控制 token 可能讓它原樣顯示。用一條短提示比較 thinking 開關。
確認 SillyTavern 與 loader 是否支援 Gemma 4 格式。社群方案可能使用 `--jinja` 或 `<|think|>`,但正確開關取決於伺服器。
先減少重複 context,再調整 temperature。確認 context 上限與角色卡,再把 temperature 1.0、top-p 0.95、top-k 64 當作測試起點。
瀏覽器替代路徑
Tabbit 不是本地 GGUF runner,也不是 SillyTavern 角色卡管理器。它適合讓角色頁、設定筆記或排錯討論留在眼前,同時和瀏覽器裡可用的模型對話。
下載 macOS 或 Windows 的 Chromium 瀏覽器。不需要本地 Gemma 檔案、供應商金鑰或 SillyTavern 伺服器。
安裝後開啟產品內的模型選擇器。目前程式列出 GPT-5.4、Gemini-3.1-Pro、Claude-Sonnet-4.6、DeepSeek-V4-Flash 等模型。當前 mapping 沒有 Gemma 4,因此本頁不保證 Tabbit 可執行 Gemma。
把 wiki 或設定筆記留在分頁,輸入 `@` 引用網頁、截圖或檔案,再請模型整理場景、檢查一致性或摘要剛比較的設定。

選擇前端
兩個工具處理不同問題。需要角色控制時保留專用前端,資料散落在網頁與檔案時使用瀏覽器路徑。
| SillyTavern | Tabbit | |
|---|---|---|
| 角色卡與 lorebook | 核心流程 | 引用來源頁面 |
| Gemma 4 本地 checkpoint | 自行準備 backend | 使用選擇器列出的模型 |
| 模板與 sampler | 細節控制 | 由所選模型管理 |
| 網頁 context | 貼上或使用擴充功能 | 用 @ 引用分頁或檔案 |
| 第一個有用回覆 | endpoint + 模板 + preset | 安裝 + 選擇清單模型 |

把 wiki 或設定筆記留在分頁,輸入 `@` 引用網頁、截圖或檔案,再請模型整理場景、檢查一致性或摘要剛比較的設定。

用 @ 引用分頁或檔案
常見問題
Google 模型卡稱它為 Gemma 4 26B A4B。Hugging Face 指令 checkpoint 是 `google/gemma-4-26B-A4B-it`,社群發佈者可能加上自己的後綴。
不相同。26B A4B 是 MoE,總參數 252 億、active parameters 約 38 億。Gemma 4 31B 是約 307 億參數的 dense 模型。
沒有單一安全數字。量化權重、KV cache、context、runtime buffer 和 vision encoder 都會影響需求。請用目標 context 測試實際 GGUF 或 backend。
tokenizer 或 template 可能和 backend 不一致,也可能是伺服器把控制 token 當成文字輸出。先檢查格式、tokenizer 和 thinking 設定。
不要直接假設。目前 Tabbit model mapping 沒有 Gemma 4。安裝後只使用目前選擇器實際顯示的模型。
社群 uncensored 模型請依序確認基座、模型卡、許可、量化、tokenizer 和 template。想在角色 wiki 或排錯資料旁聊天,安裝 Tabbit 並查看目前的模型選擇器。
支援 macOS 與 Windows。模型可用性可能改變。