thinking 標記直接漏到回覆裡
先檢查 instruct 或 chat template、tokenizer 和 reasoning 模式,再動溫度。像 <|think|> 這類標記放錯格式,就會變成原樣文字。
Gemma 4 × SillyTavern 設定
Gemma 4 回覆不對,不一定需要換一套預設。依序檢查模型 ID、chat template、系統角色、上下文預算和取樣器。這頁提供可重現的基線,不是萬用配方。

先看症狀
先分清格式錯誤和取樣選擇。最快的修復通常是能解釋症狀的最小改動。
先檢查 instruct 或 chat template、tokenizer 和 reasoning 模式,再動溫度。像 <|think|> 這類標記放錯格式,就會變成原樣文字。
檢查 response token 上限和剩餘上下文視窗。長角色卡加歷史訊息後,可能沒有足夠空間生成回覆。
查重複的角色卡內容、過滿的上下文和過強的覆誦控制。先用乾淨提示測試,再一次改一個取樣器。
模型與記憶體
Google 將 26B A4B 描述為 mixture-of-experts,31B 為 dense。MoE 每個 token 啟用的參數較少,但權重仍要載入。量化和上下文長度會改變實際記憶體成本。
| Model | Profile | Memory note | Fit |
|---|---|---|---|
| 26B A4B | 混合專家模型,每個 token 啟用 4B | Google 估算 Q4_0 權重約 14.4 GB,未計上下文開銷 | 後端支援對應格式時,可作為本地候選 |
| 31B | Dense 模型 | Google 估算 Q4_0 權重約 17.5 GB,未計上下文開銷 | 確認記憶體和回應速度能接受再選 |
| Q4、Q5、Q6 | 量化檔案,不是新的官方型號 | 低精度可能省記憶體,但會有品質和速度取捨 | 遵循發布者 model card 和後端格式 |
這些是載入權重的近似值。還要為執行時、KV cache 和所選上下文長度留空間。
連接鏈
把每一層當作獨立檢查點。症狀在哪次改動後出現,就知道該回頭看哪裡。
Setting
連接器、伺服器位址和準確 checkpoint slug
Baseline / watch
使用供應商或後端顯示的 ID
錯誤 alias、舊模型或不支援的量化格式
Setting
Chat Completions、Text Completion 和模板
Baseline / watch
服務支援時先從 Chat Completions 開始
header 或 thinking 標記變成普通文字
Setting
system message 及其位置
Baseline / watch
保持簡短明確,並與角色卡分開
後端忽略或重複 system message
Setting
context tokens 和最大 response tokens
Baseline / watch
載入長歷史前先給回覆留空間
回覆截斷、忘記細節或記憶體升高
Setting
溫度、Top P、Top K、Min P 和覆誦控制
Baseline / watch
從中性起點開始,每次改一個值
覆誦、平淡或角色聲音不穩定
取樣基線
Google 和社群指南常從 Temperature 1.0、Top P 0.95、Top K 64 附近開始。SillyTavern 對每項控制有獨立定義。把它們當作第一次測試,不要當成最佳預設。
第一次測試
SillyTavern 對不同控制項使用不同的停用值。後端也可能提供不同範圍,請同時看提示和伺服器文件。
使用一條短提示、同一張卡和同一份上下文。保存輸出,後面的改動才有可比較的對象。
回覆太平時,小幅調高溫度;太亂時,小幅調低。測試期間固定 Top P 和 Top K。
一次只改 Top P 或 Top K。SillyTavern 中 Min P 為 0 時停用,後端支援時再用低值測試。
先查重複上下文。Repetition penalty 為 1、DRY multiplier 為 0 時停用。過強的值會懲罰普通詞,讓文風變僵。
排錯地圖
重新核對準確的模型模板、tokenizer 和 reasoning 模式。後端支援時試試 Chat Completions。確認格式前,不要直接把標記塞進提示。
先檢查上下文使用量,再增加 response tokens。先刪重複的 lore 或角色卡內容。更大的上下文視窗也會增加 KV cache 記憶體。
檢查重複訊息和上下文邊界。先回到 repetition penalty 1、DRY 0,再試一個適度的控制項,不要疊加多個懲罰。
比較檔案時固定後端、角色卡和取樣器。記錄量化後綴、上下文長度和生成速度。Q4 檔案不能直接代表 BF16 執行。
另一條路徑
Tabbit 是支援 macOS 和 Windows 的 Chromium AI 瀏覽器。它不執行本地 Gemma checkpoint,也不取代 SillyTavern 角色卡。需要讀網頁、截圖或檔案並在旁邊提問時,它更合適。
下載桌面瀏覽器並開啟新分頁。官網列出 macOS 12+ 和 Windows 10+ 支援。
只選擇已安裝 Tabbit 中實際列出的模型。清單會變。本頁不聲稱 Gemma 4 目前可用。
讓角色 wiki、提示筆記或文件留在分頁裡。用 @ 引用頁面、截圖或本機檔案,再要求整理、摘要或給第二版草稿。



選擇工作流
看任務選擇路徑。本地適合精細控制模型和角色卡,網頁本身是上下文時用 Tabbit。
| SillyTavern + 本地後端 | Tabbit | |
|---|---|---|
| Checkpoint 和量化 | 自己選擇並載入 | 選擇目前模型清單中的項目 |
| 模板和取樣器 | 細粒度控制 | 由所選模型管理 |
| 角色卡和 lorebook | 核心工作流 | 開啟來源頁面 |
| 網頁、截圖和檔案上下文 | 貼上或設定擴充功能 | @ 目前分頁或檔案 |
| 第一步診斷 | 模型 ID → 模板 → 上下文 → 取樣 | 開啟、引用、提問 |

取樣基線
SillyTavern 對不同控制項使用不同的停用值。後端也可能提供不同範圍,請同時看提示和伺服器文件。
常見問題
先用 Temperature 1.0、Top P 0.95、Top K 64,並將 Min P 設為 0、repetition penalty 設為 1、DRY multiplier 設為 0。這些是起點,一次只改一個值。
兩者架構不同。Google 將 26B A4B 描述為 MoE,31B 為 dense。結合 model card、近似權重記憶體、上下文預算和後端決定。
模型模板、tokenizer、後端和 reasoning 模式可能不一致。加入 <|think|> 之前先核對這四項。
它們共用請求預算,更大的總上下文也需要更多 KV cache 記憶體。SillyTavern 傳送的上下文會扣除 response allowance。
本頁不做這個承諾。安裝後只使用目前選擇器中實際列出的模型。Tabbit 負責網頁和檔案上下文,SillyTavern 仍適合本地角色卡和取樣控制。
本地 Gemma 4 要把 model card、模板和上下文鏈放在一起核對。圍繞網頁工作時,安裝 Tabbit,從目前選擇器選擇模型。
支援 macOS 和 Windows,模型可用性可能變動。