Gemma 4 31B × SillyTavern

Gemma 4 31B 接入 SillyTavern

想用 Gemma 4 31B 跑角色對話,先把官方型號和社群量化檔分開。接著依序檢查介面、chat template、tokenizer 和 thinking 標記。

Google DeepMind 官方頁面
核對官方型號與模板
Tabbit 桌面版新分頁,左側有垂直分頁,中間是輸入框,右側是聊天面板。

先認清模型

Gemma 4 是一組型號,不是一份 SillyTavern 預設

Google 列出 E2B、E4B、12B、26B A4B 和 31B。26B A4B 是混合專家模型,31B 是 dense 模型。Q4、Q6 是量化版本,不是新的官方型號。

01

選 26B A4B 還是 31B?

依照 model card 和自己的硬體來決定。26B A4B 只啟用部分參數,執行時可能比較省資源;31B 通常需要更多記憶體。兩者架構不同,不要只看數字比較。

02

本地、供應商還是 API?

Ollama、LM Studio、KoboldCpp 和 llama.cpp server 處理模板與上下文的方式不同。使用 OpenRouter 等 API 可能比較省事,但模型 ID 和 alias 要以供應商清單為準。

03

角色扮演也是設定測試

角色卡、system prompt、採樣方式和上下文都會影響結果,不只是 checkpoint。社群有人用 DRY 和預設來減少覆誦,但那只是起點,不是官方預設值。

SillyTavern 路徑

照這個順序接,出錯更容易定位

一次只改一層,不要同時換掉所有參數。這樣才能看出一則錯誤回覆究竟是哪一層出了問題。

  1. 01

    1. 先確認端點

    選擇符合後端的連接器,確認清單中有準確的 Gemma 4 checkpoint。使用供應商時,直接複製它提供的 model slug,不要憑記憶輸入 alias。

  2. 02

    2. 選擇 Chat Completions

    API 或本地服務支援時,先使用 Chat Completions。Text Completion 也可能可用,但需要自行處理更多模板細節,舊格式更容易混進來。

  3. 03

    3. 對齊 tokenizer 和模板

    使用後端提供的 Gemma 4 或 Gemini tokenizer/template。舊版 Gemma 模板可能會把 header 和 thinking 標記放在錯誤的位置。

  4. 04

    4. 再加入角色卡和預設

    先載入角色卡,再加入簡潔的 system prompt。社群預設一次只試一份,保留作者原始檔案,也記下自己改了哪些地方。

FF、Moonlight 等名稱來自社群討論,不是 Google 預設值。本頁不轉載預設檔案。

回覆不對時

哪一層壞了,就修哪一層

CASE 01

thinking 文字無法解析

先檢查模型模板、tokenizer 和 thinking 設定。Reddit 上有人建議在系統提示前放入 <|think|>,但這取決於後端;模板不相容時,反而會顯示原始 token。

CASE 02

它有時思考,有時不思考

供應商和本地版本呈現 reasoning 的方式可能不同。不要直接硬加標記。用簡短請求分別測試 thinking 開關,再對照供應商或 model card 的說明。

CASE 03

角色覆誦或跑偏

先減少上下文雜訊,再調整 temperature。刪除重複的角色卡內容,確認上下文上限,接著試試社群 sampler 或 DRY。Temperature 1.0、Top-K 64、Top-P 0.95 是 Reddit 上的經驗值,並非硬性規則。

瀏覽器路徑

角色頁留在眼前,旁邊直接問

Tabbit 不取代 SillyTavern 的角色卡和 lorebook。它處理的是另一段流程:一邊看 wiki、文件或參考頁,一邊在瀏覽器裡和目前可用的模型聊天。

  1. 1

    安裝 Tabbit

    下載 macOS 或 Windows 版 Chromium 瀏覽器。這條路徑不需要本地模型檔案或 SillyTavern 伺服器。

  2. 2

    只選目前清單裡的模型

    安裝後開啟模型選擇器,選擇實際顯示的模型,例如 GPT-5.4、GPT-5.2-Chat 或 Gemini-3-Flash。清單可能變動,選擇器才是準確來源。

  3. 3

    引用已開啟的頁面

    把角色 wiki 或設定文件留在分頁中。使用 @ 引用頁面、螢幕截圖或檔案,請模型整理設定、記下場景重點,或提供另一種寫法。

Tabbit 新分頁的模型選擇器,顯示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。截圖中看不到 Gemma 4。

選對工具

SillyTavern 還是 Tabbit?

看你卡在哪裡。瀏覽器捷徑不是角色卡管理器,本地前端也不代表模型會自動變好。

SillyTavernTabbit
角色卡和 lorebook內建開著來源頁面
本地 Gemma 4 checkpoint自行準備後端選擇模型清單中的項目
模板和採樣控制細緻由所選模型管理
網頁上下文貼上或使用擴充功能@ 目前分頁或檔案
第一則可用回覆安裝 + 端點 + 預設安裝 + 選擇清單中的模型
Tabbit 新分頁的模型選擇器,顯示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。截圖中看不到 Gemma 4。

引用已開啟的頁面

把角色 wiki 或設定文件留在分頁中。使用 @ 引用頁面、螢幕截圖或檔案,請模型整理設定、記下場景重點,或提供另一種寫法。

Tabbit 新分頁的模型選擇器,顯示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。截圖中看不到 Gemma 4。

網頁上下文

@ 目前分頁或檔案

常見問題

Gemma 4 和 SillyTavern,直接回答

Gemma 4 26B 和 31B 是同一個模型嗎?+

不是。Google 將 26B A4B 描述為混合專家模型,31B 則是 dense。請依照 model card 和手上的硬體選擇。

Gemma 4 該下載哪種量化?+

沒有適用所有人的答案。根據可用記憶體、上下文需求和發佈者的 model card,在 Q4、Q5、Q6 中選擇。量化檔案不是新的官方 Gemma 名稱。

為什麼 thinking token 會直接顯示?+

tokenizer、模板、後端或供應商對格式的理解可能不一致。先核對這些部分,再嘗試 <|think|>;標記放錯模板只會讓輸出更亂。

Tabbit 能執行 Gemma 4 嗎?+

不要預設它能執行。安裝後開啟目前的模型選擇器,只使用實際列出的模型。本頁截圖中沒有 Gemma 4。

Tabbit 能取代 SillyTavern 嗎?+

不能。角色卡、lorebook 和細緻的預設控制仍然適合 SillyTavern。Tabbit 適合對著網頁和檔案聊天。

別再修錯層

要在本地執行 Gemma 4,就照著 model card 檢查模板鏈。想馬上對著角色 wiki 聊,就安裝 Tabbit,從目前的模型選擇器中挑選可用模型。

支援 macOS 和 Windows,模型清單可能變動。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生瀏覽器。