Gemma 4 31B × SillyTavern

Gemma 4 31B 接入 SillyTavern

想用 Gemma 4 31B 跑角色对话,先把官方型号和社区量化文件分开。然后按接口、chat template、tokenizer、thinking 标记的顺序检查。

Google DeepMind 官方页面
核对官方型号与模板
Tabbit 桌面端新标签页,左侧有垂直标签,中间是输入框,右侧是聊天面板。

先认清模型

Gemma 4 是一组型号,不是一份 SillyTavern 预设

Google 列出 E2B、E4B、12B、26B A4B 和 31B。26B A4B 是混合专家模型,31B 是 dense 模型。Q4、Q6 是量化版本,不是新的官方型号。

01

选 26B A4B 还是 31B?

结合 model card 和自己的硬件决定。26B A4B 只激活部分参数,运行可能更轻;31B 通常更吃内存。两者架构不同,别只拿数字硬比。

02

本地、供应商还是 API

Ollama、LM Studio、KoboldCpp 和 llama.cpp server 经过模板和上下文的方式不同。OpenRouter 等 API 可能更省事,但模型 ID 和 alias 要以供应商列表为准。

03

角色扮演也是设置测试

贴不贴角色卡,除了 checkpoint,还取决于系统提示、采样和上下文。社区有人用 DRY 和预设减少复读,但那只是起点,不是官方默认值。

SillyTavern 路径

按这个顺序接,出错更容易定位

一层一层改,不要一次换完所有参数。这样一条坏回复到底是哪一层出了问题,会清楚很多。

  1. 01

    1. 先确认接口

    选择对应后端的连接器,并确认列表里有准确的 Gemma 4 checkpoint。用供应商时直接复制 model slug,不要凭记忆输入 alias。

  2. 02

    2. 选择 Chat Completions

    API 或本地服务支持时,先用 Chat Completions。Text Completion 也可能可用,但要自己处理更多模板细节,旧格式更容易混进来。

  3. 03

    3. 对齐 tokenizer 和模板

    使用后端提供的 Gemma 4 或 Gemini tokenizer/template。旧的 Gemma 模板可能把 header 和 thinking 标记放错位置。

  4. 04

    4. 再加角色卡和预设

    先载入角色卡,再加克制的系统提示。社区预设一次只试一份,保留作者原文件,并记下自己改了什么。

FF、Moonlight 等名字来自社区讨论,不是 Google 默认值。本页不转载预设文件。

回复不对时

哪一层坏了,就修哪一层

CASE 01

thinking 文本无法解析

先检查模型模板、tokenizer 和 thinking 设置。Reddit 有人建议在系统提示前放 <|think|>,但这取决于后端,模板不匹配时反而会出现原样 token。

CASE 02

它有时思考,有时不思考

供应商和本地版本暴露 reasoning 的方式可能不同。不要盲加标记。用短请求分别测试 thinking 开关,再对照供应商或 model card 说明。

CASE 03

角色复读或跑偏

先减少上下文噪音,再动温度。删掉重复的卡片内容,确认上下文上限,然后尝试社区 sampler 或 DRY。Temperature 1.0、Top-K 64、Top-P 0.95 是 Reddit 上的经验值,不是硬规则。

浏览器路径

角色页留在眼前,旁边直接问

Tabbit 不替代 SillyTavern 的角色卡和 lorebook。它解决的是另一段流程:一边看 wiki、文档或参考页,一边在浏览器里和当前可用模型聊天。

  1. 1

    安装 Tabbit

    下载 macOS 或 Windows 版 Chromium AI 浏览器。这条路径不需要本地模型文件或 SillyTavern 服务。

  2. 2

    只选当前列表里的模型

    安装后打开模型选择器,选实际显示的模型,例如 GPT-5.4、GPT-5.2-Chat 或 Gemini-3-Flash。列表会变,选择器才是准的。

  3. 3

    引用打开的页面

    让角色 wiki 或设定文档留在标签页里。用 @ 引用页面、截图或文件,要求模型整理设定、记场景或给第二种写法。

Tabbit 新标签页模型选择器,显示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。截图里看不到 Gemma 4。

选对工具

SillyTavern 还是 Tabbit?

看你卡在哪里。浏览器捷径不是角色卡管理器,本地前端也不代表模型自动更好。

SillyTavernTabbit
角色卡和 lorebook内置开着来源页面
本地 Gemma 4 checkpoint自己准备后端选模型列表里的当前项
模板和采样控制由所选模型管理
网页上下文粘贴或扩展@ 当前标签或文件
第一条可用回复安装 + 接口 + 预设安装 + 选择已列模型
Tabbit 新标签页模型选择器,显示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。截图里看不到 Gemma 4。

引用打开的页面

让角色 wiki 或设定文档留在标签页里。用 @ 引用页面、截图或文件,要求模型整理设定、记场景或给第二种写法。

Tabbit 新标签页模型选择器,显示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6。截图里看不到 Gemma 4。

网页上下文

@ 当前标签或文件

常见问题

Gemma 4 和 SillyTavern,直接回答

Gemma 4 26B 和 31B 是同一个模型吗?+

不是。Google 将 26B A4B 描述为混合专家模型,31B 是 dense。按 model card 和你手头的硬件选择。

Gemma 4 该下载哪种量化?+

没有通用答案。根据内存、上下文需求和发布者 model card 在 Q4、Q5、Q6 中选。量化文件不是新的官方 Gemma 名称。

为什么 thinking token 会直接显示?+

tokenizer、模板、后端或供应商对格式的理解可能不一致。先核对这些,再尝试 <|think|>;标记放错模板会让输出更乱。

Tabbit 能运行 Gemma 4 吗?+

不要默认它能。安装后打开当前模型选择器,只使用实际列出的模型。本页截图里没有 Gemma 4。

Tabbit 能替代 SillyTavern 吗?+

不能。角色卡、lorebook 和细致预设控制仍适合 SillyTavern。Tabbit 适合对着网页和文件聊天。

别再修错层

要本地 Gemma 4,就照 model card 检查模板链。想马上对着角色 wiki 聊,就安装 Tabbit,从当前模型选择器里选可用项。

支持 macOS 和 Windows,模型列表可能变化。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生浏览器。