thinking 标记直接漏到回复里
先检查 instruct 或 chat template、tokenizer 和 reasoning 模式,再动温度。像 <|think|> 这样的标记放错格式,就会变成原样文本。
Gemma 4 × SillyTavern 设置
Gemma 4 回复不对,不一定需要换一套预设。按模型 ID、chat template、系统角色、上下文预算和采样器的顺序检查。这页给的是可复现的基线,不是万能配方。

先看症状
先分清格式错误和采样选择。最快的修复,通常是能解释症状的最小改动。
先检查 instruct 或 chat template、tokenizer 和 reasoning 模式,再动温度。像 <|think|> 这样的标记放错格式,就会变成原样文本。
检查 response token 上限和剩余上下文窗口。长角色卡加历史消息后,可能没有足够空间生成回复。
查重复的角色卡内容、过满的上下文和过强的复读控制。先用干净提示测试,再一次改一个采样器。
模型与内存
Google 将 26B A4B 描述为 mixture-of-experts,31B 为 dense。MoE 每个 token 激活的参数更少,但权重仍要加载。量化和上下文长度会改变实际内存成本。
| Model | Profile | Memory note | Fit |
|---|---|---|---|
| 26B A4B | 混合专家模型,每个 token 激活 4B | Google 估算 Q4_0 权重约 14.4 GB,未计上下文开销 | 后端支持对应格式时,可作为本地候选 |
| 31B | Dense 模型 | Google 估算 Q4_0 权重约 17.5 GB,未计上下文开销 | 确认内存和响应速度能接受再选 |
| Q4、Q5、Q6 | 量化文件,不是新的官方型号 | 低精度可能省内存,但会带来质量和速度取舍 | 遵循发布者 model card 和后端格式 |
这些是加载权重的近似值。还要为运行时、KV cache 和所选上下文长度留空间。
连接链
把每一层当作独立检查点。症状在哪次改动后出现,就知道该回头看哪里。
Setting
连接器、服务器地址和准确 checkpoint slug
Baseline / watch
使用供应商或后端显示的 ID
错误 alias、旧模型或不支持的量化格式
Setting
Chat Completions、Text Completion 和模板
Baseline / watch
服务支持时先从 Chat Completions 开始
header 或 thinking 标记变成普通文本
Setting
system message 及其位置
Baseline / watch
保持简短明确,并与角色卡分开
后端忽略或重复 system message
Setting
context tokens 和最大 response tokens
Baseline / watch
载入长历史前先给回复留空间
回复截断、忘记细节或内存升高
Setting
温度、Top P、Top K、Min P 和复读控制
Baseline / watch
从中性起点开始,每次改一个值
复读、平淡或角色声音不稳定
采样基线
Google 和社区指南常从 Temperature 1.0、Top P 0.95、Top K 64 附近开始。SillyTavern 对每项控制有独立定义。把它们当作第一次测试,不要当成最佳预设。
第一次测试
SillyTavern 对不同控制项使用不同的禁用值。后端也可能提供不同范围,请同时看提示和服务器文档。
使用一条短提示、同一张卡和同一份上下文。保存输出,后面的改动才有可比较的对象。
回复太平时,小幅调高温度;太乱时,小幅调低。测试期间固定 Top P 和 Top K。
一次只改 Top P 或 Top K。SillyTavern 中 Min P 为 0 时禁用,后端支持时再用低值测试。
先查重复上下文。Repetition penalty 为 1、DRY multiplier 为 0 时禁用。过强的值会惩罚普通词,让文风变僵。
排错地图
重新核对准确的模型模板、tokenizer 和 reasoning 模式。后端支持时试试 Chat Completions。确认格式前,不要直接把标记塞进提示。
先检查上下文使用量,再增加 response tokens。先删重复的 lore 或角色卡内容。更大的上下文窗口也会增加 KV cache 内存。
检查重复消息和上下文边界。先回到 repetition penalty 1、DRY 0,再试一个适度的控制项,不要叠加多个惩罚。
比较文件时固定后端、角色卡和采样器。记录量化后缀、上下文长度和生成速度。Q4 文件不能直接代表 BF16 运行。
另一条路径
Tabbit 是支持 macOS 和 Windows 的 Chromium AI 浏览器。它不运行本地 Gemma checkpoint,也不替代 SillyTavern 角色卡。需要读网页、截图或文件并在旁边提问时,它更合适。
下载桌面浏览器并打开新标签页。官网列出 macOS 12+ 和 Windows 10+ 支持。
只选择已安装 Tabbit 中实际列出的模型。列表会变化。本页不声称 Gemma 4 当前可用。
让角色 wiki、提示笔记或文档留在标签页里。用 @ 引用页面、截图或本地文件,再要求整理、总结或给第二版草稿。



选择工作流
看任务选择路径。本地适合精细控制模型和角色卡,网页本身是上下文时用 Tabbit。
| SillyTavern + 本地后端 | Tabbit | |
|---|---|---|
| Checkpoint 和量化 | 自己选择并加载 | 选择当前模型列表里的项 |
| 模板和采样器 | 细粒度控制 | 由所选模型管理 |
| 角色卡和 lorebook | 核心工作流 | 打开来源页面 |
| 网页、截图和文件上下文 | 粘贴或配置扩展 | @ 当前标签或文件 |
| 第一步诊断 | 模型 ID → 模板 → 上下文 → 采样 | 打开、引用、提问 |

采样基线
SillyTavern 对不同控制项使用不同的禁用值。后端也可能提供不同范围,请同时看提示和服务器文档。
常见问题
先用 Temperature 1.0、Top P 0.95、Top K 64,并将 Min P 设为 0、repetition penalty 设为 1、DRY multiplier 设为 0。这些是起点,一次只改一个值。
两者架构不同。Google 将 26B A4B 描述为 MoE,31B 为 dense。结合 model card、近似权重内存、上下文预算和后端决定。
模型模板、tokenizer、后端和 reasoning 模式可能不一致。加 <|think|> 之前先核对这四项。
它们共用请求预算,更大的总上下文也需要更多 KV cache 内存。SillyTavern 发送的上下文会扣除 response allowance。
本页不做这个承诺。安装后只使用当前选择器里实际列出的模型。Tabbit 负责网页和文件上下文,SillyTavern 仍适合本地角色卡和采样控制。
本地 Gemma 4 要把 model card、模板和上下文链放在一起核对。围绕网页工作时,安装 Tabbit,从当前选择器选择模型。
支持 macOS 和 Windows,模型可用性可能变化。