Gemma 4 uncensored × SillyTavern

“Uncensored” 是需要核验的说法

在 SillyTavern 里,uncensored 可能指社区微调、去拒答 checkpoint、渠道标签,也可能只是用户对角色扮演体验的描述。它不是 Gemma 4 的官方变体。先核对模型卡、许可、模板和渠道政策,再判断是模型拒答还是场景配置出错。

Google 模型卡
查看 Google 的安全与模型事实
Tabbit 桌面浏览器显示竖向标签、中央提示框和右侧 AI 面板,方便把来源页面留在聊天旁边。

先看证据

把基础模型和标签分开

Google 发布 Gemma 4 的预训练与指令微调开放权重,并公开安全评估与使用限制。Hugging Face 上名为 Uncensored 的仓库属于社区发布,它的测试数量和质量说法属于作者,不能当成 Google 结论。

01

使用准确的模型 ID

指令版本在 Hugging Face 模型卡中的 ID 是 `google/gemma-4-26B-A4B-it`。Q4、Q5、Q6 表示量化分发,不是 Google 新建的模型系列。

02

显存要算上下文和运行时

active 参数有助于解释速度,但不代表每个文件都是 4 GB。权重、运行时 buffer、约 5.5 亿参数的视觉编码器、KV cache 和上下文长度都会占内存。

03

量化不是对齐方式

Q4、Q5、Q6、GGUF 和渠道 slug 描述文件或路由,不能证明模型“无审查”。量化会影响内存和输出质量,而行为边界来自 checkpoint 和微调。

SillyTavern 接入顺序

先核验 uncensored 来源,再放角色卡

按层排查,才能分清是模板问题、采样问题、社区微调行为还是角色卡本身的问题。

  1. 01

    1. 确认 checkpoint 与发布者

    记录完整的社区模型 ID、基座 checkpoint、变体、量化文件和模型卡链接。不要把 uncensored 标签或 `gemma-4-26b` 记忆输入当作官方身份。

  2. 02

    2. 选择兼容的 API 模式

    KoboldCpp、llama.cpp、LM Studio 或 OpenAI 兼容渠道各有自己的 endpoint。支持时先从 Chat Completions 开始,Text Completion 会把更多格式细节交给你。

  3. 03

    3. 让后端处理 Gemma 4 模板

    Google 的格式使用 `system`、`user`、`model`、`<|turn>` 和 `<turn|>`。使用后端提供的 Gemma 4 或 Gemini tokenizer 与 chat template,不要覆盖成旧 Gemma 3 模板。

  4. 04

    4. 有意地开启 thinking

    Google 说明可在 system prompt 开头加入 `<|think|>` 开启思考。先用短提示测试,再加入角色卡和 preset。普通多轮历史只保留最终答案。

社区讨论提到 SillyTavern 1.17、KoboldCpp 的 `--jinja`、Gemma4/Gemini tokenizer 与 `<|think|>`。这些是排错线索,不是所有后端都适用的 Google 默认值。

回复出错时

只修出错的那一层

CASE 01

思考标记变成正文

先查 tokenizer、chat template 和后端生成模式。后端已经套模板时,再手写控制标记可能让 token 原样出现。用一条短提示对比开关 thinking。

CASE 02

有时思考,有时不思考

确认 SillyTavern 和 loader 是否支持 Gemma 4 格式。社区方案可能需要 `--jinja` 或 `<|think|>`,但开关取决于服务器,不要把所有方案叠在一起。

CASE 03

角色重复或丢细节

先减少重复上下文,再改温度。检查上下文上限和角色卡,然后把 temperature 1.0、top-p 0.95、top-k 64 当作实验起点。

浏览器替代路径

保留角色 wiki,在旁边提问

Tabbit 不是本地 GGUF 运行器,也不是 SillyTavern 角色卡管理器。它适合把角色页面、设定笔记或排错帖子留在眼前,同时和浏览器里可用的模型对话。

  1. 1

    安装 Tabbit

    下载 macOS 或 Windows 的 Chromium 浏览器。这条路径不需要本地 Gemma 文件、渠道 Key 或 SillyTavern 服务。

  2. 2

    只选择列表里的模型

    安装后打开产品内模型选择器。当前代码列出 GPT-5.4、Gemini-3.1-Pro、Claude-Sonnet-4.6、DeepSeek-V4-Flash 等模型。当前映射没有 Gemma 4,因此本页不承诺 Tabbit 可运行 Gemma。

  3. 3

    把资料带进对话

    将 wiki 或设置笔记留在标签页,输入 `@` 引用网页、截图或文件,再让模型整理场景、检查一致性或总结刚比较过的配置。

Tabbit 新标签页模型选择器显示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6,画面中没有 Gemma 4。

选择前端

角色卡用 SillyTavern,资料页用 Tabbit

两个工具解决不同堵点。需要角色控制时保留专用前端,资料散落在网页和文件中时使用浏览器路径。

SillyTavernTabbit
角色卡和 lorebook核心流程引用来源页面
Gemma 4 本地 checkpoint自行准备后端使用选择器列出的模型
模板和 sampler细致控制由所选模型管理
网页上下文粘贴或扩展用 @ 引用标签页或文件
第一条有用回复endpoint + 模板 + preset安装 + 选择列表模型
Tabbit 新标签页模型选择器显示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6,画面中没有 Gemma 4。

把资料带进对话

将 wiki 或设置笔记留在标签页,输入 `@` 引用网页、截图或文件,再让模型整理场景、检查一致性或总结刚比较过的配置。

Tabbit 新标签页模型选择器显示 GPT-5.4、GPT-5.2-Chat、Gemini-3.1-Pro、Gemini-3-Flash 和 Claude-Sonnet-4.6,画面中没有 Gemma 4。

网页上下文

用 @ 引用标签页或文件

常见问题

Gemma 4 uncensored 与 SillyTavern

Gemma 4 26B 的官方名称是什么?+

Google 模型卡称它为 Gemma 4 26B A4B。Hugging Face 指令 checkpoint 是 `google/gemma-4-26B-A4B-it`,社区发布者可能添加自己的后缀。

26B A4B 和 Gemma 4 31B 一样吗?+

不一样。26B A4B 是 MoE,总参数 252 亿、active parameters 约 38 亿。Gemma 4 31B 是约 307 亿参数的 dense 模型。

需要多少显存?+

没有一个安全的统一数字。量化权重、KV cache、上下文、运行时 buffer 和视觉编码器都会影响显存。请用目标上下文测量具体 GGUF 或后端构建。

为什么 `<|think|>` 会出现在回复里?+

tokenizer 或模板可能与后端不匹配,也可能是服务器把控制 token 当作文本输出。先检查格式、tokenizer 和 thinking 设置。

Tabbit 能运行 Gemma 4 26B 吗?+

不要直接假设。当前 Tabbit 模型映射没有 Gemma 4。安装后只能使用当前选择器实际显示的模型。

先核验模型链路,再调 preset

社区 uncensored 模型先核对基座、模型卡、许可、量化、tokenizer 和模板。需要在角色 wiki 或排错资料旁聊天时,安装 Tabbit 并查看当前模型选择器。

支持 macOS 和 Windows。模型可用性可能变化。

© 2026 Tabbit Browser. 理解你上下文的 AI 原生浏览器。