26B A4B ou 31B?
Use o model card e o hardware disponível. 26B A4B pode ser mais leve porque só parte do modelo fica ativa. 31B costuma pedir mais memória.
Gemma 4 31B × SillyTavern
Para usar o Gemma 4 31B em chats de personagens, separe o nome oficial dos arquivos quantizados. Depois confira backend, template, tokenizer e thinking.
Confira o nome e o template oficiais ↗
Comece pelo modelo
O Google lista E2B, E4B, 12B, 26B A4B e 31B. 26B A4B é mixture-of-experts e 31B é denso. Q4 e Q6 são versões quantizadas, não novos nomes oficiais.
Use o model card e o hardware disponível. 26B A4B pode ser mais leve porque só parte do modelo fica ativa. 31B costuma pedir mais memória.
Ollama, LM Studio, KoboldCpp e llama.cpp tratam templates e contexto de formas diferentes. Em uma API, use o ID exato do provedor.
A consistência depende do card, system prompt, sampler e contexto tanto quanto do checkpoint. DRY e presets são pontos de partida da comunidade.
Caminho no SillyTavern
Mude uma camada por vez para entender a origem de uma resposta ruim.
Escolha o conector correto e verifique o checkpoint exato. Em um provedor, copie o model slug.
Se o servidor aceitar, comece com Chat Completions. Text Completion deixa mais detalhes de template sob seu controle.
Use o tokenizer e template Gemma 4 ou Gemini indicados pelo backend. Templates antigos podem posicionar mal os marcadores.
Carregue o card, use um system prompt simples e teste um preset da comunidade por vez. Anote suas mudanças.
FF e Moonlight vêm de conversas da comunidade. Não são padrões do Google e seus arquivos não são republicados aqui.
Quando a resposta falha
Confira template, tokenizer e configuração de thinking. <|think|> depende do backend e pode exibir tokens literais no formato errado.
Um provedor pode expor reasoning de modo diferente de uma build local. Compare uma solicitação curta com thinking ligado e desligado.
Reduza duplicações no contexto antes de mexer na temperatura. Confira o limite e depois teste DRY ou um sampler comunitário.
Caminho pelo navegador
O Tabbit não substitui cards nem lorebooks do SillyTavern. Ele permite ler uma wiki ou documento e conversar com um modelo disponível no navegador.
Baixe o navegador baseado em Chromium para macOS ou Windows. Esta rota não exige arquivo de modelo local nem servidor SillyTavern.
Abra o seletor após instalar e escolha um modelo realmente visível, como GPT-5.4, GPT-5.2-Chat ou Gemini-3-Flash.
Mantenha a wiki ou documento em uma aba. Use @ para referenciar página, captura ou arquivo e pedir notas de cena ou outra versão.

Escolha a ferramenta
Escolha conforme o bloqueio. Um navegador não gerencia cards, e um frontend local não melhora o modelo sozinho.
| SillyTavern | Tabbit | |
|---|---|---|
| Cards e lorebooks | Integrados | Deixe a fonte aberta |
| Checkpoint Gemma 4 local | Você fornece o backend | Escolha na lista |
| Template e sampler | Controle detalhado | Gerenciado pelo modelo |
| Contexto da página | Colar ou extensões | @ aba ou arquivo |
| Primeira resposta útil | Instalar + endpoint + preset | Instalar + escolher |

Mantenha a wiki ou documento em uma aba. Use @ para referenciar página, captura ou arquivo e pedir notas de cena ou outra versão.

@ aba ou arquivo
FAQ
Não. O Google descreve 26B A4B como mixture-of-experts e 31B como denso.
Adapte Q4, Q5 ou Q6 à memória, ao contexto e ao model card do publicador.
Tokenizer, template, backend ou provedor podem discordar do formato. Verifique-os antes de adicionar <|think|>.
Não presuma. Após instalar, use apenas um modelo presente no seletor atual.
Não. Cards e lorebooks combinam com SillyTavern. Tabbit serve para conversar ao lado de páginas e arquivos.
Para Gemma 4 local, siga o model card e a cadeia de templates. Para conversar ao lado de uma wiki, instale o Tabbit e escolha um modelo disponível.
Disponível para macOS e Windows. A lista de modelos pode mudar.