Use o ID exato
O checkpoint de instruções do Hugging Face é `google/gemma-4-26B-A4B-it`. Q4, Q5 e Q6 são quantizações, não novas famílias de modelos do Google.
Gemma 4 26B A4B × SillyTavern
O primeiro problema é o nome. Gemma 4 26B A4B é um modelo MoE com 25,2 bilhões de parâmetros no total e cerca de 3,8 bilhões ativos. Não é um modelo denso de 26B nem o checkpoint 31B. Veja nome, memória, template e frontend nesta ordem.
Confira os fatos oficiais ↗
Nome e hardware primeiro
O nome usado pelo Google é Gemma 4 26B A4B. O model card informa 25,2 bilhões de parâmetros totais, 3,8 bilhões ativos, 30 camadas, entrada de imagens e contexto de 256K. IT, Q4, Q5 e o nome do autor no GGUF são rótulos da distribuição.
O checkpoint de instruções do Hugging Face é `google/gemma-4-26B-A4B-it`. Q4, Q5 e Q6 são quantizações, não novas famílias de modelos do Google.
A quantidade de parâmetros ativos ajuda a explicar a velocidade, mas não transforma todos os arquivos em modelos de 4 GB. Pesos, buffers, encoder visual de cerca de 550M, KV cache e contexto entram na conta.
31B é um modelo denso com cerca de 30,7 bilhões de parâmetros. 26B A4B encaminha tokens para experts. Uma estimativa de memória feita para 31B pode falhar aqui.
Ordem de conexão
Separar as camadas evita culpar o sampler por um template errado ou por um card mal configurado.
Escolha um arquivo local ou provedor que identifique Gemma 4 26B A4B. Copie o model slug fornecido, sem inventar `gemma-4-26b`.
KoboldCpp, llama.cpp, LM Studio e provedores compatíveis com OpenAI têm endpoints diferentes. Comece por Chat Completions quando disponível.
O formato do Google usa `system`, `user`, `model`, `<|turn>` e `<turn|>`. Use o template Gemma 4 ou Gemini do backend, não um template antigo do Gemma 3.
O Google documenta `<|think|>` no início do system prompt para ativar o pensamento. Faça um teste curto, depois adicione card e preset. No histórico normal, mantenha apenas a resposta final.
Discussões da comunidade citam SillyTavern 1.17, `--jinja` no KoboldCpp, tokenizer Gemma4/Gemini e `<|think|>`. Isso não é um padrão universal do Google.
Quando a saída falha
Confira tokenizer, template e modo de geração do backend. Se o servidor já aplica o template, inserir tokens manualmente pode exibi-los literalmente. Compare thinking ligado e desligado.
Verifique se sua versão do SillyTavern e o loader aceitam o formato Gemma 4. `--jinja` ou `<|think|>` podem ajudar conforme o servidor.
Reduza contexto duplicado antes de alterar a temperatura. Confira o limite e o card, então teste temperature 1.0, top-p 0.95 e top-k 64.
Caminho pelo navegador
O Tabbit não é um runner local de GGUF nem um gerenciador de cards do SillyTavern. Ele mantém wiki, notas e discussões de suporte visíveis durante uma conversa com um modelo disponível no navegador.
Baixe o navegador baseado em Chromium para macOS ou Windows. Não é preciso arquivo Gemma local, chave de provedor ou servidor SillyTavern.
Abra o seletor depois da instalação. O código atual lista GPT-5.4, Gemini-3.1-Pro, Claude-Sonnet-4.6 e DeepSeek-V4-Flash. Gemma 4 não está no mapping atual, portanto não prometemos sua execução.
Mantenha a wiki ou as notas em uma aba. Use `@` para referenciar página, captura ou arquivo e pedir um esboço de cena, uma verificação de consistência ou um resumo.

Escolha o cliente
Cada ferramenta resolve um bloqueio diferente. Use os controles de RP no frontend especializado e o navegador quando o contexto estiver espalhado por páginas e arquivos.
| SillyTavern | Tabbit | |
|---|---|---|
| Cards e lorebooks | Fluxo principal | Referenciar a fonte |
| Checkpoint Gemma 4 local | Você prepara o backend | Escolher na lista |
| Template e sampler | Controle detalhado | Gerenciado pelo modelo |
| Contexto web | Colar ou extensões | Referenciar aba ou arquivo com @ |
| Primeira resposta útil | Endpoint + template + preset | Instalar + escolher |

Mantenha a wiki ou as notas em uma aba. Use `@` para referenciar página, captura ou arquivo e pedir um esboço de cena, uma verificação de consistência ou um resumo.

Referenciar aba ou arquivo com @
Perguntas frequentes
O Google chama o modelo de Gemma 4 26B A4B. O checkpoint de instruções do Hugging Face é `google/gemma-4-26B-A4B-it`; distribuidores podem acrescentar sufixos.
Não. 26B A4B é MoE, com 25,2 bilhões no total e cerca de 3,8 bilhões ativos. 31B é denso e tem cerca de 30,7 bilhões.
Não há um número único. Quantização, KV cache, contexto, buffers e encoder visual alteram o uso. Meça o arquivo real com o contexto desejado.
O tokenizer ou template pode não coincidir com o backend, ou o servidor pode mostrar o token como texto. Confira o formato e thinking antes do sampling.
Não presuma. O mapping atual do Tabbit não inclui Gemma 4. Use somente um modelo que apareça no seletor.
Para Gemma 4 26B A4B local, confirme checkpoint, memória, tokenizer e template nessa ordem. Para conversar ao lado de uma wiki, instale o Tabbit e confira o seletor atual.
Disponível para macOS e Windows. A disponibilidade dos modelos pode mudar.