Configurações Gemma 4 × SillyTavern

Corrija primeiro a camada de configuração

Uma resposta ruim do Gemma 4 nem sempre pede outro preset. Confira o ID do modelo, o chat template, o papel do sistema, o contexto e os samplers nessa ordem. Este guia oferece uma base testável, não uma receita mágica.

Navegador Tabbit no desktop com abas verticais, campo central e painel de chat ao lado da página.

Comece pelo sintoma

A saída mostra qual controle verificar

Separe um erro de formato de uma escolha de amostragem. O reparo mais rápido costuma ser a menor mudança que explica o sintoma.

01

Marcadores de thinking aparecem na resposta

Confira template instruct ou chat, tokenizer e modo de reasoning antes de mexer na temperatura. Um marcador como <|think|> vira texto literal quando o formato não combina.

02

A resposta corta ou fica vazia

Verifique o limite de tokens de resposta e o contexto restante. Um card longo e o histórico podem ocupar o espaço de geração.

03

O modelo repete ou perde o personagem

Procure texto duplicado no card, contexto cheio ou controles de repetição fortes. Teste um prompt limpo antes de mudar vários samplers.

Modelo e memória

26B A4B e 31B fazem escolhas diferentes

O Google descreve 26B A4B como mixture-of-experts e 31B como denso. O MoE ativa menos parâmetros por token, mas seus pesos precisam ser carregados. Quantização e tamanho do contexto mudam a memória real.

ModelProfileMemory noteFit
26B A4BMixture-of-experts, 4B ativos por tokenO Google estima cerca de 14,4 GB para pesos Q4_0, sem contextoCandidato local se o backend aceitar o formato
31BModelo densoO Google estima cerca de 17,5 GB para pesos Q4_0, sem contextoEscolha após conferir memória e velocidade
Q4, Q5, Q6Arquivos quantizados, não nomes oficiais novosMenor precisão pode economizar memória, com troca de qualidade e velocidadeSiga o model card do publicador e o formato do backend

São estimativas aproximadas para carregar os pesos. Reserve espaço para runtime, KV cache e o contexto escolhido.

Cadeia de conexão

Há cinco camadas entre o card e a resposta

Trate cada camada como um ponto de verificação. Se o sintoma surge depois de uma mudança, você sabe onde voltar.

01

Endpoint e ID do modelo

Setting

Conector, URL do servidor e checkpoint exato

Baseline / watch

Use o ID mostrado pelo provedor ou backend

Alias errado, modelo antigo ou formato incompatível

02

Formato Chat ou instruct

Setting

Chat Completions, Text Completion e template

Baseline / watch

Comece com Chat Completions se o servidor aceitar

Headers ou marcadores thinking como texto

03

Papel do sistema

Setting

Mensagem do sistema e posição

Baseline / watch

Mantenha curta, clara e separada do card

O backend ignora ou duplica a mensagem

04

Contexto e resposta

Setting

Context tokens e response tokens máximos

Baseline / watch

Reserve espaço antes de carregar histórico longo

Cortes, detalhes esquecidos ou muita memória

05

Amostragem

Setting

Temperatura, Top P, Top K, Min P e repetição

Baseline / watch

Comece neutro e mude um valor

Loops, texto plano ou voz instável

Base de sampler

Comece com uma base que você consiga explicar

Guias do Google e da comunidade costumam começar perto de Temperature 1.0, Top P 0.95 e Top K 64. O SillyTavern define cada controle separadamente. São valores de teste, não o melhor preset.

Primeiro teste

  • Temperature 1.0
  • Top P 0.95
  • Top K 64
  • Min P 0
  • Repetition penalty 1
  • DRY multiplier 0

Os valores de desativação variam entre controles no SillyTavern. Confirme também a faixa e a documentação do seu backend.

01

1. Crie uma execução limpa

Use um prompt curto, o mesmo card e o mesmo contexto. Salve a saída para comparar mudanças.

02

2. Mude apenas a temperatura

Se a resposta estiver plana, aumente um pouco. Se estiver caótica, reduza um pouco. Mantenha Top P e Top K fixos.

03

3. Ajuste o grupo de tokens

Mude Top P ou Top K, um por vez. Min P fica desativado em 0 no SillyTavern e pode ser testado depois se o backend aceitar.

04

4. Deixe a repetição por último

Confira primeiro o contexto duplicado. Repetition penalty 1 e DRY multiplier 0 estão desativados. Valores fortes podem penalizar palavras comuns.

Mapa de reparo

Ligue o reparo à evidência

CASE 01

Thinking aparece como texto

Revise template, tokenizer e modo de reasoning. Tente Chat Completions se estiver disponível. Não adicione marcadores antes de saber qual formato o backend espera.

CASE 02

Uma resposta longa termina cedo

Confira o uso do contexto antes de aumentar response tokens. Remova lore ou texto duplicado do card e deixe espaço para a KV cache.

CASE 03

A repetição começa depois de alguns turnos

Inspecione mensagens duplicadas e o limite de contexto. Volte a repetition penalty 1 e DRY 0, depois teste um controle moderado.

CASE 04

Arquivos quantizados parecem diferentes

Mantenha backend, card e sampler fixos. Anote suffix, contexto e velocidade. Um resultado Q4 não é a mesma evidência de um run BF16.

Outro caminho

Se a tarefa é sobre uma página, evite ajustar samplers locais

O Tabbit é um navegador Chromium com IA para macOS e Windows. Ele não executa um checkpoint Gemma local nem substitui os cards do SillyTavern. Use-o para ler uma página, captura ou arquivo e perguntar ao lado.

  1. 1

    Instale o Tabbit

    Baixe o navegador para desktop e abra uma aba. O site oficial indica suporte a macOS 12+ e Windows 10+.

  2. 2

    Use o seletor atual

    Escolha um modelo realmente visível no seu Tabbit. A lista pode mudar. Esta página não promete que o Gemma 4 esteja disponível.

  3. 3

    Referencie o contexto com @

    Deixe a wiki do personagem, suas notas ou a documentação em uma aba. Use @ para citar uma página, captura ou arquivo e pedir notas ou outro rascunho.

Seletor de modelos do Tabbit com GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash e Claude-Sonnet-4.6. O Gemma 4 não aparece na imagem.
Seletor de modelos do Tabbit com GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash e Claude-Sonnet-4.6. O Gemma 4 não aparece na imagem.Seletor de modelos do Tabbit com GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash e Claude-Sonnet-4.6. O Gemma 4 não aparece na imagem.

Escolha o fluxo

SillyTavern local ou Tabbit?

Escolha conforme o trabalho. Controle modelo e cards localmente; use o Tabbit quando a própria página for o contexto.

SillyTavern + backend localTabbit
Checkpoint e quantizaçãoVocê escolhe e carregaEscolha no seletor
Template e samplerControle detalhadoGerenciado pelo modelo
Cards e lorebooksFluxo principalDeixe a fonte aberta
Contexto de página, captura e arquivoColar ou configurar extensão@ aba ou arquivo
Primeiro diagnósticoID → template → contexto → samplerAbrir, referenciar, perguntar
Navegador Tabbit no desktop com abas verticais, campo central e painel de chat ao lado da página.

Base de sampler

Os valores de desativação variam entre controles no SillyTavern. Confirme também a faixa e a documentação do seu backend.

FAQ

Configurações do Gemma 4, respondidas

Qual é uma base segura para Gemma 4 no SillyTavern?+

Comece com Temperature 1.0, Top P 0.95 e Top K 64. Deixe Min P em 0, repetition penalty em 1 e DRY multiplier em 0. São valores iniciais: mude uma coisa por vez.

Escolho 26B A4B ou 31B?+

As arquiteturas são diferentes. O Google descreve 26B A4B como MoE e 31B como denso. Confira o model card, a memória dos pesos, o contexto e o backend.

Por que thinking tokens aparecem como texto?+

Template, tokenizer, backend e modo de reasoning podem usar formatos diferentes. Verifique os quatro antes de adicionar <|think|>.

Context e response tokens usam a mesma memória?+

Eles compartilham o orçamento da solicitação, e um contexto total maior pede mais KV cache. O SillyTavern reserva os response tokens.

O Tabbit executa minha quantização local do Gemma 4?+

Esta página não afirma isso. Depois de instalar, use apenas um modelo visível no seletor atual. Cards e samplers locais são do SillyTavern; páginas e arquivos combinam com o Tabbit.

Mude uma coisa e leia o resultado

Para Gemma 4 local, confira a cadeia model card, template e contexto. Para trabalhar ao lado de uma página, instale o Tabbit e escolha um modelo do seletor atual.

Disponível para macOS e Windows. A disponibilidade dos modelos pode mudar.

© 2026 Tabbit Browser. O navegador nativo de IA que entende o seu contexto.