Ajustes de Gemma 4 × SillyTavern

Corrige primero la capa de ajustes

Una respuesta mala de Gemma 4 no siempre necesita otro preset. Revisa el ID del modelo, la plantilla de chat, el rol del sistema, el presupuesto de contexto y los samplers en orden. Esta guía propone una base comprobable, no una receta mágica.

Verificar Gemma 4 en Google
Navegador de escritorio Tabbit con pestañas verticales, un cuadro de entrada central y un panel de chat junto a la página.

Empieza por el síntoma

La salida indica qué control revisar

Separa un error de formato de una decisión de muestreo. La reparación más rápida suele ser el cambio mínimo que explica el síntoma.

01

Las marcas de thinking aparecen en la respuesta

Revisa la plantilla instruct o chat, el tokenizer y el modo de reasoning antes de tocar la temperatura. Una marca como <|think|> en el formato equivocado aparece como texto literal.

02

La respuesta se corta o queda vacía

Comprueba el límite de tokens de respuesta y la ventana de contexto restante. Una tarjeta larga y el historial pueden dejar poco espacio para generar.

03

Repite o pierde el personaje

Busca texto duplicado de la tarjeta, un contexto lleno o controles de repetición agresivos. Prueba un prompt limpio antes de cambiar varios samplers.

Modelo y memoria

26B A4B y 31B son decisiones distintas

Google describe 26B A4B como mixture-of-experts y 31B como denso. MoE activa menos parámetros por token, pero sus pesos deben cargarse. La cuantización y el contexto cambian el coste real de memoria.

ModelProfileMemory noteFit
26B A4BMixture-of-experts; 4B activos por tokenGoogle estima unos 14,4 GB para pesos Q4_0, sin contar contextoCandidato local si tu backend admite el formato
31BModelo densoGoogle estima unos 17,5 GB para pesos Q4_0, sin contar contextoÚsalo solo si aceptas su memoria y velocidad
Q4, Q5, Q6Archivos cuantizados, no nombres oficiales nuevosMenor precisión puede ahorrar memoria, con un intercambio de calidad y velocidadSigue el model card del publicador y el formato del backend

Son estimaciones aproximadas de carga de pesos. Reserva espacio para el runtime, la KV cache y el contexto elegido.

Cadena de conexión

Hay cinco capas entre la tarjeta y la respuesta

Trata cada capa como un punto de control. Si el síntoma aparece después de un cambio, sabrás dónde mirar.

01

Endpoint e ID del modelo

Setting

Conector, URL del servidor y checkpoint exacto

Baseline / watch

Usa el ID que muestra tu proveedor o backend

Alias equivocado, modelo antiguo o formato no compatible

02

Formato Chat o instruct

Setting

Chat Completions, Text Completion y plantilla

Baseline / watch

Empieza con Chat Completions si el servidor lo admite

Headers o marcas de thinking como texto normal

03

Rol del sistema

Setting

Mensaje de sistema y posición

Baseline / watch

Hazlo breve, explícito y separado de la tarjeta

El backend ignora o duplica el mensaje

04

Contexto y respuesta

Setting

Context tokens y response tokens máximos

Baseline / watch

Reserva respuesta antes de cargar mucho historial

Cortes, detalles olvidados o más memoria

05

Muestreo

Setting

Temperatura, Top P, Top K, Min P y repetición

Baseline / watch

Parte de un punto neutro y cambia un valor

Bucles, prosa plana o voz inestable

Base de samplers

Usa una base que puedas explicar

Las guías de Google y de la comunidad suelen empezar cerca de Temperature 1.0, Top P 0.95 y Top K 64. SillyTavern define cada control por separado. Son valores de prueba, no el mejor preset.

Primera prueba

  • Temperature 1.0
  • Top P 0.95
  • Top K 64
  • Min P 0
  • Repetition penalty 1
  • DRY multiplier 0

SillyTavern usa valores de desactivación diferentes según el control. El backend puede tener otro rango, así que revisa su ayuda y documentación.

01

1. Crea una ejecución limpia

Usa un prompt corto, la misma tarjeta y el mismo contexto. Guarda la salida para comparar los cambios.

02

2. Cambia solo la temperatura

Si la respuesta es plana, súbela un poco. Si es caótica, bájala un poco. Mantén Top P y Top K fijos.

03

3. Ajusta el grupo de tokens

Cambia Top P o Top K, uno cada vez. Min P está desactivado en 0 en SillyTavern y se puede probar después si el backend lo admite.

04

4. Añade repetición al final

Revisa primero el contexto duplicado. Repetition penalty 1 y DRY multiplier 0 están desactivados. Valores fuertes pueden castigar palabras comunes.

Mapa de reparación

Relaciona el arreglo con la evidencia

CASE 01

Thinking aparece como texto

Comprueba plantilla, tokenizer y modo de reasoning. Prueba Chat Completions si está disponible. No añadas marcas hasta saber que el backend las espera.

CASE 02

Una respuesta larga termina pronto

Revisa el uso del contexto antes de aumentar response tokens. Elimina lore o texto de tarjeta duplicado. Más contexto necesita más KV cache.

CASE 03

La repetición comienza tras varios turnos

Inspecciona mensajes repetidos y el límite de contexto. Vuelve a repetition penalty 1 y DRY 0, y prueba un solo control moderado.

CASE 04

Los archivos cuantizados se sienten distintos

Mantén backend, tarjeta y sampler fijos. Anota sufijo de cuantización, contexto y velocidad. Un Q4 no demuestra lo mismo que BF16.

Otra ruta

Si la tarea trata de una página, evita ajustar samplers locales

Tabbit es un navegador Chromium con IA para macOS y Windows. No ejecuta un checkpoint Gemma local ni sustituye las tarjetas de SillyTavern. Sirve para leer una página, captura o archivo y preguntar junto a él.

  1. 1

    Instala Tabbit

    Descarga el navegador de escritorio y abre una pestaña. El sitio oficial indica compatibilidad con macOS 12+ y Windows 10+.

  2. 2

    Usa el selector actual

    Elige un modelo que aparezca en tu Tabbit instalado. La lista puede cambiar. Esta página no afirma que Gemma 4 esté disponible allí.

  3. 3

    Referencia el contexto con @

    Deja abierta la wiki del personaje, tus notas o la documentación. Usa @ para referenciar una página, captura o archivo y pide notas o un segundo borrador.

Selector de modelos de Tabbit con GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash y Claude-Sonnet-4.6. Gemma 4 no aparece en esta captura.
Selector de modelos de Tabbit con GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash y Claude-Sonnet-4.6. Gemma 4 no aparece en esta captura.Selector de modelos de Tabbit con GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash y Claude-Sonnet-4.6. Gemma 4 no aparece en esta captura.

Elige el flujo

¿SillyTavern local o Tabbit?

La ruta depende del trabajo. Mantén el control del modelo y las tarjetas en local; usa Tabbit cuando la página sea el contexto.

SillyTavern + backend localTabbit
Checkpoint y cuantizaciónLos eliges y cargas túElige un modelo del selector
Plantilla y samplerControl detalladoDepende del modelo elegido
Tarjetas y lorebooksFlujo principalDeja abierta la fuente
Contexto de página, captura y archivoPegar o configurar extensión@ pestaña o archivo
Primer diagnósticoID → plantilla → contexto → samplerAbrir, referenciar, preguntar
Navegador de escritorio Tabbit con pestañas verticales, un cuadro de entrada central y un panel de chat junto a la página.

Base de samplers

SillyTavern usa valores de desactivación diferentes según el control. El backend puede tener otro rango, así que revisa su ayuda y documentación.

FAQ

Ajustes de Gemma 4, respondidos

¿Cuál es una base segura para Gemma 4 en SillyTavern?+

Empieza con Temperature 1.0, Top P 0.95 y Top K 64. Deja Min P en 0, repetition penalty en 1 y DRY multiplier en 0. Son valores iniciales: cambia una cosa cada vez.

¿Elijo 26B A4B o 31B?+

Tienen arquitecturas distintas. Google describe 26B A4B como MoE y 31B como denso. Comprueba el model card, la memoria aproximada, el contexto y tu backend.

¿Por qué los thinking tokens aparecen como texto?+

La plantilla, el tokenizer, el backend y el modo de reasoning pueden no coincidir. Verifica los cuatro antes de añadir <|think|>.

¿Context y response tokens usan la misma memoria?+

Comparten el presupuesto de la solicitud y un contexto total mayor necesita más KV cache. SillyTavern descuenta la reserva de respuesta del contexto enviado.

¿Tabbit puede ejecutar mi cuantización local de Gemma 4?+

Esta página no lo afirma. Instala Tabbit y usa solo un modelo visible en su selector actual. Tabbit gestiona contexto de páginas y archivos; SillyTavern sigue siendo la herramienta local para tarjetas y samplers.

Cambia una cosa y lee el resultado

Para Gemma 4 local, revisa juntos model card, plantilla y contexto. Para trabajar junto a una página, instala Tabbit y elige un modelo del selector actual.

Disponible para macOS y Windows. La disponibilidad de modelos puede cambiar.

© 2026 Tabbit Browser. El navegador nativo de IA que entiende tu contexto.