Las marcas de thinking aparecen en la respuesta
Revisa la plantilla instruct o chat, el tokenizer y el modo de reasoning antes de tocar la temperatura. Una marca como <|think|> en el formato equivocado aparece como texto literal.
Ajustes de Gemma 4 × SillyTavern
Una respuesta mala de Gemma 4 no siempre necesita otro preset. Revisa el ID del modelo, la plantilla de chat, el rol del sistema, el presupuesto de contexto y los samplers en orden. Esta guía propone una base comprobable, no una receta mágica.

Empieza por el síntoma
Separa un error de formato de una decisión de muestreo. La reparación más rápida suele ser el cambio mínimo que explica el síntoma.
Revisa la plantilla instruct o chat, el tokenizer y el modo de reasoning antes de tocar la temperatura. Una marca como <|think|> en el formato equivocado aparece como texto literal.
Comprueba el límite de tokens de respuesta y la ventana de contexto restante. Una tarjeta larga y el historial pueden dejar poco espacio para generar.
Busca texto duplicado de la tarjeta, un contexto lleno o controles de repetición agresivos. Prueba un prompt limpio antes de cambiar varios samplers.
Modelo y memoria
Google describe 26B A4B como mixture-of-experts y 31B como denso. MoE activa menos parámetros por token, pero sus pesos deben cargarse. La cuantización y el contexto cambian el coste real de memoria.
| Model | Profile | Memory note | Fit |
|---|---|---|---|
| 26B A4B | Mixture-of-experts; 4B activos por token | Google estima unos 14,4 GB para pesos Q4_0, sin contar contexto | Candidato local si tu backend admite el formato |
| 31B | Modelo denso | Google estima unos 17,5 GB para pesos Q4_0, sin contar contexto | Úsalo solo si aceptas su memoria y velocidad |
| Q4, Q5, Q6 | Archivos cuantizados, no nombres oficiales nuevos | Menor precisión puede ahorrar memoria, con un intercambio de calidad y velocidad | Sigue el model card del publicador y el formato del backend |
Son estimaciones aproximadas de carga de pesos. Reserva espacio para el runtime, la KV cache y el contexto elegido.
Cadena de conexión
Trata cada capa como un punto de control. Si el síntoma aparece después de un cambio, sabrás dónde mirar.
Setting
Conector, URL del servidor y checkpoint exacto
Baseline / watch
Usa el ID que muestra tu proveedor o backend
Alias equivocado, modelo antiguo o formato no compatible
Setting
Chat Completions, Text Completion y plantilla
Baseline / watch
Empieza con Chat Completions si el servidor lo admite
Headers o marcas de thinking como texto normal
Setting
Mensaje de sistema y posición
Baseline / watch
Hazlo breve, explícito y separado de la tarjeta
El backend ignora o duplica el mensaje
Setting
Context tokens y response tokens máximos
Baseline / watch
Reserva respuesta antes de cargar mucho historial
Cortes, detalles olvidados o más memoria
Setting
Temperatura, Top P, Top K, Min P y repetición
Baseline / watch
Parte de un punto neutro y cambia un valor
Bucles, prosa plana o voz inestable
Base de samplers
Las guías de Google y de la comunidad suelen empezar cerca de Temperature 1.0, Top P 0.95 y Top K 64. SillyTavern define cada control por separado. Son valores de prueba, no el mejor preset.
Primera prueba
SillyTavern usa valores de desactivación diferentes según el control. El backend puede tener otro rango, así que revisa su ayuda y documentación.
Usa un prompt corto, la misma tarjeta y el mismo contexto. Guarda la salida para comparar los cambios.
Si la respuesta es plana, súbela un poco. Si es caótica, bájala un poco. Mantén Top P y Top K fijos.
Cambia Top P o Top K, uno cada vez. Min P está desactivado en 0 en SillyTavern y se puede probar después si el backend lo admite.
Revisa primero el contexto duplicado. Repetition penalty 1 y DRY multiplier 0 están desactivados. Valores fuertes pueden castigar palabras comunes.
Mapa de reparación
Comprueba plantilla, tokenizer y modo de reasoning. Prueba Chat Completions si está disponible. No añadas marcas hasta saber que el backend las espera.
Revisa el uso del contexto antes de aumentar response tokens. Elimina lore o texto de tarjeta duplicado. Más contexto necesita más KV cache.
Inspecciona mensajes repetidos y el límite de contexto. Vuelve a repetition penalty 1 y DRY 0, y prueba un solo control moderado.
Mantén backend, tarjeta y sampler fijos. Anota sufijo de cuantización, contexto y velocidad. Un Q4 no demuestra lo mismo que BF16.
Otra ruta
Tabbit es un navegador Chromium con IA para macOS y Windows. No ejecuta un checkpoint Gemma local ni sustituye las tarjetas de SillyTavern. Sirve para leer una página, captura o archivo y preguntar junto a él.
Descarga el navegador de escritorio y abre una pestaña. El sitio oficial indica compatibilidad con macOS 12+ y Windows 10+.
Elige un modelo que aparezca en tu Tabbit instalado. La lista puede cambiar. Esta página no afirma que Gemma 4 esté disponible allí.
Deja abierta la wiki del personaje, tus notas o la documentación. Usa @ para referenciar una página, captura o archivo y pide notas o un segundo borrador.



Elige el flujo
La ruta depende del trabajo. Mantén el control del modelo y las tarjetas en local; usa Tabbit cuando la página sea el contexto.
| SillyTavern + backend local | Tabbit | |
|---|---|---|
| Checkpoint y cuantización | Los eliges y cargas tú | Elige un modelo del selector |
| Plantilla y sampler | Control detallado | Depende del modelo elegido |
| Tarjetas y lorebooks | Flujo principal | Deja abierta la fuente |
| Contexto de página, captura y archivo | Pegar o configurar extensión | @ pestaña o archivo |
| Primer diagnóstico | ID → plantilla → contexto → sampler | Abrir, referenciar, preguntar |

Base de samplers
SillyTavern usa valores de desactivación diferentes según el control. El backend puede tener otro rango, así que revisa su ayuda y documentación.
FAQ
Empieza con Temperature 1.0, Top P 0.95 y Top K 64. Deja Min P en 0, repetition penalty en 1 y DRY multiplier en 0. Son valores iniciales: cambia una cosa cada vez.
Tienen arquitecturas distintas. Google describe 26B A4B como MoE y 31B como denso. Comprueba el model card, la memoria aproximada, el contexto y tu backend.
La plantilla, el tokenizer, el backend y el modo de reasoning pueden no coincidir. Verifica los cuatro antes de añadir <|think|>.
Comparten el presupuesto de la solicitud y un contexto total mayor necesita más KV cache. SillyTavern descuenta la reserva de respuesta del contexto enviado.
Esta página no lo afirma. Instala Tabbit y usa solo un modelo visible en su selector actual. Tabbit gestiona contexto de páginas y archivos; SillyTavern sigue siendo la herramienta local para tarjetas y samplers.
Para Gemma 4 local, revisa juntos model card, plantilla y contexto. Para trabajar junto a una página, instala Tabbit y elige un modelo del selector actual.
Disponible para macOS y Windows. La disponibilidad de modelos puede cambiar.