¿26B A4B o 31B?
Decide con el model card y el hardware que tienes. 26B A4B puede ser más ligero porque activa solo parte del modelo. 31B suele exigir más memoria. No compares solo los números.
Gemma 4 × SillyTavern
¿Quieres usar Gemma 4 para chatear con personajes? Separa primero los nombres oficiales de los archivos cuantizados de la comunidad. Después revisa, en orden, el backend, la plantilla, el tokenizer y las marcas de thinking. Aquí tienes una ruta corta y una alternativa de navegador.
Verificar nombres en Google DeepMind ↗
Empieza por el modelo
Google enumera E2B, E4B, 12B, 26B A4B y 31B. 26B A4B es un modelo mixture-of-experts y 31B es denso. Q4 y Q6 son versiones cuantizadas, no nombres oficiales nuevos.
Decide con el model card y el hardware que tienes. 26B A4B puede ser más ligero porque activa solo parte del modelo. 31B suele exigir más memoria. No compares solo los números.
Ollama, LM Studio, KoboldCpp y llama.cpp pasan por plantillas y contextos distintos. Una API puede ser más sencilla, pero el ID exacto lo determina el proveedor.
La consistencia depende de la tarjeta, el prompt de sistema, el sampler y el contexto. La comunidad menciona DRY y presets para reducir repeticiones, no como valores oficiales.
Ruta de SillyTavern
Cambia una sola capa cada vez. Así sabrás qué produjo una respuesta defectuosa.
Elige el conector de tu backend y comprueba el checkpoint exacto. Con un proveedor, copia el model slug en vez de escribir un alias de memoria.
Si tu API o servidor lo admite, empieza con Chat Completions. Text Completion puede funcionar, pero deja más detalles de plantilla expuestos.
Usa el tokenizer y la plantilla Gemma 4 o Gemini de tu backend. Las plantillas antiguas pueden colocar mal los headers y las marcas de thinking.
Carga la tarjeta, añade un prompt de sistema sobrio y prueba un preset de la comunidad cada vez. Conserva los archivos del autor y anota tus cambios.
FF y Moonlight aparecen en conversaciones de la comunidad. No son valores de Google y esta página no redistribuye sus archivos.
Si la respuesta sale mal
Revisa primero plantilla, tokenizer y modo de thinking. Algunos usuarios de Reddit sugieren <|think|>, pero depende del backend y puede mostrar tokens literales.
Un proveedor puede exponer reasoning de forma distinta a una compilación local. Compara una petición corta con thinking activado y desactivado antes de forzar marcas.
Reduce el ruido del contexto antes de tocar la temperatura. Elimina texto duplicado, comprueba el límite y luego prueba DRY o un sampler comunitario. Los parámetros citados en Reddit son experimentos.
Ruta de navegador
Tabbit no reemplaza las tarjetas ni los lorebooks de SillyTavern. Te permite leer una wiki o documento y hablar con un modelo disponible en el navegador.
Descarga el navegador basado en Chromium para macOS o Windows. Esta ruta no necesita un archivo de modelo local ni un servidor de SillyTavern.
Abre el selector tras instalar y elige un modelo que esté visible, como GPT-5.4, GPT-5.2-Chat o Gemini-3-Flash. El selector es la fuente actual.
Deja la wiki o el documento en una pestaña. Usa @ para referenciar la página, una captura o un archivo y pide notas de escena o un segundo borrador.

Elige la herramienta
Usa la herramienta que encaja con tu bloqueo. Un navegador no es un gestor de tarjetas y un frontend local no mejora el modelo por sí solo.
| SillyTavern | Tabbit | |
|---|---|---|
| Tarjetas y lorebooks | Incluidos | Deja abierta la fuente |
| Checkpoint local Gemma 4 | Aportas tu backend | Elige uno de la lista |
| Plantilla y sampler | Control detallado | Depende del modelo |
| Contexto de página | Pegar o extensiones | @ pestaña o archivo |
| Primera respuesta útil | Instalar + endpoint + preset | Instalar + elegir modelo |

Deja la wiki o el documento en una pestaña. Usa @ para referenciar la página, una captura o un archivo y pide notas de escena o un segundo borrador.

@ pestaña o archivo
FAQ
No. Google describe 26B A4B como mixture-of-experts y 31B como denso. Elige según tu model card y hardware.
Depende de memoria, contexto y del model card del publicador. Q4, Q5 y Q6 son archivos cuantizados, no nombres oficiales nuevos.
El tokenizer, la plantilla, el backend o el proveedor pueden no coincidir. Verifica esas piezas antes de añadir <|think|>.
No lo des por hecho. Instala Tabbit y usa un modelo que aparezca en el selector actual. Gemma 4 no aparece en la captura de esta página.
No. SillyTavern encaja mejor con tarjetas, lorebooks y presets detallados. Tabbit sirve para hablar junto a páginas y archivos.
Para Gemma 4 local, sigue el model card y revisa la cadena de plantillas. Para hablar junto a una wiki, instala Tabbit y elige un modelo disponible.
Disponible para macOS y Windows. La lista de modelos puede cambiar.