Usa el ID exacto
La ficha de Hugging Face identifica el checkpoint de instrucciones como `google/gemma-4-26B-A4B-it`. Q4, Q5 y Q6 son cuantizaciones, no nuevas familias de Google.
Gemma 4 uncensored × SillyTavern
Uncensored no es una variante oficial de Google. Puede ser un ajuste comunitario, un checkpoint modificado, una etiqueta del proveedor o solo un informe de roleplay. Comprueba la ficha, el modelo base, la licencia, la plantilla y la política del proveedor antes de atribuir un rechazo al modelo.
Comprobar los datos oficiales ↗
Nombre y hardware primero
Google usa el nombre Gemma 4 26B A4B. La ficha indica 25,2B de parámetros totales, 3,8B activos, 30 capas, entrada de imágenes y contexto de 256K. Los sufijos IT, Q4 o el nombre de un autor en un GGUF describen una distribución.
La ficha de Hugging Face identifica el checkpoint de instrucciones como `google/gemma-4-26B-A4B-it`. Q4, Q5 y Q6 son cuantizaciones, no nuevas familias de Google.
Los parámetros activos ayudan a explicar la velocidad, pero no convierten todos los archivos en modelos de 4 GB. Pesos, buffers, el encoder visual de unos 550M, KV cache y contexto cambian el consumo.
31B es un modelo denso de unos 30,7B parámetros. 26B A4B enruta cada token a expertos. Una estimación de memoria para 31B puede fallar aquí.
Orden de verificación
Una secuencia limpia separa una plantilla rota, un sampler inestable, un ajuste comunitario y una tarjeta de personaje débil.
Guarda el ID completo, el checkpoint base, la variante, el archivo cuantizado y el enlace de la ficha. Un nombre uncensored no prueba que sea una variante oficial.
KoboldCpp, llama.cpp, LM Studio y los proveedores compatibles con OpenAI tienen endpoints distintos. Si existe, empieza con Chat Completions; Text Completion exige más control manual.
El formato de Google usa `system`, `user`, `model`, `<|turn>` y `<turn|>`. Utiliza la plantilla Gemma 4 o Gemini que indique el backend, no una plantilla antigua de Gemma 3.
Google documenta `<|think|>` al inicio del system prompt para activar el pensamiento. Haz una prueba corta, después añade la tarjeta y el preset. En el historial normal conserva solo la respuesta final.
La comunidad menciona SillyTavern 1.17, `--jinja` en KoboldCpp, el tokenizer Gemma4/Gemini y `<|think|>`. Son pistas de diagnóstico, no valores universales de Google.
Cuando falla la respuesta
Revisa tokenizer, plantilla y modo de generación del backend. Si el servidor ya aplica la plantilla, añadir tokens manuales puede mostrarlos literalmente. Compara thinking activado y desactivado.
Comprueba que tu versión de SillyTavern y el loader soporten Gemma 4. Una solución comunitaria puede usar `--jinja` o `<|think|>`, pero depende del servidor.
Reduce el contexto duplicado antes de tocar la temperatura. Revisa el límite y prueba temperature 1.0, top-p 0.95 y top-k 64 como punto de partida.
Ruta desde el navegador
Tabbit no es un runner local de GGUF ni un gestor de tarjetas de SillyTavern. Sirve para mantener una wiki, notas o un hilo de diagnóstico visible mientras conversas con un modelo disponible en el navegador.
Descarga el navegador basado en Chromium para macOS o Windows. No necesitas un archivo Gemma local, una clave de proveedor ni un servidor SillyTavern.
Abre el selector de modelos después de instalar. El código actual lista GPT-5.4, Gemini-3.1-Pro, Claude-Sonnet-4.6 y DeepSeek-V4-Flash, entre otros. Gemma 4 no está en ese mapping actual, así que esta página no promete ejecutarlo.
Deja la wiki o las notas en una pestaña. Escribe `@` para referenciar una página, captura o archivo y pide un esquema de escena, una comprobación de coherencia o un resumen.

Elige el cliente
Cada uno resuelve un cuello de botella distinto. Conserva los controles de RP cuando los necesites y usa el navegador cuando el contexto esté repartido entre páginas y archivos.
| SillyTavern | Tabbit | |
|---|---|---|
| Tarjetas y lorebooks | Flujo principal | Referenciar la fuente |
| Checkpoint local Gemma 4 | Preparas el backend | Usar un modelo del selector |
| Plantilla y sampler | Control detallado | Lo gestiona el modelo |
| Contexto web | Pegar o usar extensiones | Referenciar pestaña o archivo con @ |
| Primera respuesta útil | Endpoint + plantilla + preset | Instalar + elegir un modelo |

Deja la wiki o las notas en una pestaña. Escribe `@` para referenciar una página, captura o archivo y pide un esquema de escena, una comprobación de coherencia o un resumen.

Referenciar pestaña o archivo con @
Preguntas frecuentes
La ficha de Google lo llama Gemma 4 26B A4B. El checkpoint de instrucciones de Hugging Face es `google/gemma-4-26B-A4B-it`; los distribuidores pueden añadir sufijos.
No. 26B A4B es MoE, con 25,2B totales y unos 3,8B activos. Gemma 4 31B es denso y tiene unos 30,7B parámetros.
No hay una cifra única. Influyen los pesos cuantizados, KV cache, contexto, buffers y encoder visual. Mide el GGUF o build concreta con el contexto que quieras usar.
El tokenizer o la plantilla pueden no coincidir con el backend, o el servidor puede exponer el token como texto. Comprueba formato y thinking antes de cambiar el muestreo.
No lo des por hecho. El mapping actual de Tabbit no incluye Gemma 4. Tras instalarlo, usa solo un modelo que aparezca en el selector.
Para un modelo comunitario uncensored, comprueba checkpoint, ficha, licencia, memoria, tokenizer y plantilla en ese orden. Para conversar junto a una wiki, instala Tabbit y revisa el selector actual.
Disponible para macOS y Windows. La disponibilidad puede cambiar.