Checkpoint dense oficial
La tarjeta de Qwen se llama Qwen/Qwen3.8-27B. Indica 27B parámetros, codificador visual, licencia Apache-2.0 y contexto nativo de 262.144 tokens.
Qwen3.8-27B · guía para SillyTavern
El nombre es real, pero se mezcla con facilidad. Qwen publica un checkpoint oficial dense de visión y lenguaje, Qwen3.8-27B. Qwen3.8-Max es otro miembro de la familia: 2,4 billones de parámetros totales y 95 mil millones activos. Comprueba primero qué checkpoint y proveedor tienes.
La guía separa los datos de upstream de los informes de la comunidad. No promete un proveedor, una cuantización ni acceso en todas las cuentas de Tabbit.

Comprobar el nombre
Los resultados de búsqueda colocan varias etiquetas juntas. Apuntan a artefactos distintos, así que copiar un nombre puede llevar tu configuración local por la ruta equivocada.
La tarjeta de Qwen se llama Qwen/Qwen3.8-27B. Indica 27B parámetros, codificador visual, licencia Apache-2.0 y contexto nativo de 262.144 tokens.
El anuncio de Qwen y el nombre de los pesos abiertos describen Qwen3.8-Max con 2,4 billones totales y 95 mil millones activos. El peso abierto es Qwen3.8-2.4T-A95B, no un alias de 27B.
GGUF, FP8, GPTQ y los fine-tunes de roleplay pueden añadir sufijos o el nombre de su creador. Trata cada repositorio como un artefacto propio y lee sus notas.
SillyTavern necesita el ID exacto que expone el proveedor. Un nombre de pantalla amable no demuestra que la ruta sirva Qwen3.8-27B.
Tarjeta del modelo
Usa estos datos para elegir el runtime. Describen el checkpoint upstream, no el coste de memoria de cada archivo cuantizado.
La tarjeta lista el modelo de lenguaje dense con 27B parámetros y muestra una etiqueta de tamaño safetensors de 28B. No conviertas esa etiqueta en otro nombre.
La página lo etiqueta image-text-to-text y describe comprensión de imágenes y vídeo. El backend aún necesita el procesador y soporte multimodal adecuados.
El contexto nativo es de 262.144 tokens y la tarjeta describe una extensión hasta 1M. El contexto largo no significa que cualquier GPU pueda cargarlo.
Hay ejemplos para Transformers, vLLM, SGLang, TokenSpeed y Docker. Elige una versión actual que declare soporte para esta arquitectura.

Configuración de SillyTavern
Una tarjeta de personaje no arregla una ruta incorrecta ni una plantilla duplicada. Sigue este orden con una API alojada o un servidor local.
Las etiquetas del proveedor, los presets de la comunidad y los repositorios cuantizados no forman parte de la tarjeta upstream. Mantén cada afirmación junto a su fuente.
Copia el repositorio o ID exacto del proveedor. Decide si tienes Qwen/Qwen3.8-27B, un derivado cuantizado o el miembro Qwen3.8-2.4T-A95B.
En local, confirma que Transformers, vLLM, SGLang, llama.cpp o tu aplicación soporta el checkpoint y su ruta visual. Un GGUF puede no exponer todas las funciones multimodales.
Para un servidor compatible con OpenAI, selecciona Chat Completions, introduce la Base URL documentada y copia el model ID que devuelve el servidor. No guardes claves en la tarjeta.
Deja que la ruta alojada serialice los mensajes o usa la plantilla documentada del tokenizer local. Aplicar ambas puede romper los roles o producir respuestas muy cortas.
Si el proveedor lo permite, prueba la misma tarjeta con thinking desactivado o low, después medium y xhigh. Mide la latencia antes de tocar el preset de estilo.
Diagnóstico rápido
Mantén fija la tarjeta y el mensaje inicial. Cambia una entrada cada vez y guarda el model ID que devuelve cada prueba.
| Síntoma | Comprueba primero | Ajuste pequeño |
|---|---|---|
| Modelo no encontrado o fallback silencioso | Lista del proveedor y model de la respuesta | Copia el ID expuesto y elimina el alias qwen3.8-27b inventado. |
| Se rompen roles, etiquetas o formato | Quién controla la plantilla | Usa una sola ruta de plantilla y abre un chat nuevo. |
| Falta VRAM | Formato, contexto y entradas visuales | Prueba un quant menor, menos contexto y una línea base de texto. |
| Mucho razonamiento, poco avance | Modo de razonamiento, límite de salida y preset | Compara low o medium con xhigh en la misma tarjeta. |
| La prosa cambia entre proveedores | Filtros, samplers y prompt de sistema | Registra la ruta como variable; no lo llames un hecho del modelo. |
Tarjeta de prueba RP
Un prompt de prueba compacto hace visibles las diferencias de plantilla, razonamiento y proveedor.
Role: Eres [personaje]. Scene: [lugar, relación, conflicto actual]. Style: [punto de vista, idioma, longitud]. Direction: Avanza una acción observable. No hables por el usuario. Continuity: Usa solo hechos confirmados; pregunta si dudas. Format: Acción primero, diálogo después. 250 a 450 palabras. Sin resumen. Check: Conserva la voz, los límites y la pista pendiente del turno anterior.
Envía la misma tarjeta tres veces. Compara latencia, etiquetas inesperadas, formato y movimiento de la escena. Después cambia temperatura, contexto o preset.
Ruta del navegador
SillyTavern sigue siendo el cockpit especializado para tarjetas y lorebooks. Tabbit ayuda cuando el problema es leer una tarjeta, comparar proveedores y escribir con una referencia sin copiar todo.
Deja la tarjeta de Hugging Face, la documentación del proveedor o la wiki del personaje en una pestaña.
Abre el selector de modelos de Tabbit y elige Qwen3.8-27B solo si tu edición y cuenta muestran esa opción exacta. El selector es la fuente de disponibilidad.
Usa @ para llevar una página, captura o archivo a la pregunta. Pide a otro modelo que extraiga requisitos de plantilla o compare una nota de quant con la tarjeta.
El chat multimodelo puede leer la misma fuente desde varios ángulos. La captura demuestra el flujo del navegador, no acceso idéntico para todos.

Ruta del navegador


Elegir superficie
Resuelven partes distintas del flujo de roleplay. Conserva los controles especializados y usa el navegador cuando la referencia sea el cuello de botella.
| Necesidad | SillyTavern | Tabbit |
|---|---|---|
| Tarjetas y lorebooks | Controles RP dedicados | Citar páginas y archivos |
| Preset y orden de prompts | Control detallado | Prompt de sistema y Skills |
| Leer docs junto al RP | Extensiones o copiar y pegar | Las pestañas abiertas son contexto |
| Comparar respuestas | Proveedor o extensiones | Chat multimodelo en el navegador |
| Primer paso | Verificar ID, backend y plantilla | Abrir la fuente y revisar el selector |
Abrir la evidencia
Estos enlaces separan las especificaciones upstream de los informes que explican los problemas habituales en SillyTavern.
Preguntas frecuentes
Sí. Qwen/Qwen3.8-27B tiene una tarjeta oficial en Hugging Face y es un checkpoint dense de visión y lenguaje de 27B. Es distinto de Qwen3.8-Max y Qwen3.8-2.4T-A95B.
No. Qwen3.8-Max se describe con 2,4 billones de parámetros totales y 95 mil millones activos. No uses su ID ni su quant de 2,4T para probar el modelo dense de 27B.
Depende de GPU, RAM, contexto y backend. Empieza con un repositorio que declare formato y soporte del loader. GGUF, FP8, GPTQ y fine-tunes son artefactos distintos.
Un proveedor alojado suele serializar los mensajes. Un servidor local debe seguir el tokenizer o la documentación del checkpoint. No apliques una segunda plantilla Qwen.
Revisa por separado razonamiento, límite de salida, contexto, samplers y proveedor. Repite la misma tarjeta y anota la ruta antes de cambiar el prompt.
Solo si el selector de modelos de Tabbit muestra ese modelo exacto. La disponibilidad depende de edición, región, cuenta y despliegue. También puedes usar Tabbit para mantener la tarjeta junto a un chat compatible.
Instala Tabbit para macOS o Windows, revisa el selector real y lleva la tarjeta del modelo o la wiki del personaje a la misma conversación del navegador.
El acceso al modelo y las condiciones del proveedor cambian según edición y despliegue.