Conecta SillyTavern a un backend separado que sirva un checkpoint Kimi K2 identificado. SillyTavern prepara el contexto de personajes y conversaciones, pero no aloja el modelo. Primero confirma la versión, elige un servidor local o un proveedor documentado y prueba una petición sencilla antes de cargar una ficha de roleplay.
Esta guía cubre Kimi-K2-Instruct y solo una actualización K2 cuando el backend identifica explícitamente ese checkpoint. No ofrece una receta para un proveedor concreto: no verificamos un endpoint alojado, alias API, precio, cuota o disponibilidad actual. El texto permanece como borrador hasta reproducir una conexión real.
Puntos clave
SillyTavern es el cliente; otro backend debe ejecutar Kimi K2.
Confirma el checkpoint exacto, revisión, cuantización y plantilla de chat. La página oficial enlaza los pesos Kimi-K2-Instruct-0905; no mezcles configuraciones entre versiones.
El ID del repositorio de Hugging Face no tiene por qué ser el alias API del proveedor.
Chat Completions y Text Completions indican cómo se construye el prompt; no distinguen nube y local.
Comprueba conexión, modelo, plantilla y conversación en pasos separados. No se ejecutó esta receta con un backend real.
Componentes de la conexión
| Componente | Función | Qué verificar |
|---|---|---|
| Checkpoint | Proporciona los pesos y comportamiento del modelo | Variante, revisión, cuantización, licencia y plantilla |
| Servidor de inferencia | Carga el modelo y ofrece una API | Formato, versión, ruta, dirección y aplicación de plantilla |
| Proveedor alojado | Ejecuta el modelo remotamente | Modelo exacto, ID, clave, límites, coste, contexto y datos |
| SillyTavern | Prepara contexto y envía la solicitud | Tipo de API y ajustes documentados por el backend |
Que la conexión responda solo confirma que el endpoint es accesible. No confirma el checkpoint, la plantilla ni la calidad en sesiones largas.
1. Confirma el checkpoint
Empieza en la ficha oficial Kimi K2-Instruct, no en una preset antigua. La ficha muestra ejemplos locales con vLLM y SGLang, y enlaza Kimi-K2-Instruct-0905. La página del proyecto Kimi K2 describe cambios en los pesos y el contexto para 0905. Antes de instalar, anota el nombre y revisión exactos, si es una cuantización, el runtime compatible, quién aplica la plantilla y el ID aceptado en solicitudes.
Los ejemplos oficiales muestran una interfaz de chat completions compatible con OpenAI. Eso no demuestra que un proveedor cualquiera use el mismo endpoint o ID. La compatibilidad de protocolo no garantiza las mismas funciones, límites, políticas ni resultados.
No rellenes datos de K2 original con instrucciones de K2.5, K2.6, K2.7 Code, K2.8 o K3. Consulta por separado Kimi K2.6, Kimi K3 para SillyTavern y la configuración K3; sus ajustes no son presets de K2.
\nOtras guías muestran rutas distintas; sus IDs y presets no son intercambiables con K2. Consulta Mistral 24B, DeepSeek V4 Flash, GLM-5.3 y Gemma 4 como ejemplos separados. Kimi K3 roleplay corresponde a otra generación.\n
2. Elige alojamiento local o proveedor
| Ruta | Cuándo conviene | Verificación actual | Aún desconocido |
|---|---|---|---|
| Servidor local | Quieres controlar runtime y endpoint | Checkpoint, motor, plantilla, dirección y requisitos de hardware | No probamos instalación, memoria, latencia ni velocidad |
| Proveedor alojado | El catálogo enumera explícitamente tu checkpoint | ID, URL base, campo de clave, límites, coste, contexto y datos | No abrimos ni probamos un proveedor K2 |
| Web/App de Kimi | Solo necesitas el chat en su propia interfaz | Comprueba si ofrece API documentada compatible | Un chat de consumo no demuestra acceso API |
Local exige gestionar archivos del modelo, hardware y actualizaciones. Un servicio alojado evita esa tarea, pero depende de sus condiciones e instrucciones actuales. Los ejemplos de la ficha no son una recomendación completa de hardware: cuantización, tamaño del contexto, runtime y memoria influyen. No deduzcas requisitos a partir del número de parámetros activos.
Para un proveedor, abre su catálogo y documentación actuales. Si no especifican el checkpoint, formato de solicitud, campo de autorización e ID, detente y no adivines.
3. Conecta con el contrato del backend
La documentación de API Connections de SillyTavern explica que Chat Completions organiza mensajes por roles; Text Completions convierte la conversación en un texto continuo. Es una decisión sobre cómo construir el prompt, no sobre alojamiento local o nube.
Inicia el servidor según las instrucciones del checkpoint y runtime elegidos; usa el mensaje de disponibilidad del propio servidor.
En API Connections, elige el tipo documentado por ese backend. Una API compatible con OpenAI no basta para deducir la opción o la ruta exacta.
Introduce URL y credencial solo en los campos previstos. Copia los valores del documento actual; no pongas claves en fichas, notas, capturas ni presets compartidas.
Usa el ID aceptado por ese backend. Puede ser distinto al repositorio de Hugging Face.
Averigua si servidor o cliente aplica la plantilla. Evita aplicar el mismo formato dos veces.
Guarda un perfil base con checkpoint, fecha, tipo de API y responsable de la plantilla, si tu versión permite perfiles. Un perfil registra valores, no los valida.
Las etiquetas de campo cambian entre versiones; verifica ambas documentaciones. No fuerces otra API por ensayo y error con una clave real.
Protege claves y prompts privados
Trata la clave API como contraseña. No compartas capturas o perfiles sin comprobar si contienen secretos. Un endpoint local tampoco significa que sea inaccesible desde la red: sigue la guía de binding y firewall y no expongas un servidor sin autenticación a Internet.
4. Ejecuta una prueba breve
Empieza con un prompt inocuo: “Responde con una frase para confirmar que recibiste el mensaje”. Si devuelve texto normal, prueba una ficha sencilla, dos turnos y un detalle neutral del turno anterior. Busca marcadores de plantilla, etiquetas duplicadas, respuesta vacía o texto inesperado. Dos turnos no demuestran memoria larga.
Añade una sola capa cada vez: lorebook, nota del autor, saludo largo o extensión. Una ficha grande puede exceder el contexto real o incluir instrucciones para otra plantilla. Si la prueba breve funciona y la ficha larga no, compara tamaño y formato antes de cambiar generación.
| Síntoma | Capa probable | Primera comprobación |
|---|---|---|
| No conecta | Servidor/endpoint | Estado, URL, ruta, puerto y red |
| Error de autenticación | Clave/cuenta | Campo correcto, validez y permiso |
| Modelo desconocido | Identificador | Alias del backend frente al ID HF |
| Respuesta vacía | Solicitud/servidor | Tipo de API, ruta, logs y límite de salida |
| Marcadores o roles visibles | Plantilla | Si cliente y servidor formatean ambos |
| Repetición o bucle | Prompt/ajustes | Ficha duplicada, lore, contexto y stop |
| Respuesta lenta | Carga/cola/hardware | Logs, cuantización, trabajos y tamaño de prompt |
| Primera respuesta sí, siguiente no | Contexto acumulado | Historial y activación de lore |
Registra checkpoint, versión del servidor y SillyTavern, tipo de API, último cambio y error redactado. Cambia una variable cada vez. Los logs o terminal de SillyTavern pueden incluir conversaciones privadas; inspecciónalos localmente y comparte solo fragmentos mínimos sin secretos.
5. Evalúa el roleplay después
Una llamada API correcta no mide si el estilo te gusta. Mantén la ficha, prompt, contexto y ajustes iguales al comparar modelos. Evalúa si conserva la voz, hace avanzar la escena sin controlar tu personaje, respeta límites y recuerda un detalle reciente. Guarda ejemplos y limitaciones; una respuesta agradable no es una puntuación general.
No asumas que los presets de K2.6, K3 u otro modelo sirven para K2. Si el backend publica parámetros para el checkpoint exacto, registra la fuente y pruébalos después de estabilizar la conexión. La guía separada Kimi K2 roleplay trata la adecuación de estilo.
Un espacio de investigación: Tabbit Browser
Puedes mantener abiertos la ficha, la guía del runtime y los documentos de conexión en Tabbit Browser mientras registras qué fuente define cada ajuste. No probamos Tabbit con un servidor K2; no aloja el modelo ni sustituye SillyTavern. Usa el backend para inferencia y SillyTavern para el contexto de roleplay. Tabbit no valida claves ni endpoints.
Qué ruta elegir
| Situación | Siguiente paso |
|---|---|
| Tienes hardware compatible y quieres control | Sigue instrucciones oficiales del checkpoint y runtime |
| Buscas API alojada | Espera documentación que nombre checkpoint y endpoint exactos |
| Solo tienes la web de Kimi | Verifica si hay API separada y documentada |
| Conecta, pero el estilo no te sirve | Mantén ajustes y evalúa ficha/modelo aparte |
| Aparecen marcadores | Revisa quién aplica la plantilla |
En resumen, Kimi K2 puede conectarse a SillyTavern mediante un backend compatible que sirva el checkpoint exacto. Verifica versión y documentación, usa valores documentados, prueba texto simple y luego añade una ficha pequeña. Si el endpoint o ID no se documenta, no lo inventes.
Preguntas frecuentes
¿SillyTavern ejecuta Kimi K2 por sí solo?
No. Es una interfaz que prepara prompts y se conecta a un backend. Necesitas un servidor local o servicio alojado que exponga el checkpoint exacto mediante una API compatible.
¿Qué ID debo introducir?
Usa el que indique el backend para ese checkpoint o despliegue. El repositorio moonshotai/Kimi-K2-Instruct no tiene por qué ser el alias API.
¿Chat Completion o Text Completion?
Sigue el formato documentado por el backend. SillyTavern usa esa opción para construir el prompt; no distingue nube y local.
¿Puedo ejecutarlo localmente?
La ficha oficial incluye ejemplos de vLLM y SGLang. La viabilidad depende de checkpoint, cuantización, hardware y runtime; aquí no se probó ninguna instalación local.
¿Por qué recibo respuestas vacías, marcadores o repeticiones?
Comprueba endpoint e ID, y después determina qué capa aplica la plantilla. Reduce el prompt y agrega contexto de personaje gradualmente antes de cambiar ajustes de generación.
Fuentes y estado
Se consultaron en Tabbit el modelo Kimi K2-Instruct, el proyecto Kimi K2 y la guía de SillyTavern el 2026-09-23. No se verificaron proveedor, conexión real, salida, precio/disponibilidad, capturas de comunidad ni integración con Tabbit. Sigue en borrador.
Preguntas frecuentes
¿SillyTavern ejecuta Kimi K2?
No. Es la interfaz y necesita un servidor local o proveedor con el checkpoint exacto.
¿Qué ID debo usar?
El ID indicado por el backend para esa versión; el ID HF puede diferir del alias API.
¿Chat o Text Completion?
Sigue el formato del backend; no distingue nube y local.
¿Kimi K2 funciona en local?
La ficha tiene ejemplos locales; memoria y velocidad dependen del checkpoint y hardware.
¿Qué revisar ante respuestas vacías?
Endpoint, ID, conexión y capa de plantilla; después prueba con un prompt breve.