SillyTavern에서 Kimi K2를 사용하려면 특정 K2 체크포인트를 제공하는 별도 백엔드에 연결해야 합니다. SillyTavern은 캐릭터와 대화 맥락을 구성하는 클라이언트이며 모델을 호스팅하지 않습니다. 먼저 버전을 확인하고 로컬 서버나 문서화된 제공업체를 선택한 뒤, RP 맥락을 추가하기 전에 짧은 요청을 시험하세요.
이 안내는 Kimi-K2-Instruct와 백엔드가 명시적으로 식별한 K2 업데이트만 다룹니다. 특정 업체의 설정 절차는 제공하지 않습니다. 현재 호스팅 endpoint, API alias, 가격, 한도, 제공 여부를 확인하지 못했습니다. 실제 연결을 재현하기 전까지 초안 상태를 유지합니다.
핵심 요점
SillyTavern은 클라이언트입니다. Kimi K2를 실행하는 서버나 API가 별도로 필요합니다.
정확한 체크포인트, revision, 양자화, chat template을 확인하세요. 공식 페이지가 Kimi-K2-Instruct-0905를 가리키므로 버전 설정을 섞지 마세요.
Hugging Face 저장소 ID가 업체의 API alias와 같다는 보장은 없습니다.
Chat Completions와 Text Completions는 prompt 구성 방식이며 로컬/클라우드 구분이 아닙니다.
연결, 모델, template, 짧은 대화를 따로 점검하세요. 실제 K2 백엔드는 시험하지 않았습니다.
연결의 구성 요소
| 구성 요소 | 역할 | 연결 전에 확인할 항목 |
|---|---|---|
| 체크포인트 | 모델 가중치와 동작 제공 | 버전, revision, 양자화, 라이선스, template |
| 추론 서버 | 모델을 로드하고 API 공개 | 형식, 버전, 경로, 주소, template 처리 |
| 호스팅 제공업체 | 원격 모델 실행 | 정확한 모델, ID, 인증, 한도, 가격, context, 데이터 처리 |
| SillyTavern | 대화/캐릭터 문맥 구성 및 전송 | API 유형과 백엔드가 문서화한 설정 |
연결 성공은 endpoint에 도달했다는 뜻일 뿐입니다. 의도한 체크포인트, template, 장기 대화의 일관성을 증명하지 않습니다.
1. 체크포인트 확인
오래된 preset이나 영상의 짧은 이름이 아니라 공식 Kimi K2-Instruct 모델 카드부터 확인하세요. 카드에는 vLLM 및 SGLang 로컬 제공 예시와 Kimi-K2-Instruct-0905 링크가 있습니다. Kimi K2 프로젝트 페이지는 0905 업데이트가 가중치와 context 지원을 바꾼다고 설명합니다. 정확한 이름/revision, 양자화, runtime, template 적용 주체, 요청에 쓸 ID를 기록하세요.
공식 예시는 OpenAI 호환 chat completions 인터페이스를 보여 줍니다. 임의의 제공업체가 같은 endpoint나 ID를 쓴다는 뜻은 아닙니다. 프로토콜 호환성은 기능, 한도, 정책, 응답이 동일하다는 보장이 아닙니다.
원래 K2 설정을 채우려고 K2.5, K2.6, K2.7 Code, K2.8 또는 K3 문서를 사용하지 마세요. Kimi K2.6 개요, Kimi K3 SillyTavern, K3 설정은 별도 버전을 위한 자료입니다.
\n다른 모델 가이드는 설정 차이를 보는 참고 자료일 뿐, ID나 preset을 K2에 그대로 쓸 수 없습니다. 별도 경로인 Mistral 24B, DeepSeek V4 Flash, GLM-5.3, Gemma 4를 참고하세요. Kimi K3 roleplay는 다른 세대 모델을 다룹니다.\n
2. 로컬 또는 제공업체 선택
| 경로 | 적합한 상황 | 현재 문서에서 확인 | 이 초안에서 모르는 점 |
|---|---|---|---|
| 로컬 추론 서버 | runtime과 endpoint를 직접 관리 | 체크포인트, 엔진, template, URL, 하드웨어 안내 | 설치, 메모리, 지연시간, 속도 미측정 |
| 호스팅 API | 필요한 체크포인트가 카탈로그에 명시됨 | model ID, base URL, key, 한도, 가격, context, 데이터 정책 | K2 제공업체를 열어 보거나 시험하지 않음 |
| Kimi Web/App | 전용 UI만 사용 | 별도 API 상품/문서 여부 | 소비자 채팅만으로 API 접근이 확인되지 않음 |
로컬은 모델 파일, 하드웨어, 업데이트를 관리해야 합니다. 호스팅은 그 부담을 줄이지만 제공업체의 현재 조건에 의존합니다. 모델 카드의 예시는 하드웨어 추천이 아닙니다. 양자화, context, 메모리, runtime에 따라 달라지므로 활성 파라미터 수만으로 필요한 사양을 추정하지 마세요.
제공업체를 쓸 때는 최신 catalog와 연결 안내를 여세요. 정확한 체크포인트, request 형식, 인증 필드, ID가 문서에 없으면 추측하지 말고 멈추세요.
3. 백엔드 계약에 맞춰 연결
SillyTavern API Connections 문서에 따르면 Chat Completions는 역할별 메시지를 구성하고, Text Completions는 대화를 하나의 연속된 텍스트로 합칩니다. API 유형은 prompt 구성을 뜻하며 로컬/클라우드 선택이 아닙니다.
선택한 체크포인트/runtime의 공식 절차에 따라 서버를 시작하고 준비 완료 상태를 확인합니다.
API Connections에서 백엔드 문서가 지정한 유형을 선택합니다. OpenAI 호환이라는 이유만으로 정확한 메뉴나 경로를 추정하지 마세요.
endpoint와 credential을 해당 입력란에 넣습니다. 키를 캐릭터 카드, 공유 preset, 캡처, 공개 prompt에 넣지 마세요.
백엔드가 허용하는 model ID를 사용합니다. HF 저장소 ID와 다를 수 있습니다.
서버와 SillyTavern 중 어느 쪽이 template을 적용하는지 확인하고 중복 적용을 피합니다.
프로필 기능이 있다면 체크포인트, 날짜, API 유형, template 담당을 기록한 기준 프로필을 저장합니다. 저장은 검증이 아닙니다.
화면과 문서는 버전에 따라 달라집니다. 양쪽의 최신 자료를 확인하고 실제 키로 다른 API를 무작위 시도하지 마세요.
키와 개인 prompt 보호
API 키는 비밀번호처럼 다루세요. 공유 전에 캡처와 프로필에 포함됐는지 확인하고, 노출 시 제공업체 절차에 따라 교체하세요. 로컬 endpoint도 네트워크에서 접근될 수 있습니다. bind/firewall 안내를 따르고 인증되지 않은 서버를 공개망에 노출하지 마세요.
4. 짧은 스모크 테스트
먼저 “메시지를 받았는지 한 문장으로 확인해 주세요”처럼 민감하지 않은 prompt를 보냅니다. 정상적인 응답이 오는지 확인한 뒤 간단한 캐릭터 카드로 두 턴을 진행하고, 직전의 무해한 내용을 다시 물어봅니다. template marker, 중복 역할명, 빈 응답, 엉뚱한 문구를 확인하세요. 두 턴만으로 긴 문맥 처리를 입증할 수는 없습니다.
lorebook, 작가 메모, 긴 시작 인사, extension은 하나씩 추가하세요. 큰 카드가 실제 context를 넘거나 다른 template을 전제로 할 수 있습니다. 짧은 테스트만 성공하면 설정을 바꾸기 전에 prompt 크기와 형식을 비교하세요.
| 증상 | 의심 계층 | 먼저 확인 |
|---|---|---|
| 연결 실패 | 서버/endpoint | 상태, URL, 경로, port, 네트워크 |
| 인증 오류 | 키/계정 | 필드, 유효성, 권한 |
| 모델을 찾지 못함 | ID | 제공업체 alias와 HF repo |
| 빈 응답 | 요청/서버 | API 유형, 경로, 로그, 출력 한도 |
| marker 노출 | template | client와 server의 중복 포맷 여부 |
| 반복/루프 | prompt/설정 | 중복 카드, lore, context, stop |
| 속도가 느림 | 로드/하드웨어/대기열 | 로그, 양자화, 작업량, prompt 길이 |
| 첫 턴 후 실패 | 누적 context | 대화 기록, lore 활성화 |
체크포인트, 서버/SillyTavern 버전, API 유형, 마지막 변경사항, 비밀을 제거한 오류를 적고 한 번에 하나만 변경하세요. 로그와 terminal에는 사적인 대화가 들어갈 수 있으므로 로컬에서 먼저 확인합니다.
5. 연결 후 RP 평가
API 호출 성공은 문체가 취향에 맞는다는 뜻이 아닙니다. 비교 시 카드, prompt, context, 설정을 고정하세요. 캐릭터 목소리, 장면 진행, 사용자 캐릭터를 대신 조종하지 않는지, 경계 준수, 최근 정보 활용을 살펴보고 예시와 한계를 기록합니다. 한 번 좋은 응답은 종합 점수가 아닙니다.
K2.6, K3 또는 다른 모델의 preset이 K2에 맞는다고 가정하지 마세요. 정확한 체크포인트의 권장값이 backend 문서에 있으면 출처를 기록하고 연결이 안정된 후 시험하세요. 문체 적합성은 별도의 Kimi K2 roleplay 안내에서 다룹니다.
조사 작업공간으로서의 Tabbit Browser
Tabbit Browser에서 모델 카드, runtime 안내, SillyTavern 문서를 나란히 열고 각 설정의 출처를 기록할 수 있습니다. K2 서버와 Tabbit을 실제 시험하지 않았습니다. Tabbit은 모델 호스트나 SillyTavern 대체품이 아닙니다. 추론은 backend가, RP 맥락은 SillyTavern이 담당합니다. API 키나 endpoint를 검증하지 않습니다.
어떤 경로를 선택할까?
| 상황 | 다음 단계 |
|---|---|
| 호환 하드웨어와 제어권이 있음 | checkpoint와 runtime의 공식 안내 확인 |
| 호스팅 API를 원함 | 정확한 모델과 endpoint를 명시한 현행 문서 대기 |
| Kimi 웹만 사용 가능 | 별도 문서화 API 상품 확인 |
| 연결은 되지만 문체가 안 맞음 | 연결 설정을 고정하고 카드/모델 평가 |
| marker가 노출됨 | template 적용 계층 확인 |
정확한 체크포인트를 제공하고 호환 API를 제공하는 backend를 통해 Kimi K2를 SillyTavern에 연결할 수 있습니다. 버전을 확인하고 문서의 값만 입력한 다음, 짧은 메시지와 작은 캐릭터 카드로 시험하세요. 문서에 없는 endpoint나 ID를 추측하지 마세요.
자주 묻는 질문
SillyTavern이 Kimi K2를 직접 실행하나요?
아닙니다. SillyTavern은 prompt를 구성해 backend에 연결하는 UI입니다. 정확한 checkpoint를 호환 API로 제공하는 로컬 서버나 호스팅 서비스가 필요합니다.
어떤 model ID를 입력하나요?
해당 체크포인트나 배포에 대해 백엔드가 지정한 ID를 사용하세요. moonshotai/Kimi-K2-Instruct라는 HF 저장소명이 API alias와 같다는 보장은 없습니다.
Chat Completion과 Text Completion 중 무엇을 선택하나요?
백엔드 문서를 따르세요. SillyTavern이 prompt를 구성하는 방식이며 로컬/클라우드 구분이 아닙니다.
Kimi K2를 로컬에서 실행할 수 있나요?
공식 카드에 vLLM과 SGLang 예시가 있습니다. 실제 가능 여부는 체크포인트, 양자화, 하드웨어, runtime에 달려 있으며 이 안내에서는 설치를 시험하지 않았습니다.
빈 응답, marker, 반복은 왜 생기나요?
endpoint와 ID를 확인하고 어느 계층이 template을 적용하는지 살펴보세요. 생성 설정을 바꾸기 전에 prompt를 줄이고 캐릭터 맥락을 단계적으로 추가합니다.
출처와 초안 상태
공식 Kimi K2-Instruct 카드, Kimi K2 프로젝트, SillyTavern API Connections를 2026-09-23 Tabbit에서 열어 확인했습니다. 업체, 실제 연결/출력, 가격과 제공 여부, 커뮤니티 캡처, Tabbit 연동은 미검증입니다. 초안으로 유지합니다.
자주 묻는 질문
SillyTavern이 Kimi K2를 직접 실행하나요?
아닙니다. 정확한 모델을 제공하는 로컬 서버나 호스팅 서비스가 필요합니다.
어떤 ID를 입력하나요?
백엔드가 지정한 ID를 사용하세요. HF 저장소 ID와 API 별칭은 다를 수 있습니다.
Chat과 Text Completion 중 무엇을 선택하나요?
백엔드 프롬프트 형식을 따릅니다. 클라우드와 로컬 구분이 아닙니다.
로컬 실행할 수 있나요?
공식 카드에 예제가 있습니다. 메모리와 속도는 모델 및 하드웨어에 따라 다릅니다.
빈 응답이면 무엇을 확인하나요?
endpoint, ID, 연결, 템플릿 담당 계층을 확인한 뒤 짧은 입력으로 테스트하세요.