KIMI K3 / 추론 프리필

답변을 프리필하고, 잘못된 추론 블록은 넣지 마세요

Kimi K3는 항상 추론합니다. Partial Mode는 assistant 메시지의 접두사를 이어가지만 추론과 최종 내용은 별도 필드로 올 수 있습니다. 이 경계가 빈 응답, 400 오류, 추론 노출과 다음 턴의 문맥 손실을 설명합니다.

호환성 지도 보기

공식 Kimi Chat Completions 문서는 K3, Partial Mode, K2.x 차이를 설명합니다. 공급자 지원은 별도로 확인하세요.

Tabbit 새 탭에서 중앙 프롬프트와 모델 선택 목록이 열려 있어 현재 모델 목록을 확인하는 화면.

계약부터 확인

추론과 프리필은 서로 다른 경계입니다

Kimi 문서는 구체적입니다. 커뮤니티 글은 공급자와 SillyTavern 증상을 알려 주지만 보편적인 우회법을 보장하지는 않습니다.

K3는 항상 추론합니다

K3는 최상위 `reasoning_effort`에 `low`, `high`, `max`를 사용합니다. K2.x의 `thinking` 설정을 K3 요청에 복사하지 마세요.

Partial Mode는 내용을 이어갑니다

`messages` 끝에 `assistant` 메시지를 두고 `partial: true`를 설정해 다음 출력의 접두사를 안내합니다. 비공개 추론을 주입하는 문서화된 방법은 아닙니다.

공급자도 테스트 변수입니다

게이트웨이는 `partial`, `reasoning_effort`, `reasoning_content`를 바꾸거나 삭제하거나 거부할 수 있습니다. 역할 카드를 바꾸기 전에 프리필을 끈 같은 프롬프트와 비교하세요.

필드 지도

K3와 K2.x는 같은 thinking 스위치를 쓰지 않습니다

모델 계열에 맞춰 필드를 선택하세요. 이 표는 진단을 돕지만 게이트웨이가 모든 필드를 그대로 전달한다는 뜻은 아닙니다.

K3와 K2.x는 같은 thinking 스위치를 쓰지 않습니다
질문Kimi K3Kimi K2.x
thinking을 끌 수 있나요?아니요. K3는 항상 추론합니다.모델에 따라 다릅니다. K2.6은 enabled 또는 disabled를 문서화하고, K2.7-code는 enabled로 고정됩니다.
추론 제어최상위 `reasoning_effort`: low, high, max.`thinking.type`이며 기본값은 모델마다 다릅니다.
보존된 기록K3는 preserved thinking을 사용합니다. 공급자가 요구하면 완전한 assistant turn을 돌려보내세요.`thinking.keep`은 K2.x에 문서화되어 있으며 모델마다 다릅니다.
프리필`partial: true`와 마지막 assistant 접두사로 Partial Mode를 이어갑니다.모델과 공급자 문서를 확인하세요. K3 예시만으로 지원을 추정하지 마세요.

K3 요청에 `thinking: { type: "enabled" }`가 있다면 공급자가 변환 계층을 명시한 경우가 아니면 삭제하세요.

프리필 점검

접두사를 넣기 전에 깨끗한 턴을 실행하세요

짧고 통제된 테스트로 문제가 프롬프트, 응답 매핑, 기록 또는 공급자 중 어디에 있는지 나눌 수 있습니다. 같은 모델과 엔드포인트를 유지하고 한 번에 한 가지만 바꾸세요.

최소 Partial Mode 형태

{
  "model": "kimi-k3",
  "messages": [
    {"role": "user", "content": "상태 객체를 반환하세요."},
    {"role": "assistant", "content": "{\"status\":", "partial": true}
  ],
  "reasoning_effort": "low",
  "stream": false
}

이 예시는 필드의 역할을 보여 주며 SillyTavern 전용 preset이 아닙니다. 코드에 API 키를 넣지 마세요.

  1. 01

    1. 모델 계열 확인

    공급자 목록에서 정확한 모델 slug를 확인하세요. 공식 Kimi API에서 K3 별칭은 `kimi-k3`지만 게이트웨이는 다른 별칭을 쓸 수 있습니다.

  2. 02

    2. 깨끗한 요청 하나 보내기

    `partial`을 제거하고 일반 user 메시지를 사용하며 문서에 나온 K3 추론 필드만 설정하세요. 최종 `content`와 반환된 `reasoning_content`를 모두 저장하세요.

  3. 03

    3. 짧은 assistant 접두사 추가

    마지막 assistant 메시지에 짧은 접두사를 넣고 `partial: true`를 설정하세요. 긴 역할극 블록 대신 `{"status":` 같은 형식 안내부터 시작하세요.

  4. 04

    4. 완전한 assistant turn 재생

    다음 턴에는 공급자 문서가 정한 형태로 완전한 assistant 메시지를 보존하세요. 추론 블록을 content 접두사에 이어 붙이지 마세요.

공급자와 프런트엔드

OpenAI 호환은 형태일 뿐 보장은 아닙니다

SillyTavern은 사용자 지정 OpenAI 호환 엔드포인트에 연결할 수 있고 models 엔드포인트가 없으면 모델 ID를 직접 입력할 수 있습니다. 어떤 K3 필드가 살아남는지는 엔드포인트가 결정합니다.

Moonshot 공식게이트웨이 또는 SillyTavern 경로
모델`kimi-k3`현재 공급자가 제시한 정확한 alias를 사용하세요.
추론`reasoning_effort` low, high, max그대로 전달되는지, 이름이 바뀌는지, 빠지는지 확인하세요.
Partial Modeassistant 접두사와 `partial: true`이 모델에서 해당 필드를 받는지 확인하세요.
응답 기록필요할 때 assistant 메시지를 보존reasoning과 content가 따로 보존되는지 확인하세요.
SillyTavern 설정문서에 나온 API source 사용Test Message와 Bypass API status check로 프런트엔드 검사를 분리할 수 있습니다.

증상에서 테스트로

오류가 다음 변경을 고르게 하세요

이 테스트는 진단 범위를 좁혀 줍니다. 커뮤니티 보고는 가설을 제시할 수 있지만 선택한 공급자의 요청과 응답이 증거입니다.

K2.x preset을 가져온 뒤 400

추론 스키마 오류

`thinking`과 K2.x 기록 필드를 제거하고 K3의 `reasoning_effort`와 공급자의 현재 모델 alias를 사용하세요.

추론이 보인 뒤 빈 응답

응답 매핑 또는 기록

스트리밍 delta와 비스트리밍 필드를 확인하세요. `content`만 남기지 말고 완전한 assistant turn을 보존하세요.

프리필이 거부나 이상한 이어쓰기를 반환

Partial Mode 또는 공급자

`partial`을 끄고 깨끗한 완료와 비교하세요. 해당 모델과 경로가 프리필을 문서화했는지 확인하세요.

최종 답변에 추론 텍스트가 표시됨

렌더러 경계

`reasoning_content`와 `content`를 따로 렌더링하세요. 화면 표시를 위해 두 필드를 합치지 마세요.

다음 턴에서 문맥이 사라짐

기록이 잘리거나 편집됨

보내는 messages를 기록하고 완전한 assistant 객체를 유지한 뒤 공급자의 context limit을 확인하세요.

추론이 너무 오래 걸림

effort, prompt 또는 quota

공급자가 문서화한 낮은 effort를 시도하고 테스트 기록을 줄인 뒤 프리필을 끈 결과와 비교하세요.

설정이 적은 경로

먼저 자료 옆에서 Kimi에게 물어보세요

캐릭터 시트, API 문서 또는 조사 페이지를 확인해야 한다면 Tabbit에서 현재 모델을 선택하고 자료를 화면에 둔 채 질문할 수 있습니다. 브라우저 작업에 엔드포인트를 연결할 필요가 없으며, 카드와 확장 기능은 SillyTavern에서 계속 사용할 수 있습니다.

01

페이지나 파일을 열어 두기

현재 페이지, 스크린샷 또는 로컬 파일을 문맥으로 사용하세요. 프리필 payload를 만들지 않고도 초점을 좁힌 질문을 할 수 있습니다.

새 탭에 열린 Tabbit 모델 선택기와 보이는 프롬프트 입력란 및 모델 목록.
02

현재 모델 선택기 확인

목록에 Kimi-K3가 있을 때 선택하세요. 스크린샷은 인터페이스 예시이므로 이용 가능 여부는 edition과 plan에 따라 달라집니다.

다른 모델 답변 옆에 Kimi-K3 열이 있는 Tabbit 다중 모델 채팅 화면.
03

깨끗한 답변 비교

사이드바에서 빠르게 질문하거나 여러 답변을 비교하세요. 공급자별 Partial Mode 테스트로 돌아가기 전에 기준을 만들 수 있습니다.

API 프리필 payload 없이 페이지 문맥을 보여 주는 기사 옆 Tabbit 요약 사이드바.

추론 프리필 FAQ

다음 오류가 난 턴을 위한 답변

Kimi K3는 assistant prefill을 지원하나요?+

공식 API는 Partial Mode를 문서화합니다. `messages` 마지막에 assistant 메시지를 넣고 `partial: true`로 접두사를 이어가세요. 사용하는 공급자도 확인해야 합니다.

Kimi K3의 reasoning_content를 프리필할 수 있나요?+

가능하다고 가정하지 마세요. 문서화된 Partial Mode는 assistant 출력 접두사를 프리필합니다. 추론 출력은 별도 응답 경계이며 공급자가 주입 시도를 거부하거나 바꿀 수 있습니다.

thinking과 reasoning_effort 중 무엇을 보내나요?+

K3에는 최상위 `reasoning_effort`와 `low`, `high`, `max`를 사용하세요. `thinking` 객체는 K2.x 예시에 속하며 모든 Kimi 모델에 통하는 스위치가 아닙니다.

프리필 요청이 빈 답을 반환하는 이유는 무엇인가요?+

프리필을 끄고 깨끗한 요청을 보낸 다음 `content`와 `reasoning_content`가 따로 도착하는지 확인하세요. 다음 요청에서 완전한 assistant 메시지를 보존했는지도 확인하세요.

SillyTavern이 400을 표시하는 이유는 무엇인가요?+

모델 alias, 엔드포인트, JSON 형태와 공급자 지원을 확인하세요. 프롬프트를 바꾸기 전에 복사한 K2.x 필드와 지원하지 않는 sampler를 제거하세요.

프리필을 지원하는 공급자는 Moonshot뿐인가요?+

Reddit에는 Moonshot에서만 지원을 찾았다는 사용자 경험이 있지만 보편적인 공급자 규칙은 아닙니다. 사용하는 경로의 최신 문서를 확인하세요.

경계를 눈에 보이게 한 뒤 작업 방식을 고르세요

공식 K3 필드 이름을 사용하고 짧은 접두사로 Partial Mode를 테스트한 뒤 공급자가 요구하는 assistant turn을 보존하세요. 페이지 기반 질문이라면 Tabbit을 열고 현재 모델 선택기에서 Kimi-K3를 고르세요.

macOS와 Windows에서 사용할 수 있습니다. 모델 이용 권한과 quota는 현재 edition과 plan에 따라 달라집니다.

© 2026 Tabbit Browser. 당신의 맥락을 이해하는 AI 네이티브 브라우저.