계속 생각함
thinking이 켜져 있는지, 추론 예산이 충분한지, 공급자가 thinking block을 보존하는지 확인하세요. 낮은 reasoning effort는 한 턴을 빠르게 만들 수 있지만 긴 작업에서는 재시도가 늘 수 있습니다.
QWEN 3.8 + SILLYTAVERN
답변이 반복되거나, 너무 오래 생각하거나, 캐릭터 정보를 잊거나, 중간에 멈출 때 원인은 샘플러 하나가 아닐 수 있습니다. 먼저 연결과 채팅 템플릿을 확인한 뒤 변수 하나만 바꾸고 같은 짧은 테스트를 반복하세요.
아래 값은 문서에 나온 시작점이며 모든 카드에 맞는 최적 프리셋이 아닙니다. 공급자, 백엔드, 양자화, 카드와 컨텍스트 예산도 Qwen3.8-27B 동작에 영향을 줍니다.

실패부터 확인
같은 나쁜 답변도 잘못된 엔드포인트, 맞지 않는 템플릿, 작은 컨텍스트, 지나치게 제한적인 샘플러 조합에서 나올 수 있습니다. 프리셋을 바꾸기 전에 바뀐 항목을 기록하세요.
thinking이 켜져 있는지, 추론 예산이 충분한지, 공급자가 thinking block을 보존하는지 확인하세요. 낮은 reasoning effort는 한 턴을 빠르게 만들 수 있지만 긴 작업에서는 재시도가 늘 수 있습니다.
컨텍스트 경계와 response 할당을 확인하세요. SillyTavern은 캐릭터 정보, 시스템 프롬프트와 채팅 기록을 context에 보냅니다. 오래된 메시지가 범위 밖일 수 있습니다.
repetition penalty, DRY, top-p, top-k와 min-p를 함께 확인하세요. Qwen은 여러 항목의 중립값을 문서화했습니다. 한 번에 하나만 바꾸세요.
모델 ID, 채팅 템플릿, 추론 태그 처리와 프롬프트 후처리를 확인하세요. 샘플러는 다른 모델 계열용 요청 형식을 고치지 못합니다.
문제 해결 순서
반복 가능한 짧은 캐릭터 턴을 사용하세요. 카드, 프롬프트, 가능한 seed와 출력 길이를 유지하며 계층을 확인합니다.
공급자가 실제로 Qwen3.8-27B를 제공하는지 확인하고 정확한 모델 ID를 복사한 뒤 Test Message를 보냅니다. Custom OpenAI-compatible endpoint라면 base URL과 /v1/models도 확인하세요.
Qwen3.8용 템플릿을 사용하세요. 공식 카드는 thinking을 기본으로 켭니다. 직접 답하게 하려면 백엔드가 문서화한 필드로 끄고, 과거 thinking을 보존할지도 정하세요.
카드와 최근 대화를 담을 context를 확보하고 response 공간을 남기세요. 큰 컨텍스트 값을 적어도 백엔드나 양자화 버전이 같은 크기를 노출한다는 뜻은 아닙니다.
아래 공식 행에서 시작하세요. 설정 하나를 바꾸고 같은 짧은 턴을 몇 번 재생성해 눈에 보이는 결과를 기록한 다음 다음 변수를 테스트하세요.
공급자가 필드를 무시한다면 화면 값만으로 모델이 받은 사실을 증명할 수 없습니다. 가능하면 요청 또는 응답 메타데이터를 확인하세요.
참조 표
Qwen은 Thinking Mode와 Instruct 또는 non-thinking mode를 따로 제시합니다. SillyTavern 문서는 샘플러를 끄는 중립값도 설명합니다. 테스트 중인 모드에 맞는 행을 고르세요.
| 파라미터 | Thinking mode | Instruct / non-thinking | 확인할 점 |
|---|---|---|---|
| temperature | 1.0 | 0.7 | 낮을수록 예측 가능, 높을수록 다양함. |
| top_p | 0.95 | 0.80 | 1은 nucleus 필터를 끔. |
| top_k | 20 | 20 | 백엔드에 따라 0 또는 -1로 끔. |
| min_p | 0.0 | 0.0 | 너무 높으면 반복이 심해질 수 있음. |
| presence_penalty | 0.0 | 1.5 | Qwen은 0에서 2로 반복을 줄일 수 있다고 설명. |
| repetition_penalty | 1.0 | 1.0 | 1은 효과를 끔. |
| reasoning_effort | xhigh | 해당 없음 | xhigh, medium, low를 문서화. |
| preserve_thinking | true | true | 최신 추론만 남기려면 끔. |
Qwen 모델 카드의 시작값입니다. 샘플러 지원은 프레임워크와 공급자마다 다르며 모든 캐릭터 카드에서 더 나은 RP를 보장하지 않습니다.
샘플러처럼 보이는 경계 사례
각각을 별도 실험으로 다루세요. 커뮤니티 프리셋은 어떤 계층이 바뀌었는지 숨길 수 있습니다.
SillyTavern에서 context tokens는 response를 배정한 뒤 프롬프트 예산입니다. response가 길수록 느리고 카드와 기록 공간은 줄어듭니다. Qwen3.8-27B의 네이티브 지원은 262,144 tokens지만 실제 한도는 백엔드와 양자화에 따라 낮을 수 있습니다.
공식 카드는 이미지와 영상 이해를 설명합니다. 커넥터가 백엔드가 요구하는 형식으로 미디어를 보내지 못하면 통합 문제입니다. temperature를 바꿔도 해결되지 않습니다.
BF16, FP8과 저비트 빌드는 메모리와 수치 정밀도를 서로 다르게 교환합니다. 같은 백엔드, 프롬프트, context와 sampler로 비교한 뒤 프리셋을 의심하세요.
repetition_penalty 1은 중립입니다. range나 slope가 높으면 흔한 단어도 벌점을 받을 수 있습니다. DRY는 반복 시퀀스를 대상으로 하며 multiplier 0으로 끕니다. 반복이 재현될 때만 제어 하나를 추가하세요.
다른 컨텍스트 경로
캐릭터 카드와 lorebook에는 SillyTavern이 적합합니다. 페이지, PDF, 스크린샷이나 조사에서 시작하는 작업에는 Tabbit이 편합니다. 출처를 열고 모델을 선택한 뒤 컨텍스트를 계속 보면서 작업하세요.
macOS 또는 Windows 데스크톱 브라우저를 사용하고 wiki, 프롬프트 가이드 또는 문서를 메인 화면에 둡니다.

새 탭 입력창이나 사이드 채팅에서 Tabbit 모델 선택기를 엽니다. 목록은 제품 업데이트로 바뀌므로 모든 로컬 Qwen3.8 가중치를 쓸 수 있다고 가정하지 마세요.

@를 입력해 탭, 스크린샷 또는 파일을 참조합니다. 출처를 보면서 장면 개요, 카드 수정 또는 비교를 요청할 수 있습니다.

@를 입력해 탭, 스크린샷 또는 파일을 참조합니다. 출처를 보면서 장면 개요, 카드 수정 또는 비교를 요청할 수 있습니다.

FAQ
Thinking Mode는 temperature 1.0, top_p 0.95, top_k 20, min_p 0.0, presence_penalty 0.0, repetition_penalty 1.0입니다. Instruct 또는 non-thinking mode는 0.7, 0.80, 20, 0.0, 1.5, 1.0입니다.
비교용 시작점으로만 사용하세요. 게시물은 모델 버전과 백엔드를 섞기도 합니다. 필드를 기록한 뒤 공식 행을 변수 하나씩 테스트하세요.
공식 카드에서 thinking은 기본으로 켜져 있습니다. 샘플러를 바꾸기 전에 연결기의 템플릿, 추론 태그와 공급자 지원을 확인하세요.
카드, 시스템 프롬프트와 최근 채팅에 공간을 주고 response도 남기세요. 네이티브 상한은 262,144 tokens지만 사용하는 스택은 더 작을 수 있습니다.
먼저 repetition_penalty 1과 DRY multiplier 0을 사용하세요. 중립 또는 비활성 값입니다. 같은 테스트에서 반복이 계속될 때만 하나를 추가하세요.
이 페이지는 그렇게 주장하지 않습니다. Tabbit은 브라우저 모델 선택기와 컨텍스트 기능을 제공합니다. 현재 선택기를 확인하고 로컬 가중치에는 SillyTavern과 로컬 백엔드를 사용하세요.
공식 행에서 시작하고 변수 하나를 바꾸며 출처를 보이게 유지하세요. 웹이나 문서에서 시작하는 작업은 Tabbit에서 열고 브라우저 컨텍스트 경로를 사용하면 됩니다.
macOS와 Windows에서 사용 가능. 모델 제공 여부는 제품 업데이트에 따라 바뀔 수 있습니다.