thinking 마커가 답변에 그대로 보임
temperature를 바꾸기 전에 instruct 또는 chat template, tokenizer, reasoning mode를 확인하세요. <|think|> 같은 마커는 형식이 맞지 않으면 일반 텍스트가 됩니다.
Gemma 4 × SillyTavern 설정
Gemma 4의 답변이 이상하다고 바로 새 프리셋이 필요한 것은 아닙니다. 모델 ID, chat template, system role, context와 sampler를 순서대로 확인하세요. 만능 레시피가 아니라 검증 가능한 기준을 정리했습니다.

증상부터 보기
형식 오류와 샘플링 선택을 구분하세요. 증상을 설명하는 가장 작은 변경부터 시작하면 원인을 찾기 쉽습니다.
temperature를 바꾸기 전에 instruct 또는 chat template, tokenizer, reasoning mode를 확인하세요. <|think|> 같은 마커는 형식이 맞지 않으면 일반 텍스트가 됩니다.
response token 한도와 남은 context를 확인하세요. 긴 캐릭터 카드와 대화 기록이 생성 공간을 모두 차지할 수 있습니다.
중복 카드 텍스트, 가득 찬 context, 강한 반복 제어를 확인하세요. 여러 sampler를 바꾸기 전에 깨끗한 prompt로 테스트하세요.
모델과 메모리
Google은 26B A4B를 mixture-of-experts, 31B를 dense로 설명합니다. MoE는 token마다 활성화되는 파라미터가 적어도 가중치는 모두 로드해야 합니다. 양자화와 context 길이가 실제 메모리 사용량을 바꿉니다.
| Model | Profile | Memory note | Fit |
|---|---|---|---|
| 26B A4B | MoE. token마다 4B 활성 | Google 기준 Q4_0 가중치 약 14.4 GB. context 제외 | backend가 형식을 지원할 때 로컬 후보 |
| 31B | Dense 모델 | Google 기준 Q4_0 가중치 약 17.5 GB. context 제외 | 메모리와 응답 속도를 확인하고 선택 |
| Q4, Q5, Q6 | 양자화 파일이며 새 공식 모델명이 아님 | 낮은 정밀도는 메모리를 줄일 수 있지만 품질과 속도가 달라짐 | 게시자의 model card와 backend 형식을 따름 |
수치는 가중치 로드에 대한 대략적인 값입니다. runtime, KV cache와 선택한 context를 위한 공간도 남겨 두세요.
연결 레이어
각 레이어를 별도의 확인 지점으로 보세요. 변경 뒤 증상이 생겼다면 돌아갈 위치가 분명해집니다.
Setting
connector, server URL, 정확한 checkpoint slug
Baseline / watch
provider 또는 backend에 표시된 ID 사용
잘못된 alias, 오래된 모델, 지원하지 않는 양자화 형식
Setting
Chat Completions, Text Completion, template
Baseline / watch
지원하면 Chat Completions부터 시작
header나 thinking marker가 일반 텍스트로 표시
Setting
system message와 위치
Baseline / watch
짧고 명확하게 카드와 분리
backend가 무시하거나 중복
Setting
context tokens와 최대 response tokens
Baseline / watch
긴 기록을 넣기 전에 response 공간 확보
중간 종료, 세부 내용 망각, 메모리 증가
Setting
temperature, Top P, Top K, Min P, 반복 제어
Baseline / watch
중립적인 시작점에서 하나씩 변경
루프, 밋밋한 문장, 불안정한 캐릭터
Sampler 기준
Google과 커뮤니티 가이드는 보통 Temperature 1.0, Top P 0.95, Top K 64 근처에서 시작합니다. SillyTavern은 각 제어를 따로 정의합니다. 첫 테스트 값이지 최고의 프리셋은 아닙니다.
첫 테스트
SillyTavern은 제어 항목마다 비활성화 값이 다릅니다. backend의 범위와 문서도 확인하세요.
짧은 prompt, 같은 카드, 같은 context를 사용하고 결과를 저장하세요. 다음 변경과 비교할 수 있습니다.
답변이 밋밋하면 조금 올리고, 혼란스러우면 조금 내리세요. 테스트 중에는 Top P와 Top K를 고정하세요.
Top P 또는 Top K를 한 번에 하나씩 바꾸세요. SillyTavern에서 Min P는 0이면 비활성화되며 backend가 지원할 때 나중에 낮은 값으로 테스트할 수 있습니다.
먼저 중복 context를 확인하세요. Repetition penalty 1과 DRY multiplier 0은 비활성 상태입니다. 강한 값은 일반 단어까지 억제할 수 있습니다.
수정 지도
template, tokenizer, reasoning mode를 다시 확인하세요. 지원된다면 Chat Completions를 시도하세요. 형식을 알기 전에는 marker를 prompt에 넣지 마세요.
response tokens를 늘리기 전에 context 사용량을 확인하세요. 중복 lore와 카드 문장을 줄이고 KV cache 여유도 확인하세요.
중복 메시지와 context 경계를 확인하세요. repetition penalty 1, DRY 0으로 되돌린 뒤 완만한 제어 하나만 테스트하세요.
비교할 때 backend, 카드, sampler를 고정하세요. 양자화 suffix, context 길이, 생성 속도를 기록하세요. Q4 결과를 BF16 결과로 볼 수는 없습니다.
별도 경로
Tabbit은 macOS와 Windows용 Chromium 기반 AI 브라우저입니다. 로컬 Gemma checkpoint를 실행하거나 SillyTavern 카드를 대신하지 않습니다. 페이지, 스크린샷, 파일을 읽으며 옆에서 질문할 때 적합합니다.
데스크톱 브라우저를 다운로드하고 새 탭을 여세요. 공식 사이트는 macOS 12+와 Windows 10+를 지원한다고 안내합니다.
설치한 Tabbit의 선택기에 실제로 표시되는 모델을 고르세요. 목록은 바뀔 수 있으며, 이 페이지는 Gemma 4 제공을 약속하지 않습니다.
캐릭터 wiki, prompt 메모, 문서를 탭에 남기세요. @로 페이지, 스크린샷, 파일을 참조해 메모나 요약을 요청하세요.



워크플로 선택
작업에 맞춰 선택하세요. 모델과 카드를 세밀하게 제어하려면 로컬, 페이지 자체가 context라면 Tabbit입니다.
| SillyTavern + 로컬 backend | Tabbit | |
|---|---|---|
| Checkpoint와 양자화 | 직접 선택하고 로드 | 선택기에 표시된 모델 사용 |
| Template와 sampler | 세밀하게 제어 | 선택한 모델이 관리 |
| 카드와 lorebook | 핵심 워크플로 | 원본 페이지를 열어 둠 |
| 페이지, 이미지, 파일 context | 붙여넣거나 확장 기능 구성 | @로 탭이나 파일 참조 |
| 첫 진단 | ID → template → context → sampler | 열기, 참조, 질문 |

Sampler 기준
SillyTavern은 제어 항목마다 비활성화 값이 다릅니다. backend의 범위와 문서도 확인하세요.
FAQ
Temperature 1.0, Top P 0.95, Top K 64에서 시작하고 Min P 0, repetition penalty 1, DRY multiplier 0으로 두세요. 시작값이므로 한 번에 하나만 바꾸세요.
구조가 다릅니다. Google은 26B A4B를 MoE, 31B를 dense로 설명합니다. model card, 대략적인 가중치 메모리, context, backend를 확인하세요.
template, tokenizer, backend, reasoning mode의 형식이 맞지 않을 수 있습니다. <|think|>를 추가하기 전에 네 가지를 확인하세요.
요청 예산을 공유하고 전체 context가 커질수록 KV cache도 커집니다. SillyTavern은 response 공간을 뺀 context를 보냅니다.
이 페이지는 그렇게 말하지 않습니다. 설치 후 현재 선택기에 표시된 모델만 사용하세요. 카드와 sampler는 SillyTavern, 페이지 context는 Tabbit에 맞습니다.
로컬 Gemma 4에서는 model card, template, context 연결을 확인하세요. 페이지 중심 작업이라면 Tabbit을 설치하고 현재 선택기에서 모델을 고르세요.
macOS와 Windows 지원. 모델 제공 여부는 바뀔 수 있습니다.