Gemma 4 × SillyTavern 설정

먼저 설정 레이어를 고치세요

Gemma 4의 답변이 이상하다고 바로 새 프리셋이 필요한 것은 아닙니다. 모델 ID, chat template, system role, context와 sampler를 순서대로 확인하세요. 만능 레시피가 아니라 검증 가능한 기준을 정리했습니다.

Google Gemma 4 문서 확인
세로 탭과 중앙 입력창, 페이지 옆 채팅 패널이 보이는 Tabbit 데스크톱 브라우저.

증상부터 보기

출력에 따라 확인할 설정이 달라집니다

형식 오류와 샘플링 선택을 구분하세요. 증상을 설명하는 가장 작은 변경부터 시작하면 원인을 찾기 쉽습니다.

01

thinking 마커가 답변에 그대로 보임

temperature를 바꾸기 전에 instruct 또는 chat template, tokenizer, reasoning mode를 확인하세요. <|think|> 같은 마커는 형식이 맞지 않으면 일반 텍스트가 됩니다.

02

답변이 끊기거나 비어 있음

response token 한도와 남은 context를 확인하세요. 긴 캐릭터 카드와 대화 기록이 생성 공간을 모두 차지할 수 있습니다.

03

반복하거나 캐릭터가 흐려짐

중복 카드 텍스트, 가득 찬 context, 강한 반복 제어를 확인하세요. 여러 sampler를 바꾸기 전에 깨끗한 prompt로 테스트하세요.

모델과 메모리

26B A4B와 31B는 서로 다른 선택입니다

Google은 26B A4B를 mixture-of-experts, 31B를 dense로 설명합니다. MoE는 token마다 활성화되는 파라미터가 적어도 가중치는 모두 로드해야 합니다. 양자화와 context 길이가 실제 메모리 사용량을 바꿉니다.

ModelProfileMemory noteFit
26B A4BMoE. token마다 4B 활성Google 기준 Q4_0 가중치 약 14.4 GB. context 제외backend가 형식을 지원할 때 로컬 후보
31BDense 모델Google 기준 Q4_0 가중치 약 17.5 GB. context 제외메모리와 응답 속도를 확인하고 선택
Q4, Q5, Q6양자화 파일이며 새 공식 모델명이 아님낮은 정밀도는 메모리를 줄일 수 있지만 품질과 속도가 달라짐게시자의 model card와 backend 형식을 따름

수치는 가중치 로드에 대한 대략적인 값입니다. runtime, KV cache와 선택한 context를 위한 공간도 남겨 두세요.

연결 레이어

카드와 답변 사이에는 다섯 레이어가 있습니다

각 레이어를 별도의 확인 지점으로 보세요. 변경 뒤 증상이 생겼다면 돌아갈 위치가 분명해집니다.

01

Endpoint와 모델 ID

Setting

connector, server URL, 정확한 checkpoint slug

Baseline / watch

provider 또는 backend에 표시된 ID 사용

잘못된 alias, 오래된 모델, 지원하지 않는 양자화 형식

02

Chat 또는 instruct 형식

Setting

Chat Completions, Text Completion, template

Baseline / watch

지원하면 Chat Completions부터 시작

header나 thinking marker가 일반 텍스트로 표시

03

System role

Setting

system message와 위치

Baseline / watch

짧고 명확하게 카드와 분리

backend가 무시하거나 중복

04

Context와 response

Setting

context tokens와 최대 response tokens

Baseline / watch

긴 기록을 넣기 전에 response 공간 확보

중간 종료, 세부 내용 망각, 메모리 증가

05

Sampling

Setting

temperature, Top P, Top K, Min P, 반복 제어

Baseline / watch

중립적인 시작점에서 하나씩 변경

루프, 밋밋한 문장, 불안정한 캐릭터

Sampler 기준

설명할 수 있는 기준에서 시작하세요

Google과 커뮤니티 가이드는 보통 Temperature 1.0, Top P 0.95, Top K 64 근처에서 시작합니다. SillyTavern은 각 제어를 따로 정의합니다. 첫 테스트 값이지 최고의 프리셋은 아닙니다.

첫 테스트

  • Temperature 1.0
  • Top P 0.95
  • Top K 64
  • Min P 0
  • Repetition penalty 1
  • DRY multiplier 0

SillyTavern은 제어 항목마다 비활성화 값이 다릅니다. backend의 범위와 문서도 확인하세요.

01

1. 깨끗한 실행 만들기

짧은 prompt, 같은 카드, 같은 context를 사용하고 결과를 저장하세요. 다음 변경과 비교할 수 있습니다.

02

2. temperature만 변경

답변이 밋밋하면 조금 올리고, 혼란스러우면 조금 내리세요. 테스트 중에는 Top P와 Top K를 고정하세요.

03

3. token pool 조정

Top P 또는 Top K를 한 번에 하나씩 바꾸세요. SillyTavern에서 Min P는 0이면 비활성화되며 backend가 지원할 때 나중에 낮은 값으로 테스트할 수 있습니다.

04

4. 반복 제어는 마지막에

먼저 중복 context를 확인하세요. Repetition penalty 1과 DRY multiplier 0은 비활성 상태입니다. 강한 값은 일반 단어까지 억제할 수 있습니다.

수정 지도

증거에 맞는 부분만 고치세요

CASE 01

Thinking이 텍스트로 표시됨

template, tokenizer, reasoning mode를 다시 확인하세요. 지원된다면 Chat Completions를 시도하세요. 형식을 알기 전에는 marker를 prompt에 넣지 마세요.

CASE 02

긴 답변이 빨리 끝남

response tokens를 늘리기 전에 context 사용량을 확인하세요. 중복 lore와 카드 문장을 줄이고 KV cache 여유도 확인하세요.

CASE 03

몇 턴 뒤 반복 시작

중복 메시지와 context 경계를 확인하세요. repetition penalty 1, DRY 0으로 되돌린 뒤 완만한 제어 하나만 테스트하세요.

CASE 04

양자화 파일마다 느낌이 다름

비교할 때 backend, 카드, sampler를 고정하세요. 양자화 suffix, context 길이, 생성 속도를 기록하세요. Q4 결과를 BF16 결과로 볼 수는 없습니다.

별도 경로

페이지가 목적이면 로컬 sampler 조정을 건너뛰세요

Tabbit은 macOS와 Windows용 Chromium 기반 AI 브라우저입니다. 로컬 Gemma checkpoint를 실행하거나 SillyTavern 카드를 대신하지 않습니다. 페이지, 스크린샷, 파일을 읽으며 옆에서 질문할 때 적합합니다.

  1. 1

    Tabbit 설치

    데스크톱 브라우저를 다운로드하고 새 탭을 여세요. 공식 사이트는 macOS 12+와 Windows 10+를 지원한다고 안내합니다.

  2. 2

    현재 모델 선택기 사용

    설치한 Tabbit의 선택기에 실제로 표시되는 모델을 고르세요. 목록은 바뀔 수 있으며, 이 페이지는 Gemma 4 제공을 약속하지 않습니다.

  3. 3

    @로 context 참조

    캐릭터 wiki, prompt 메모, 문서를 탭에 남기세요. @로 페이지, 스크린샷, 파일을 참조해 메모나 요약을 요청하세요.

Tabbit 모델 선택기에 GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash, Claude-Sonnet-4.6이 보입니다. Gemma 4는 보이지 않습니다.
Tabbit 모델 선택기에 GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash, Claude-Sonnet-4.6이 보입니다. Gemma 4는 보이지 않습니다.Tabbit 모델 선택기에 GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash, Claude-Sonnet-4.6이 보입니다. Gemma 4는 보이지 않습니다.

워크플로 선택

로컬 SillyTavern과 Tabbit 중 무엇을 쓸까

작업에 맞춰 선택하세요. 모델과 카드를 세밀하게 제어하려면 로컬, 페이지 자체가 context라면 Tabbit입니다.

SillyTavern + 로컬 backendTabbit
Checkpoint와 양자화직접 선택하고 로드선택기에 표시된 모델 사용
Template와 sampler세밀하게 제어선택한 모델이 관리
카드와 lorebook핵심 워크플로원본 페이지를 열어 둠
페이지, 이미지, 파일 context붙여넣거나 확장 기능 구성@로 탭이나 파일 참조
첫 진단ID → template → context → sampler열기, 참조, 질문
세로 탭과 중앙 입력창, 페이지 옆 채팅 패널이 보이는 Tabbit 데스크톱 브라우저.

Sampler 기준

SillyTavern은 제어 항목마다 비활성화 값이 다릅니다. backend의 범위와 문서도 확인하세요.

FAQ

Gemma 4 설정 질문

Gemma 4 SillyTavern의 안전한 기준은 무엇인가요?+

Temperature 1.0, Top P 0.95, Top K 64에서 시작하고 Min P 0, repetition penalty 1, DRY multiplier 0으로 두세요. 시작값이므로 한 번에 하나만 바꾸세요.

26B A4B와 31B 중 무엇을 선택하나요?+

구조가 다릅니다. Google은 26B A4B를 MoE, 31B를 dense로 설명합니다. model card, 대략적인 가중치 메모리, context, backend를 확인하세요.

Gemma 4 thinking token이 텍스트로 나오는 이유는 무엇인가요?+

template, tokenizer, backend, reasoning mode의 형식이 맞지 않을 수 있습니다. <|think|>를 추가하기 전에 네 가지를 확인하세요.

context와 response token은 같은 메모리를 사용하나요?+

요청 예산을 공유하고 전체 context가 커질수록 KV cache도 커집니다. SillyTavern은 response 공간을 뺀 context를 보냅니다.

Tabbit에서 로컬 Gemma 4 양자화를 실행할 수 있나요?+

이 페이지는 그렇게 말하지 않습니다. 설치 후 현재 선택기에 표시된 모델만 사용하세요. 카드와 sampler는 SillyTavern, 페이지 context는 Tabbit에 맞습니다.

하나를 바꾸고 결과를 읽으세요

로컬 Gemma 4에서는 model card, template, context 연결을 확인하세요. 페이지 중심 작업이라면 Tabbit을 설치하고 현재 선택기에서 모델을 고르세요.

macOS와 Windows 지원. 모델 제공 여부는 바뀔 수 있습니다.

© 2026 Tabbit Browser. 당신의 맥락을 이해하는 AI 네이티브 브라우저.