정확한 모델 ID 사용
Hugging Face 지시 튜닝 체크포인트는 `google/gemma-4-26B-A4B-it`입니다. Q4, Q5, Q6는 양자화 배포판이지 Google의 새 모델군이 아닙니다.
Gemma 4 26B A4B × SillyTavern
첫 번째 함정은 이름입니다. Gemma 4 26B A4B는 총 252억, 약 38억 active parameters를 가진 MoE 모델입니다. dense 26B도 31B 체크포인트도 아닙니다. 이름, 메모리, 템플릿, 프런트엔드 순서로 설정을 확인하세요.
공식 모델 정보 확인 ↗
이름과 하드웨어부터
Google의 공식 이름은 Gemma 4 26B A4B입니다. 모델 카드는 총 252억 파라미터, 38억 active parameters, 30개 레이어, 이미지 입력과 256K 컨텍스트를 명시합니다. GGUF의 IT, Q4, Q5, 제작자 이름은 배포 라벨입니다.
Hugging Face 지시 튜닝 체크포인트는 `google/gemma-4-26B-A4B-it`입니다. Q4, Q5, Q6는 양자화 배포판이지 Google의 새 모델군이 아닙니다.
active parameters는 속도를 설명하지만 모든 파일이 4GB가 된다는 뜻은 아닙니다. 가중치, 런타임 버퍼, 약 5.5억 파라미터 비전 인코더, KV cache와 컨텍스트가 메모리를 사용합니다.
31B는 약 307억 파라미터의 dense 모델입니다. 26B A4B는 토큰을 expert로 라우팅합니다. 31B용 메모리 추정과 프리셋은 맞지 않을 수 있습니다.
SillyTavern 연결 순서
레이어를 나누어 테스트하면 템플릿, sampler와 카드 중 어디가 문제인지 알 수 있습니다.
Gemma 4 26B A4B라고 명시된 로컬 파일이나 제공업체 버전을 선택하세요. `gemma-4-26b`를 기억으로 입력하지 말고 model slug를 복사하세요.
KoboldCpp, llama.cpp, LM Studio와 OpenAI 호환 제공업체는 endpoint가 다릅니다. 지원한다면 먼저 Chat Completions를 사용하고 Text Completion의 수동 설정은 뒤로 미루세요.
Google 형식은 `system`, `user`, `model`, `<|turn>`, `<turn|>`를 사용합니다. backend가 제공하는 Gemma 4 또는 Gemini 설정을 사용하고 오래된 Gemma 3 템플릿을 덮어쓰지 마세요.
Google은 system prompt 앞에 `<|think|>`를 두면 thinking을 켤 수 있다고 안내합니다. 짧은 입력으로 시험한 뒤 카드와 preset을 추가하고 일반 대화 기록에는 최종 답만 남기세요.
커뮤니티에서는 SillyTavern 1.17, KoboldCpp `--jinja`, Gemma4/Gemini tokenizer와 `<|think|>`가 언급됩니다. 모든 backend에 적용되는 Google 기본값은 아닙니다.
출력이 이상할 때
tokenizer, chat template와 backend 생성 모드를 확인하세요. backend가 이미 템플릿을 적용한다면 토큰을 직접 넣을 때 그대로 노출될 수 있습니다. 짧은 입력으로 on/off를 비교하세요.
SillyTavern과 loader가 Gemma 4 형식을 지원하는지 확인하세요. `--jinja`나 `<|think|>`가 필요할 수 있지만 올바른 설정은 서버에 따라 달라집니다.
온도를 바꾸기 전에 중복 컨텍스트를 줄이세요. 한도와 카드를 확인한 후 temperature 1.0, top-p 0.95, top-k 64를 실험 시작점으로 사용하세요.
브라우저 대안
Tabbit은 로컬 GGUF 실행기나 SillyTavern 카드 관리자가 아닙니다. wiki, 설정 메모와 문제 해결 글을 보면서 브라우저에서 제공되는 모델과 대화하는 경로입니다.
macOS 또는 Windows용 Chromium 기반 브라우저를 받으세요. 로컬 Gemma 파일, 제공업체 키와 SillyTavern 서버가 필요하지 않습니다.
설치 후 제품 모델 선택기를 여세요. 현재 코드에는 GPT-5.4, Gemini-3.1-Pro, Claude-Sonnet-4.6, DeepSeek-V4-Flash 등이 있습니다. 현재 mapping에 Gemma 4가 없으므로 실행을 약속하지 않습니다.
wiki나 설정 메모를 탭에 남기고 `@`로 페이지, 스크린샷, 파일을 참조하세요. 장면 구성, 일관성 점검과 설정 요약을 요청할 수 있습니다.

클라이언트 선택
두 도구가 해결하는 병목이 다릅니다. 세밀한 RP 제어는 전용 프런트엔드로, 자료가 페이지와 파일에 흩어졌다면 브라우저로 처리하세요.
| SillyTavern | Tabbit | |
|---|---|---|
| 캐릭터 카드와 lorebook | 핵심 흐름 | 출처 페이지 참조 |
| Gemma 4 로컬 checkpoint | backend 직접 준비 | 선택기에 있는 모델 사용 |
| 템플릿과 sampler | 세밀한 제어 | 선택 모델이 관리 |
| 웹 컨텍스트 | 붙여넣기 또는 확장 | @로 탭과 파일 참조 |
| 첫 유용한 답변 | endpoint + template + preset | 설치 + 모델 선택 |

wiki나 설정 메모를 탭에 남기고 `@`로 페이지, 스크린샷, 파일을 참조하세요. 장면 구성, 일관성 점검과 설정 요약을 요청할 수 있습니다.

@로 탭과 파일 참조
FAQ
Google 모델 카드는 Gemma 4 26B A4B라고 부릅니다. Hugging Face 지시 튜닝 checkpoint는 `google/gemma-4-26B-A4B-it`이며 배포자가 접미사를 추가할 수 있습니다.
아닙니다. 26B A4B는 총 252억, active parameters 약 38억의 MoE입니다. 31B는 약 307억 파라미터의 dense 모델입니다.
고정된 답은 없습니다. 양자화 가중치, KV cache, 컨텍스트, 런타임 버퍼와 비전 인코더가 모두 영향을 줍니다. 사용할 컨텍스트로 실제 파일을 측정하세요.
tokenizer나 template이 backend와 맞지 않거나 서버가 제어 토큰을 텍스트로 노출했을 수 있습니다. 샘플링보다 형식과 thinking 설정을 먼저 확인하세요.
그렇다고 가정하지 마세요. 현재 Tabbit mapping에 Gemma 4가 없습니다. 설치 후 선택기에 표시되는 모델만 사용하세요.
로컬 Gemma 4 26B A4B는 checkpoint, 메모리, tokenizer와 template을 차례로 확인하세요. wiki 옆에서 대화하려면 Tabbit을 설치하고 현재 모델 선택기를 확인하세요.
macOS와 Windows 지원. 모델 제공 여부는 바뀔 수 있습니다.