Les marqueurs thinking apparaissent dans la réponse
Vérifiez template instruct ou chat, tokenizer et mode reasoning avant de toucher à la température. Un marqueur comme <|think|> s’affiche comme du texte si le format ne correspond pas.
Réglages Gemma 4 × SillyTavern
Une mauvaise réponse de Gemma 4 ne demande pas toujours un nouveau preset. Vérifiez dans l’ordre l’identifiant du modèle, le chat template, le rôle système, le contexte et les samplers. Voici une base testable, pas une recette universelle.

Partir du symptôme
Séparez un problème de format d’un choix de sampling. Le correctif le plus rapide est souvent le plus petit changement qui explique le symptôme.
Vérifiez template instruct ou chat, tokenizer et mode reasoning avant de toucher à la température. Un marqueur comme <|think|> s’affiche comme du texte si le format ne correspond pas.
Contrôlez la limite de tokens de réponse et le contexte restant. Une longue carte et l’historique peuvent occuper tout l’espace de génération.
Cherchez les doublons dans la carte, un contexte trop plein ou des contrôles de répétition trop forts. Testez un prompt propre avant de changer plusieurs samplers.
Modèle et mémoire
Google décrit 26B A4B comme mixture-of-experts et 31B comme dense. Le MoE active moins de paramètres par token, mais ses poids doivent être chargés. Quantification et longueur du contexte changent la mémoire réelle.
| Model | Profile | Memory note | Fit |
|---|---|---|---|
| 26B A4B | Mixture-of-experts, 4B actifs par token | Google estime environ 14,4 Go pour les poids Q4_0, hors contexte | Candidat local si le backend accepte ce format |
| 31B | Modèle dense | Google estime environ 17,5 Go pour les poids Q4_0, hors contexte | À choisir après vérification de la mémoire et de la vitesse |
| Q4, Q5, Q6 | Fichiers quantifiés, pas de nouveaux noms officiels | Une précision moindre peut économiser de la mémoire, avec un compromis qualité/vitesse | Suivre le model card de l’éditeur et le format du backend |
Ce sont des estimations de chargement des poids. Gardez de la marge pour le runtime, la KV cache et le contexte choisi.
Chaîne de connexion
Traitez chaque couche comme un point de contrôle. Si le symptôme arrive après une modification, vous saurez où revenir.
Setting
Connecteur, URL du serveur et checkpoint exact
Baseline / watch
Utiliser l’ID affiché par le fournisseur ou le backend
Mauvais alias, modèle ancien ou format quantifié non compatible
Setting
Chat Completions, Text Completion et template
Baseline / watch
Commencer par Chat Completions si le serveur le permet
Headers ou marqueurs thinking affichés comme texte
Setting
Message système et position
Baseline / watch
Le garder court, clair et séparé de la carte
Le backend ignore ou duplique le message
Setting
Context tokens et response tokens maximum
Baseline / watch
Réserver de la place avant un long historique
Coupures, détails oubliés ou mémoire élevée
Setting
Température, Top P, Top K, Min P et répétition
Baseline / watch
Partir d’un point neutre et changer une valeur
Boucles, prose plate ou voix instable
Base sampler
Les guides Google et communautaires commencent souvent près de Temperature 1.0, Top P 0.95 et Top K 64. SillyTavern définit chaque contrôle séparément. Ce sont des valeurs de test, pas le meilleur preset.
Premier test
Les valeurs de désactivation diffèrent selon les contrôles dans SillyTavern. Vérifiez aussi la plage et la documentation de votre backend.
Utilisez un prompt court, la même carte et le même contexte. Enregistrez la sortie pour comparer.
Si la réponse est plate, augmentez-la légèrement. Si elle est chaotique, baissez-la. Gardez Top P et Top K fixes.
Changez Top P ou Top K, un seul à la fois. Min P est désactivé à 0 dans SillyTavern et peut être testé plus tard si le backend le permet.
Vérifiez d’abord le contexte en double. Repetition penalty 1 et DRY multiplier 0 sont désactivés. Des valeurs fortes peuvent pénaliser les mots ordinaires.
Carte de réparation
Revérifiez template, tokenizer et mode reasoning. Essayez Chat Completions si disponible. N’ajoutez pas de marqueur avant de connaître le format attendu.
Contrôlez l’usage du contexte avant d’augmenter response tokens. Supprimez les doublons de lore ou de carte et gardez de la KV cache.
Inspectez les messages en double et la limite de contexte. Revenez à repetition penalty 1 et DRY 0, puis testez un seul contrôle modéré.
Gardez backend, carte et sampler fixes. Notez le suffixe, le contexte et la vitesse. Un résultat Q4 ne prouve pas le même comportement qu’un run BF16.
Un autre parcours
Tabbit est un navigateur Chromium avec IA pour macOS et Windows. Il ne lance pas un checkpoint Gemma local et ne remplace pas les cartes SillyTavern. Il sert à lire une page, une capture ou un fichier et à poser des questions à côté.
Téléchargez le navigateur de bureau et ouvrez un onglet. Le site officiel indique macOS 12+ et Windows 10+.
Choisissez un modèle réellement affiché dans votre Tabbit. La liste peut changer. Cette page ne promet pas la disponibilité de Gemma 4.
Gardez la wiki du personnage, vos notes ou la documentation dans un onglet. Avec @, référencez une page, une capture ou un fichier et demandez des notes ou un second brouillon.



Choisir le flux
Choisissez selon la tâche. Gardez le contrôle du modèle et des cartes en local, et utilisez Tabbit quand la page est le contexte.
| SillyTavern + backend local | Tabbit | |
|---|---|---|
| Checkpoint et quantification | Vous les choisissez et chargez | Choisir dans le sélecteur |
| Template et sampler | Contrôle précis | Géré par le modèle choisi |
| Cartes et lorebooks | Flux principal | Garder la source ouverte |
| Contexte de page, capture et fichier | Coller ou configurer une extension | @ onglet ou fichier |
| Premier diagnostic | ID → template → contexte → sampler | Ouvrir, référencer, demander |

Base sampler
Les valeurs de désactivation diffèrent selon les contrôles dans SillyTavern. Vérifiez aussi la plage et la documentation de votre backend.
FAQ
Commencez par Temperature 1.0, Top P 0.95 et Top K 64. Laissez Min P à 0, repetition penalty à 1 et DRY multiplier à 0. Ce sont des valeurs de départ, à modifier une par une.
Les architectures diffèrent. Google décrit 26B A4B comme MoE et 31B comme dense. Vérifiez le model card, la mémoire des poids, le contexte et votre backend.
Le template, le tokenizer, le backend et le mode reasoning peuvent ne pas utiliser le même format. Vérifiez-les avant d’ajouter <|think|>.
Ils partagent le budget de la requête, et un contexte total plus grand demande davantage de KV cache. SillyTavern réserve les response tokens.
Cette page ne l’affirme pas. Après installation, utilisez seulement un modèle visible dans le sélecteur. Les cartes et samplers locaux restent du ressort de SillyTavern; les pages et fichiers conviennent à Tabbit.
Pour Gemma 4 en local, vérifiez la chaîne model card, template et contexte. Pour travailler à côté d’une page, installez Tabbit et choisissez un modèle du sélecteur actuel.
Disponible sur macOS et Windows. La disponibilité des modèles peut changer.