Réglages Gemma 4 × SillyTavern

Corriger la bonne couche

Une mauvaise réponse de Gemma 4 ne demande pas toujours un nouveau preset. Vérifiez dans l’ordre l’identifiant du modèle, le chat template, le rôle système, le contexte et les samplers. Voici une base testable, pas une recette universelle.

Navigateur Tabbit sur ordinateur avec onglets verticaux, zone de saisie centrale et panneau de chat à côté de la page.

Partir du symptôme

La sortie indique le réglage à vérifier

Séparez un problème de format d’un choix de sampling. Le correctif le plus rapide est souvent le plus petit changement qui explique le symptôme.

01

Les marqueurs thinking apparaissent dans la réponse

Vérifiez template instruct ou chat, tokenizer et mode reasoning avant de toucher à la température. Un marqueur comme <|think|> s’affiche comme du texte si le format ne correspond pas.

02

La réponse est coupée ou vide

Contrôlez la limite de tokens de réponse et le contexte restant. Une longue carte et l’historique peuvent occuper tout l’espace de génération.

03

Le modèle répète ou perd le personnage

Cherchez les doublons dans la carte, un contexte trop plein ou des contrôles de répétition trop forts. Testez un prompt propre avant de changer plusieurs samplers.

Modèle et mémoire

26B A4B et 31B font des compromis différents

Google décrit 26B A4B comme mixture-of-experts et 31B comme dense. Le MoE active moins de paramètres par token, mais ses poids doivent être chargés. Quantification et longueur du contexte changent la mémoire réelle.

ModelProfileMemory noteFit
26B A4BMixture-of-experts, 4B actifs par tokenGoogle estime environ 14,4 Go pour les poids Q4_0, hors contexteCandidat local si le backend accepte ce format
31BModèle denseGoogle estime environ 17,5 Go pour les poids Q4_0, hors contexteÀ choisir après vérification de la mémoire et de la vitesse
Q4, Q5, Q6Fichiers quantifiés, pas de nouveaux noms officielsUne précision moindre peut économiser de la mémoire, avec un compromis qualité/vitesseSuivre le model card de l’éditeur et le format du backend

Ce sont des estimations de chargement des poids. Gardez de la marge pour le runtime, la KV cache et le contexte choisi.

Chaîne de connexion

Cinq couches séparent la carte de la réponse

Traitez chaque couche comme un point de contrôle. Si le symptôme arrive après une modification, vous saurez où revenir.

01

Endpoint et ID du modèle

Setting

Connecteur, URL du serveur et checkpoint exact

Baseline / watch

Utiliser l’ID affiché par le fournisseur ou le backend

Mauvais alias, modèle ancien ou format quantifié non compatible

02

Format Chat ou instruct

Setting

Chat Completions, Text Completion et template

Baseline / watch

Commencer par Chat Completions si le serveur le permet

Headers ou marqueurs thinking affichés comme texte

03

Rôle système

Setting

Message système et position

Baseline / watch

Le garder court, clair et séparé de la carte

Le backend ignore ou duplique le message

04

Contexte et réponse

Setting

Context tokens et response tokens maximum

Baseline / watch

Réserver de la place avant un long historique

Coupures, détails oubliés ou mémoire élevée

05

Sampling

Setting

Température, Top P, Top K, Min P et répétition

Baseline / watch

Partir d’un point neutre et changer une valeur

Boucles, prose plate ou voix instable

Base sampler

Commencer avec une base explicable

Les guides Google et communautaires commencent souvent près de Temperature 1.0, Top P 0.95 et Top K 64. SillyTavern définit chaque contrôle séparément. Ce sont des valeurs de test, pas le meilleur preset.

Premier test

  • Temperature 1.0
  • Top P 0.95
  • Top K 64
  • Min P 0
  • Repetition penalty 1
  • DRY multiplier 0

Les valeurs de désactivation diffèrent selon les contrôles dans SillyTavern. Vérifiez aussi la plage et la documentation de votre backend.

01

1. Créer un test propre

Utilisez un prompt court, la même carte et le même contexte. Enregistrez la sortie pour comparer.

02

2. Modifier seulement la température

Si la réponse est plate, augmentez-la légèrement. Si elle est chaotique, baissez-la. Gardez Top P et Top K fixes.

03

3. Ajuster le pool de tokens

Changez Top P ou Top K, un seul à la fois. Min P est désactivé à 0 dans SillyTavern et peut être testé plus tard si le backend le permet.

04

4. Ajouter la répétition en dernier

Vérifiez d’abord le contexte en double. Repetition penalty 1 et DRY multiplier 0 sont désactivés. Des valeurs fortes peuvent pénaliser les mots ordinaires.

Carte de réparation

Relier le correctif à l’indice

CASE 01

Thinking apparaît comme du texte

Revérifiez template, tokenizer et mode reasoning. Essayez Chat Completions si disponible. N’ajoutez pas de marqueur avant de connaître le format attendu.

CASE 02

Une réponse longue s’arrête tôt

Contrôlez l’usage du contexte avant d’augmenter response tokens. Supprimez les doublons de lore ou de carte et gardez de la KV cache.

CASE 03

La répétition commence après quelques tours

Inspectez les messages en double et la limite de contexte. Revenez à repetition penalty 1 et DRY 0, puis testez un seul contrôle modéré.

CASE 04

Les fichiers quantifiés donnent une autre impression

Gardez backend, carte et sampler fixes. Notez le suffixe, le contexte et la vitesse. Un résultat Q4 ne prouve pas le même comportement qu’un run BF16.

Un autre parcours

Si la tâche concerne une page, évitez le réglage local des samplers

Tabbit est un navigateur Chromium avec IA pour macOS et Windows. Il ne lance pas un checkpoint Gemma local et ne remplace pas les cartes SillyTavern. Il sert à lire une page, une capture ou un fichier et à poser des questions à côté.

  1. 1

    Installer Tabbit

    Téléchargez le navigateur de bureau et ouvrez un onglet. Le site officiel indique macOS 12+ et Windows 10+.

  2. 2

    Utiliser le sélecteur actuel

    Choisissez un modèle réellement affiché dans votre Tabbit. La liste peut changer. Cette page ne promet pas la disponibilité de Gemma 4.

  3. 3

    Référencer le contexte avec @

    Gardez la wiki du personnage, vos notes ou la documentation dans un onglet. Avec @, référencez une page, une capture ou un fichier et demandez des notes ou un second brouillon.

Sélecteur de modèles Tabbit affichant GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash et Claude-Sonnet-4.6. Gemma 4 n’est pas visible.
Sélecteur de modèles Tabbit affichant GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash et Claude-Sonnet-4.6. Gemma 4 n’est pas visible.Sélecteur de modèles Tabbit affichant GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash et Claude-Sonnet-4.6. Gemma 4 n’est pas visible.

Choisir le flux

SillyTavern local ou Tabbit ?

Choisissez selon la tâche. Gardez le contrôle du modèle et des cartes en local, et utilisez Tabbit quand la page est le contexte.

SillyTavern + backend localTabbit
Checkpoint et quantificationVous les choisissez et chargezChoisir dans le sélecteur
Template et samplerContrôle précisGéré par le modèle choisi
Cartes et lorebooksFlux principalGarder la source ouverte
Contexte de page, capture et fichierColler ou configurer une extension@ onglet ou fichier
Premier diagnosticID → template → contexte → samplerOuvrir, référencer, demander
Navigateur Tabbit sur ordinateur avec onglets verticaux, zone de saisie centrale et panneau de chat à côté de la page.

Base sampler

Les valeurs de désactivation diffèrent selon les contrôles dans SillyTavern. Vérifiez aussi la plage et la documentation de votre backend.

FAQ

Réglages Gemma 4, réponses

Quelle base utiliser pour Gemma 4 dans SillyTavern ?+

Commencez par Temperature 1.0, Top P 0.95 et Top K 64. Laissez Min P à 0, repetition penalty à 1 et DRY multiplier à 0. Ce sont des valeurs de départ, à modifier une par une.

Choisir 26B A4B ou 31B ?+

Les architectures diffèrent. Google décrit 26B A4B comme MoE et 31B comme dense. Vérifiez le model card, la mémoire des poids, le contexte et votre backend.

Pourquoi les thinking tokens deviennent-ils du texte ?+

Le template, le tokenizer, le backend et le mode reasoning peuvent ne pas utiliser le même format. Vérifiez-les avant d’ajouter <|think|>.

Context et response tokens partagent-ils la mémoire ?+

Ils partagent le budget de la requête, et un contexte total plus grand demande davantage de KV cache. SillyTavern réserve les response tokens.

Tabbit peut-il exécuter ma quantification Gemma 4 locale ?+

Cette page ne l’affirme pas. Après installation, utilisez seulement un modèle visible dans le sélecteur. Les cartes et samplers locaux restent du ressort de SillyTavern; les pages et fichiers conviennent à Tabbit.

Changer une chose, puis lire le résultat

Pour Gemma 4 en local, vérifiez la chaîne model card, template et contexte. Pour travailler à côté d’une page, installez Tabbit et choisissez un modèle du sélecteur actuel.

Disponible sur macOS et Windows. La disponibilité des modèles peut changer.

© 2026 Tabbit Browser. Le navigateur natif IA qui comprend votre contexte.