Marcadores de thinking aparecem na resposta
Confira template instruct ou chat, tokenizer e modo de reasoning antes de mexer na temperatura. Um marcador como <|think|> vira texto literal quando o formato não combina.
Configurações Gemma 4 × SillyTavern
Uma resposta ruim do Gemma 4 nem sempre pede outro preset. Confira o ID do modelo, o chat template, o papel do sistema, o contexto e os samplers nessa ordem. Este guia oferece uma base testável, não uma receita mágica.

Comece pelo sintoma
Separe um erro de formato de uma escolha de amostragem. O reparo mais rápido costuma ser a menor mudança que explica o sintoma.
Confira template instruct ou chat, tokenizer e modo de reasoning antes de mexer na temperatura. Um marcador como <|think|> vira texto literal quando o formato não combina.
Verifique o limite de tokens de resposta e o contexto restante. Um card longo e o histórico podem ocupar o espaço de geração.
Procure texto duplicado no card, contexto cheio ou controles de repetição fortes. Teste um prompt limpo antes de mudar vários samplers.
Modelo e memória
O Google descreve 26B A4B como mixture-of-experts e 31B como denso. O MoE ativa menos parâmetros por token, mas seus pesos precisam ser carregados. Quantização e tamanho do contexto mudam a memória real.
| Model | Profile | Memory note | Fit |
|---|---|---|---|
| 26B A4B | Mixture-of-experts, 4B ativos por token | O Google estima cerca de 14,4 GB para pesos Q4_0, sem contexto | Candidato local se o backend aceitar o formato |
| 31B | Modelo denso | O Google estima cerca de 17,5 GB para pesos Q4_0, sem contexto | Escolha após conferir memória e velocidade |
| Q4, Q5, Q6 | Arquivos quantizados, não nomes oficiais novos | Menor precisão pode economizar memória, com troca de qualidade e velocidade | Siga o model card do publicador e o formato do backend |
São estimativas aproximadas para carregar os pesos. Reserve espaço para runtime, KV cache e o contexto escolhido.
Cadeia de conexão
Trate cada camada como um ponto de verificação. Se o sintoma surge depois de uma mudança, você sabe onde voltar.
Setting
Conector, URL do servidor e checkpoint exato
Baseline / watch
Use o ID mostrado pelo provedor ou backend
Alias errado, modelo antigo ou formato incompatível
Setting
Chat Completions, Text Completion e template
Baseline / watch
Comece com Chat Completions se o servidor aceitar
Headers ou marcadores thinking como texto
Setting
Mensagem do sistema e posição
Baseline / watch
Mantenha curta, clara e separada do card
O backend ignora ou duplica a mensagem
Setting
Context tokens e response tokens máximos
Baseline / watch
Reserve espaço antes de carregar histórico longo
Cortes, detalhes esquecidos ou muita memória
Setting
Temperatura, Top P, Top K, Min P e repetição
Baseline / watch
Comece neutro e mude um valor
Loops, texto plano ou voz instável
Base de sampler
Guias do Google e da comunidade costumam começar perto de Temperature 1.0, Top P 0.95 e Top K 64. O SillyTavern define cada controle separadamente. São valores de teste, não o melhor preset.
Primeiro teste
Os valores de desativação variam entre controles no SillyTavern. Confirme também a faixa e a documentação do seu backend.
Use um prompt curto, o mesmo card e o mesmo contexto. Salve a saída para comparar mudanças.
Se a resposta estiver plana, aumente um pouco. Se estiver caótica, reduza um pouco. Mantenha Top P e Top K fixos.
Mude Top P ou Top K, um por vez. Min P fica desativado em 0 no SillyTavern e pode ser testado depois se o backend aceitar.
Confira primeiro o contexto duplicado. Repetition penalty 1 e DRY multiplier 0 estão desativados. Valores fortes podem penalizar palavras comuns.
Mapa de reparo
Revise template, tokenizer e modo de reasoning. Tente Chat Completions se estiver disponível. Não adicione marcadores antes de saber qual formato o backend espera.
Confira o uso do contexto antes de aumentar response tokens. Remova lore ou texto duplicado do card e deixe espaço para a KV cache.
Inspecione mensagens duplicadas e o limite de contexto. Volte a repetition penalty 1 e DRY 0, depois teste um controle moderado.
Mantenha backend, card e sampler fixos. Anote suffix, contexto e velocidade. Um resultado Q4 não é a mesma evidência de um run BF16.
Outro caminho
O Tabbit é um navegador Chromium com IA para macOS e Windows. Ele não executa um checkpoint Gemma local nem substitui os cards do SillyTavern. Use-o para ler uma página, captura ou arquivo e perguntar ao lado.
Baixe o navegador para desktop e abra uma aba. O site oficial indica suporte a macOS 12+ e Windows 10+.
Escolha um modelo realmente visível no seu Tabbit. A lista pode mudar. Esta página não promete que o Gemma 4 esteja disponível.
Deixe a wiki do personagem, suas notas ou a documentação em uma aba. Use @ para citar uma página, captura ou arquivo e pedir notas ou outro rascunho.



Escolha o fluxo
Escolha conforme o trabalho. Controle modelo e cards localmente; use o Tabbit quando a própria página for o contexto.
| SillyTavern + backend local | Tabbit | |
|---|---|---|
| Checkpoint e quantização | Você escolhe e carrega | Escolha no seletor |
| Template e sampler | Controle detalhado | Gerenciado pelo modelo |
| Cards e lorebooks | Fluxo principal | Deixe a fonte aberta |
| Contexto de página, captura e arquivo | Colar ou configurar extensão | @ aba ou arquivo |
| Primeiro diagnóstico | ID → template → contexto → sampler | Abrir, referenciar, perguntar |

Base de sampler
Os valores de desativação variam entre controles no SillyTavern. Confirme também a faixa e a documentação do seu backend.
FAQ
Comece com Temperature 1.0, Top P 0.95 e Top K 64. Deixe Min P em 0, repetition penalty em 1 e DRY multiplier em 0. São valores iniciais: mude uma coisa por vez.
As arquiteturas são diferentes. O Google descreve 26B A4B como MoE e 31B como denso. Confira o model card, a memória dos pesos, o contexto e o backend.
Template, tokenizer, backend e modo de reasoning podem usar formatos diferentes. Verifique os quatro antes de adicionar <|think|>.
Eles compartilham o orçamento da solicitação, e um contexto total maior pede mais KV cache. O SillyTavern reserva os response tokens.
Esta página não afirma isso. Depois de instalar, use apenas um modelo visível no seletor atual. Cards e samplers locais são do SillyTavern; páginas e arquivos combinam com o Tabbit.
Para Gemma 4 local, confira a cadeia model card, template e contexto. Para trabalhar ao lado de uma página, instale o Tabbit e escolha um modelo do seletor atual.
Disponível para macOS e Windows. A disponibilidade dos modelos pode mudar.