Use o ID exato
O checkpoint de instruções do Hugging Face é `google/gemma-4-26B-A4B-it`. Q4, Q5 e Q6 são quantizações, não novas famílias de modelos do Google.
Gemma 4 uncensored × SillyTavern
Uncensored não é uma variante oficial publicada pelo Google. Pode significar um fine-tune da comunidade, um checkpoint modificado, um rótulo do provedor ou apenas um relato de roleplay. Confira o model card, a base, a licença, o template e a política do provedor antes de atribuir uma recusa ao modelo.
Confira os fatos oficiais ↗
Nome e hardware primeiro
O nome usado pelo Google é Gemma 4 26B A4B. O model card informa 25,2 bilhões de parâmetros totais, 3,8 bilhões ativos, 30 camadas, entrada de imagens e contexto de 256K. IT, Q4, Q5 e o nome do autor no GGUF são rótulos da distribuição.
O checkpoint de instruções do Hugging Face é `google/gemma-4-26B-A4B-it`. Q4, Q5 e Q6 são quantizações, não novas famílias de modelos do Google.
A quantidade de parâmetros ativos ajuda a explicar a velocidade, mas não transforma todos os arquivos em modelos de 4 GB. Pesos, buffers, encoder visual de cerca de 550M, KV cache e contexto entram na conta.
31B é um modelo denso com cerca de 30,7 bilhões de parâmetros. 26B A4B encaminha tokens para experts. Uma estimativa de memória feita para 31B pode falhar aqui.
Ordem de verificação
Separar as camadas evita culpar o sampler por um template errado, um derivado comunitário ou um card mal configurado.
Guarde o ID completo, o checkpoint base, a variante, o arquivo quantizado e o link do model card. O nome uncensored não prova que seja uma variante oficial.
KoboldCpp, llama.cpp, LM Studio e provedores compatíveis com OpenAI têm endpoints diferentes. Comece por Chat Completions quando disponível.
O formato do Google usa `system`, `user`, `model`, `<|turn>` e `<turn|>`. Use o template Gemma 4 ou Gemini do backend, não um template antigo do Gemma 3.
O Google documenta `<|think|>` no início do system prompt para ativar o pensamento. Faça um teste curto, depois adicione card e preset. No histórico normal, mantenha apenas a resposta final.
Discussões da comunidade citam SillyTavern 1.17, `--jinja` no KoboldCpp, tokenizer Gemma4/Gemini e `<|think|>`. Isso não é um padrão universal do Google.
Quando a saída falha
Confira tokenizer, template e modo de geração do backend. Se o servidor já aplica o template, inserir tokens manualmente pode exibi-los literalmente. Compare thinking ligado e desligado.
Verifique se sua versão do SillyTavern e o loader aceitam o formato Gemma 4. `--jinja` ou `<|think|>` podem ajudar conforme o servidor.
Reduza contexto duplicado antes de alterar a temperatura. Confira o limite e o card, então teste temperature 1.0, top-p 0.95 e top-k 64.
Caminho pelo navegador
O Tabbit não é um runner local de GGUF nem um gerenciador de cards do SillyTavern. Ele mantém wiki, notas e discussões de suporte visíveis durante uma conversa com um modelo disponível no navegador.
Baixe o navegador baseado em Chromium para macOS ou Windows. Não é preciso arquivo Gemma local, chave de provedor ou servidor SillyTavern.
Abra o seletor depois da instalação. O código atual lista GPT-5.4, Gemini-3.1-Pro, Claude-Sonnet-4.6 e DeepSeek-V4-Flash. Gemma 4 não está no mapping atual, portanto não prometemos sua execução.
Mantenha a wiki ou as notas em uma aba. Use `@` para referenciar página, captura ou arquivo e pedir um esboço de cena, uma verificação de consistência ou um resumo.

Escolha o cliente
Cada ferramenta resolve um bloqueio diferente. Use os controles de RP no frontend especializado e o navegador quando o contexto estiver espalhado por páginas e arquivos.
| SillyTavern | Tabbit | |
|---|---|---|
| Cards e lorebooks | Fluxo principal | Referenciar a fonte |
| Checkpoint Gemma 4 local | Você prepara o backend | Escolher na lista |
| Template e sampler | Controle detalhado | Gerenciado pelo modelo |
| Contexto web | Colar ou extensões | Referenciar aba ou arquivo com @ |
| Primeira resposta útil | Endpoint + template + preset | Instalar + escolher |

Mantenha a wiki ou as notas em uma aba. Use `@` para referenciar página, captura ou arquivo e pedir um esboço de cena, uma verificação de consistência ou um resumo.

Referenciar aba ou arquivo com @
Perguntas frequentes
O Google chama o modelo de Gemma 4 26B A4B. O checkpoint de instruções do Hugging Face é `google/gemma-4-26B-A4B-it`; distribuidores podem acrescentar sufixos.
Não. 26B A4B é MoE, com 25,2 bilhões no total e cerca de 3,8 bilhões ativos. 31B é denso e tem cerca de 30,7 bilhões.
Não há um número único. Quantização, KV cache, contexto, buffers e encoder visual alteram o uso. Meça o arquivo real com o contexto desejado.
O tokenizer ou template pode não coincidir com o backend, ou o servidor pode mostrar o token como texto. Confira o formato e thinking antes do sampling.
Não presuma. O mapping atual do Tabbit não inclui Gemma 4. Use somente um modelo que apareça no seletor.
Para um modelo comunitário uncensored, confirme checkpoint, model card, licença, memória, tokenizer e template nessa ordem. Para conversar ao lado de uma wiki, instale o Tabbit e confira o seletor atual.
Disponível para macOS e Windows. A disponibilidade dos modelos pode mudar.