Gemma 4 26B A4B × SillyTavern

Gemma 4 26B no SillyTavern

O primeiro problema é o nome. Gemma 4 26B A4B é um modelo MoE com 25,2 bilhões de parâmetros no total e cerca de 3,8 bilhões ativos. Não é um modelo denso de 26B nem o checkpoint 31B. Veja nome, memória, template e frontend nesta ordem.

Model card do Google
Confira os fatos oficiais
Navegador Tabbit no desktop com abas verticais, campo central e painel de chat à direita.

Nome e hardware primeiro

26B A4B é MoE, não apenas um número

O nome usado pelo Google é Gemma 4 26B A4B. O model card informa 25,2 bilhões de parâmetros totais, 3,8 bilhões ativos, 30 camadas, entrada de imagens e contexto de 256K. IT, Q4, Q5 e o nome do autor no GGUF são rótulos da distribuição.

01

Use o ID exato

O checkpoint de instruções do Hugging Face é `google/gemma-4-26B-A4B-it`. Q4, Q5 e Q6 são quantizações, não novas famílias de modelos do Google.

02

Conte contexto e runtime

A quantidade de parâmetros ativos ajuda a explicar a velocidade, mas não transforma todos os arquivos em modelos de 4 GB. Pesos, buffers, encoder visual de cerca de 550M, KV cache e contexto entram na conta.

03

Não copie a receita do 31B

31B é um modelo denso com cerca de 30,7 bilhões de parâmetros. 26B A4B encaminha tokens para experts. Uma estimativa de memória feita para 31B pode falhar aqui.

Ordem de conexão

Conecte o backend antes do card

Separar as camadas evita culpar o sampler por um template errado ou por um card mal configurado.

  1. 01

    1. Confirme o checkpoint

    Escolha um arquivo local ou provedor que identifique Gemma 4 26B A4B. Copie o model slug fornecido, sem inventar `gemma-4-26b`.

  2. 02

    2. Selecione o modo de API

    KoboldCpp, llama.cpp, LM Studio e provedores compatíveis com OpenAI têm endpoints diferentes. Comece por Chat Completions quando disponível.

  3. 03

    3. Alinhe tokenizer e template

    O formato do Google usa `system`, `user`, `model`, `<|turn>` e `<turn|>`. Use o template Gemma 4 ou Gemini do backend, não um template antigo do Gemma 3.

  4. 04

    4. Teste thinking com intenção

    O Google documenta `<|think|>` no início do system prompt para ativar o pensamento. Faça um teste curto, depois adicione card e preset. No histórico normal, mantenha apenas a resposta final.

Discussões da comunidade citam SillyTavern 1.17, `--jinja` no KoboldCpp, tokenizer Gemma4/Gemini e `<|think|>`. Isso não é um padrão universal do Google.

Quando a saída falha

Conserte a camada responsável

CASE 01

Marcadores aparecem como texto

Confira tokenizer, template e modo de geração do backend. Se o servidor já aplica o template, inserir tokens manualmente pode exibi-los literalmente. Compare thinking ligado e desligado.

CASE 02

Thinking funciona só às vezes

Verifique se sua versão do SillyTavern e o loader aceitam o formato Gemma 4. `--jinja` ou `<|think|>` podem ajudar conforme o servidor.

CASE 03

O personagem repete ou esquece detalhes

Reduza contexto duplicado antes de alterar a temperatura. Confira o limite e o card, então teste temperature 1.0, top-p 0.95 e top-k 64.

Caminho pelo navegador

Deixe a wiki do personagem aberta e pergunte ao lado

O Tabbit não é um runner local de GGUF nem um gerenciador de cards do SillyTavern. Ele mantém wiki, notas e discussões de suporte visíveis durante uma conversa com um modelo disponível no navegador.

  1. 1

    Instale o Tabbit

    Baixe o navegador baseado em Chromium para macOS ou Windows. Não é preciso arquivo Gemma local, chave de provedor ou servidor SillyTavern.

  2. 2

    Escolha um modelo listado

    Abra o seletor depois da instalação. O código atual lista GPT-5.4, Gemini-3.1-Pro, Claude-Sonnet-4.6 e DeepSeek-V4-Flash. Gemma 4 não está no mapping atual, portanto não prometemos sua execução.

  3. 3

    Referencie a fonte

    Mantenha a wiki ou as notas em uma aba. Use `@` para referenciar página, captura ou arquivo e pedir um esboço de cena, uma verificação de consistência ou um resumo.

Seletor de modelos do Tabbit com GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash e Claude-Sonnet-4.6. Gemma 4 não aparece na captura.

Escolha o cliente

SillyTavern para cards, Tabbit para a fonte

Cada ferramenta resolve um bloqueio diferente. Use os controles de RP no frontend especializado e o navegador quando o contexto estiver espalhado por páginas e arquivos.

SillyTavernTabbit
Cards e lorebooksFluxo principalReferenciar a fonte
Checkpoint Gemma 4 localVocê prepara o backendEscolher na lista
Template e samplerControle detalhadoGerenciado pelo modelo
Contexto webColar ou extensõesReferenciar aba ou arquivo com @
Primeira resposta útilEndpoint + template + presetInstalar + escolher
Seletor de modelos do Tabbit com GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash e Claude-Sonnet-4.6. Gemma 4 não aparece na captura.

Referencie a fonte

Mantenha a wiki ou as notas em uma aba. Use `@` para referenciar página, captura ou arquivo e pedir um esboço de cena, uma verificação de consistência ou um resumo.

Seletor de modelos do Tabbit com GPT-5.4, GPT-5.2-Chat, Gemini-3.1-Pro, Gemini-3-Flash e Claude-Sonnet-4.6. Gemma 4 não aparece na captura.

Contexto web

Referenciar aba ou arquivo com @

Perguntas frequentes

Gemma 4 26B A4B e SillyTavern

Qual é o nome oficial do Gemma 4 26B?+

O Google chama o modelo de Gemma 4 26B A4B. O checkpoint de instruções do Hugging Face é `google/gemma-4-26B-A4B-it`; distribuidores podem acrescentar sufixos.

26B A4B é igual ao Gemma 4 31B?+

Não. 26B A4B é MoE, com 25,2 bilhões no total e cerca de 3,8 bilhões ativos. 31B é denso e tem cerca de 30,7 bilhões.

De quanta VRAM preciso?+

Não há um número único. Quantização, KV cache, contexto, buffers e encoder visual alteram o uso. Meça o arquivo real com o contexto desejado.

Por que `<|think|>` aparece na resposta?+

O tokenizer ou template pode não coincidir com o backend, ou o servidor pode mostrar o token como texto. Confira o formato e thinking antes do sampling.

O Tabbit executa Gemma 4 26B?+

Não presuma. O mapping atual do Tabbit não inclui Gemma 4. Use somente um modelo que apareça no seletor.

Corrija o caminho do modelo antes do preset

Para Gemma 4 26B A4B local, confirme checkpoint, memória, tokenizer e template nessa ordem. Para conversar ao lado de uma wiki, instale o Tabbit e confira o seletor atual.

Disponível para macOS e Windows. A disponibilidade dos modelos pode mudar.

© 2026 Tabbit Browser. O navegador nativo de IA que entende o seu contexto.