Checkpoint dense oficial
O cartão da Qwen se chama Qwen/Qwen3.8-27B. Ele informa 27B parâmetros, codificador visual, licença Apache-2.0 e contexto nativo de 262.144 tokens.
Qwen3.8-27B · guia para SillyTavern
O nome é real, mas costuma ser misturado com outros modelos. A Qwen publica o checkpoint dense oficial Qwen3.8-27B, com visão e linguagem. Qwen3.8-Max é outro membro da família: 2,4 trilhões de parâmetros no total e 95 bilhões ativos. Confirme o checkpoint e o provedor antes de ajustar o preset.
Este guia separa fatos upstream de relatos da comunidade. Não promete provedor, quantização ou acesso em todas as contas do Tabbit.

Conferir o nome
Os resultados de busca colocam várias etiquetas juntas. Elas apontam para artefatos diferentes, então copiar apenas o nome pode desviar a configuração local.
O cartão da Qwen se chama Qwen/Qwen3.8-27B. Ele informa 27B parâmetros, codificador visual, licença Apache-2.0 e contexto nativo de 262.144 tokens.
O anúncio da Qwen e o nome dos pesos abertos descrevem Qwen3.8-Max com 2,4 trilhões no total e 95 bilhões ativos. O peso aberto é Qwen3.8-2.4T-A95B, não um alias de 27B.
GGUF, FP8, GPTQ e fine-tunes de RP podem trazer sufixos ou o nome do autor. Trate cada repositório como um artefato separado e leia suas notas.
O SillyTavern precisa do ID exato exposto pelo provedor. Um nome amigável não prova que a rota entrega Qwen3.8-27B.
Cartão do modelo
Use estes fatos para escolher o runtime. Eles descrevem o checkpoint upstream, não o uso de memória de cada arquivo quantizado.
O modelo de linguagem dense tem 27B parâmetros. A página também mostra uma etiqueta de tamanho safetensors de 28B, que não é outro nome de modelo.
A página o classifica como image-text-to-text e descreve compreensão de imagem e vídeo. O backend ainda precisa do processador e suporte multimodal.
O contexto nativo é 262.144 tokens, com extensão até 1M descrita no cartão. Contexto longo não significa que toda GPU consiga carregá-lo.
Há exemplos para Transformers, vLLM, SGLang, TokenSpeed e Docker. Escolha uma versão atual que declare suporte a esta arquitetura.

Configuração do SillyTavern
Um cartão de personagem não corrige uma rota errada nem um template duplicado. Siga esta ordem com uma API hospedada ou servidor local.
Rótulos de provedores, presets da comunidade e repositórios quantizados não fazem parte do cartão upstream. Mantenha cada afirmação ligada à sua fonte.
Copie o repositório ou ID exato do provedor. Separe Qwen/Qwen3.8-27B, um derivado quantizado e o membro Qwen3.8-2.4T-A95B.
Localmente, confirme que Transformers, vLLM, SGLang, llama.cpp ou seu aplicativo suporta o checkpoint e o caminho visual. Um GGUF pode limitar o multimodal.
Para um servidor compatível com OpenAI, selecione Chat Completions, informe a Base URL documentada e copie o model ID retornado. Não coloque chaves no cartão.
Deixe a rota hospedada serializar as mensagens ou use o template documentado do tokenizer local. Aplicar os dois pode quebrar papéis e tags.
Se o provedor oferecer a opção, teste o mesmo cartão com thinking desligado ou low, depois medium e xhigh. Meça a latência antes do preset de estilo.
Diagnóstico rápido
Mantenha o cartão e a primeira mensagem fixos. Mude uma entrada por vez e guarde o model ID de cada resposta.
| Sintoma | Verifique primeiro | Ajuste pequeno |
|---|---|---|
| Modelo ausente ou fallback silencioso | Lista do provedor e model da resposta | Copie o ID exposto e remova o alias qwen3.8-27b inventado. |
| Papéis, tags ou formato quebrados | Quem controla o template | Use um único caminho de template e abra um chat novo. |
| VRAM insuficiente | Formato, contexto e entradas visuais | Teste um quant menor, menos contexto e uma base só de texto. |
| Muito raciocínio, pouca ação na cena | Modo, limite de saída e tamanho do preset | Compare low ou medium com xhigh usando o mesmo cartão. |
| A prosa muda entre provedores | Filtros, samplers e prompt de sistema | Registre a rota como variável, não como fato do modelo. |
Cartão de teste RP
Um prompt de teste enxuto deixa claras as diferenças de template, raciocínio e provedor.
Role: Você é [personagem]. Scene: [local, relação, conflito atual]. Style: [ponto de vista, idioma, tamanho]. Direction: Avance uma ação observável. Não fale pelo usuário. Continuity: Use fatos confirmados; pergunte em caso de dúvida. Format: Ação primeiro, diálogo depois. 250 a 450 palavras. Sem resumo. Check: Preserve voz, limites e pista não resolvida do turno anterior.
Envie o mesmo cartão três vezes. Compare latência, tags inesperadas, formato e movimento da cena antes de mudar temperatura ou preset.
Rota do navegador
O SillyTavern continua sendo o cockpit para cartões e lorebooks. O Tabbit ajuda a ler a ficha do modelo, comparar provedores e escrever com referências sem copiar tudo.
Deixe a ficha do Hugging Face, a documentação do provedor ou a wiki do personagem em uma aba.
Abra o seletor de modelos do Tabbit e escolha Qwen3.8-27B apenas se essa opção exata aparecer na sua edição e conta.
Use @ para levar uma página, captura ou arquivo à pergunta. Peça a outro modelo para extrair requisitos de template ou comparar uma nota de quantização.
O chat multimodelo pode ler a mesma fonte por ângulos diferentes. A imagem mostra o fluxo do navegador, não acesso igual para todos.

Rota do navegador


Escolha a superfície
Eles cuidam de partes diferentes do fluxo de RP. Deixe controles especializados no lugar e use o navegador quando a referência for o gargalo.
| Necessidade | SillyTavern | Tabbit |
|---|---|---|
| Cartões e lorebooks | Controles de RP dedicados | Referenciar páginas e arquivos |
| Preset e ordem de prompts | Controle detalhado | Prompt de sistema e Skills |
| Ler docs durante o RP | Extensões ou copiar e colar | Abas abertas viram contexto |
| Comparar respostas | Provedor ou extensões | Chat multimodelo no navegador |
| Primeiro passo | Verificar ID, backend e template | Abrir a fonte e ver o seletor |
Abrir as evidências
Os links separam especificações upstream dos relatos que explicam os problemas no SillyTavern.
Perguntas frequentes
Sim. Qwen/Qwen3.8-27B tem cartão oficial no Hugging Face e é um checkpoint dense de visão e linguagem com 27B. É diferente de Qwen3.8-Max e Qwen3.8-2.4T-A95B.
Não. Qwen3.8-Max é descrito com 2,4 trilhões de parâmetros totais e 95 bilhões ativos. Não use seu ID ou quant 2,4T para testar o dense de 27B.
Depende de GPU, RAM, contexto e backend. Comece por um repositório que declare formato e suporte do loader. GGUF, FP8, GPTQ e fine-tunes são artefatos distintos.
Provedores hospedados normalmente serializam as mensagens. Um servidor local deve seguir o tokenizer ou o cartão do checkpoint. Não aplique um segundo template Qwen.
Verifique raciocínio, limite de saída, contexto, samplers e rota separadamente. Repita o mesmo cartão e anote o provedor antes de mudar o prompt.
Escolha-o apenas se o seletor do Tabbit mostrar o modelo exato. A disponibilidade depende de edição, região, conta e implantação.
Instale o Tabbit para macOS ou Windows, confira o seletor e leve a ficha do modelo ou a wiki do personagem para a mesma conversa no navegador.
O acesso ao modelo e as condições do provedor variam conforme edição e implantação.