TabbitBlog

Kimi K2 no SillyTavern: configuração e solução de problemas

Conecte um checkpoint Kimi K2 por um backend local ou hospedado e teste cada camada.

Neste artigo
  1. Principais pontos
  2. Camadas da conexão
  3. 1. Confirme o checkpoint
  4. 2. Escolha local ou provedor
  5. 3. Conecte seguindo o contrato do backend
  6. Proteja chaves e prompts privados
  7. 4. Faça um teste curto
  8. 5. Avalie o roleplay depois
  9. Um espaço de pesquisa: Tabbit Browser
  10. Qual rota escolher?
  11. Perguntas frequentes
  12. O SillyTavern executa Kimi K2 sozinho?
  13. Qual ID informar?
  14. Chat Completion ou Text Completion?
  15. Posso executar Kimi K2 localmente?
  16. Por que recebo respostas vazias, marcadores ou repetição?
  17. Fontes e estado

Para usar Kimi K2 no SillyTavern, conecte a interface a um backend separado que ofereça um checkpoint K2 identificado. O SillyTavern monta o contexto da conversa, mas não hospeda o modelo. Confirme a versão, escolha um servidor local ou provedor documentado e teste uma solicitação simples antes de adicionar contexto de roleplay.

Este guia cobre Kimi-K2-Instruct e uma atualização K2 apenas quando o backend identifica explicitamente o checkpoint. Não é um passo a passo de um provedor: endpoint hospedado, alias API, preço, cota e disponibilidade atuais não foram verificados. O texto continua como rascunho até uma conexão real ser reproduzida.

Principais pontos

  • SillyTavern é o cliente; outro backend precisa executar Kimi K2.

  • Confirme checkpoint, revisão, quantização e template exatos. A página oficial aponta para Kimi-K2-Instruct-0905; não misture configurações de versões.

  • O ID do repositório Hugging Face pode ser diferente do alias API.

  • Chat Completions e Text Completions descrevem a montagem do prompt, não nuvem versus local.

  • Teste conexão, modelo, template e conversa em etapas. Nenhum backend K2 real foi testado aqui.

Camadas da conexão

ParteFunçãoO que verificar
CheckpointFornece pesos e comportamento do modeloVariante, revisão, quantização, licença e template
Servidor de inferênciaCarrega o modelo e expõe uma APIFormato, versão, caminho, endereço e template
Provedor hospedadoExecuta o modelo remotamenteModelo exato, ID, autenticação, limites, preço, contexto e dados
SillyTavernMonta contexto e envia a solicitaçãoTipo de API e configurações documentadas pelo backend

Uma conexão bem-sucedida só mostra que o endpoint responde. Não prova o checkpoint, template nem coerência em sessões longas.

1. Confirme o checkpoint

Comece pelo cartão oficial Kimi K2-Instruct, não por um preset antigo. O cartão mostra exemplos locais com vLLM e SGLang e aponta para Kimi-K2-Instruct-0905. A página do projeto Kimi K2 diz que a atualização 0905 altera pesos e suporte de contexto. Anote nome e revisão, quantização, runtime, quem aplica o template e o ID aceito nas solicitações.

Os exemplos oficiais mostram interface chat completions compatível com OpenAI. Isso não prova que qualquer provedor use o mesmo endpoint ou ID. Compatibilidade de protocolo não garante recursos, limites, políticas ou resultados idênticos.

Não complete instruções do K2 original com material de K2.5, K2.6, K2.7 Code, K2.8 ou K3. Veja separadamente Kimi K2.6, Kimi K3 SillyTavern e configuração K3; não são presets para K2.

\nOutros guias mostram caminhos diferentes; IDs e presets não são intercambiáveis com K2. Veja Mistral 24B, DeepSeek V4 Flash, GLM-5.3 e Gemma 4 como exemplos separados. Kimi K3 roleplay cobre outra geração.\n

2. Escolha local ou provedor

RotaQuando faz sentidoVerifique na fonte atualDesconhecido neste rascunho
Servidor localVocê quer controlar runtime e endpointCheckpoint, engine, template, endereço e hardwareInstalação, memória, latência e velocidade não testadas
Provedor hospedadoO catálogo nomeia o checkpoint exatoID, URL base, chave, limites, preço, contexto e dadosNenhum provedor K2 foi aberto e testado
Web/App KimiVocê quer apenas a interface própriaSe há produto API separado e documentadoChat para consumidor não comprova acesso API

Local exige administrar arquivos do modelo, hardware e atualizações. Hospedado depende das condições e instruções do provedor. Exemplos oficiais não dimensionam hardware: quantização, contexto, memória e runtime alteram a necessidade. Não estime requisitos pelo número de parâmetros ativos.

Para um provedor, abra catálogo e guia atuais. Se checkpoint, formato de solicitação, campo de autenticação e ID não estiverem documentados, pare em vez de adivinhar.

3. Conecte seguindo o contrato do backend

A documentação API Connections do SillyTavern explica que Chat Completions organiza mensagens por papel e Text Completions as reúne em um texto contínuo. O tipo muda como o prompt é montado, não onde o servidor roda.

  1. Inicie o servidor pelas instruções do checkpoint e runtime escolhidos; aguarde o estado pronto informado pelo servidor.

  2. Em API Connections, selecione o tipo indicado pelo backend. Compatibilidade OpenAI, sozinha, não define a opção ou o caminho.

  3. Insira URL e credencial nos campos previstos, copiadas da documentação atual. Não inclua a chave em cartão, nota, captura ou preset compartilhado.

  4. Use o ID aceito por esse backend. Ele pode diferir do repositório HF.

  5. Confirme se o servidor ou o SillyTavern aplica o template. Evite formatação duplicada.

  6. Se houver perfis, salve uma base com checkpoint, data, tipo de API e responsável pelo template. Salvar não valida os valores.

Os rótulos mudam por versão. Confira os dois lados e não experimente outra API com uma chave real.

Proteja chaves e prompts privados

Trate a chave como senha. Confira se perfil ou captura a exporta e faça rotação se exposta. Um endpoint local pode estar acessível pela rede; siga instruções de binding e firewall e não exponha servidor sem autenticação à Internet.

4. Faça um teste curto

Comece com um pedido simples, como “Responda em uma frase para confirmar que recebeu a mensagem”. Verifique texto normal. Depois use um cartão pequeno por dois turnos e pergunte sobre um detalhe neutro do turno anterior. Procure marcadores, papéis duplicados, resposta vazia ou texto inesperado. Dois turnos não provam memória longa.

Adicione uma camada por vez: lorebook, nota do autor, saudação longa ou extensão. Um cartão extenso pode exceder o contexto real ou pressupor outro template. Se o teste curto funciona e o longo falha, compare tamanho e formato antes de alterar a geração.

SintomaCamada provávelPrimeira verificação
Não conectaServidor/endpointEstado, URL, caminho, porta e rede
Erro de autenticaçãoChave/contaCampo, validade e permissões
Modelo desconhecidoIdentificadorAlias do backend versus ID HF
Resposta vaziaSolicitação/servidorTipo, caminho, logs e limite de saída
Marcadores visíveisTemplateCliente e servidor formatam ambos?
RepetiçãoPrompt/configuraçãoCartão duplicado, lore, contexto, stop
LentidãoCarga/hardware/filaLogs, quantização, trabalhos e tamanho do prompt
Primeiro turno funciona, depois falhaContexto acumuladoHistórico e ativação de lore

Registre checkpoint, versões do servidor e SillyTavern, tipo de API, última mudança e erro sem segredos. Mude uma variável por vez. Logs podem conter conversa privada; inspecione localmente e compartilhe só o trecho mínimo redigido.

5. Avalie o roleplay depois

Uma chamada API válida não indica se o estilo agrada. Mantenha cartão, prompt, contexto e configurações iguais ao comparar. Avalie voz, avanço da cena sem controlar o personagem do usuário, respeito a limites e uso de detalhe recente. Registre exemplos e limitações; uma boa resposta isolada não é uma nota geral.

Não suponha que presets K2.6, K3 ou de outro modelo sirvam para K2. Se o backend publicar parâmetros para o checkpoint exato, cite a fonte e teste depois de estabilizar a conexão. A guia separada Kimi K2 roleplay trata da adequação do estilo.

Um espaço de pesquisa: Tabbit Browser

O Tabbit Browser pode manter abertos o cartão do modelo, as instruções do runtime e os docs do SillyTavern enquanto você registra qual fonte define cada ajuste. Não testamos o Tabbit com servidor K2; ele não hospeda o modelo nem substitui SillyTavern. Use o backend para inferência e SillyTavern para o contexto RP. O navegador não valida chave ou endpoint.

Qual rota escolher?

SituaçãoPróximo passo
Hardware compatível e quer controleSiga a documentação do checkpoint e runtime
Quer API hospedadaAguarde docs atuais com checkpoint e endpoint exatos
Só tem o app web KimiVerifique se existe API separada documentada
Conecta, mas o estilo não agradaMantenha conexão e avalie modelo/cartão separadamente
Marcadores aparecemIdentifique quem aplica o template

Kimi K2 pode conectar-se ao SillyTavern por um backend compatível que sirva o checkpoint exato. Confirme a versão e a documentação primária, use valores documentados, teste uma mensagem simples e então um cartão pequeno. Se ID ou endpoint não estiver documentado, não invente.

Perguntas frequentes

O SillyTavern executa Kimi K2 sozinho?

Não. É uma interface que monta prompts e conecta a um backend. Você precisa de servidor local ou serviço hospedado que exponha o checkpoint exato por uma API compatível.

Qual ID informar?

Use o ID que o backend especifica para o checkpoint ou deployment. moonshotai/Kimi-K2-Instruct não é necessariamente o alias API.

Chat Completion ou Text Completion?

Siga o formato do backend. A opção define como o SillyTavern monta o prompt; não separa local de nuvem.

Posso executar Kimi K2 localmente?

O cartão oficial inclui exemplos de vLLM e SGLang. A viabilidade depende do checkpoint, quantização, hardware e runtime; nenhuma instalação foi testada aqui.

Por que recebo respostas vazias, marcadores ou repetição?

Confira endpoint e ID, depois determine qual camada aplica o template. Reduza o prompt e acrescente contexto aos poucos antes de mudar parâmetros de geração.

Fontes e estado

O cartão oficial Kimi K2-Instruct, o projeto Kimi K2 e a documentação API Connections foram abertos no Tabbit em 2026-09-23. Provedor, conexão e saída reais, preço/disponibilidade, capturas comunitárias e integração Tabbit seguem sem verificação. Mantido como rascunho.

Perguntas frequentes

O SillyTavern executa Kimi K2?

Não. É preciso um servidor local ou provedor com o checkpoint exato.

Qual ID informar?

Use o ID documentado pelo backend; o ID HF pode não ser o alias API.

Chat ou Text Completion?

Siga o formato do backend; não é uma distinção entre nuvem e local.

Kimi K2 pode rodar localmente?

A ficha tem exemplos; memória e velocidade dependem do checkpoint e hardware.

O que conferir em resposta vazia?

Endpoint, ID, conexão e camada de template; depois faça um teste curto.

Dê o próximo passo

Deixe o Tabbit trabalhar ao seu lado.

Pesquise entre abas, automatize o trabalho repetitivo do navegador e mantenha todo o contexto ao alcance.