01 / MODELO
Thinking está sempre ativo
A Moonshot documenta K3 como um modelo que sempre raciocina. A API aceita reasoning_effort low, high ou max. Uma resposta longa não prova que o preset falhou.
CONFIGURE ANTES DO PRESET
Uma conexão estável começa com quatro dados: provedor atual, alias do modelo, caminho Chat Completions e tratamento do histórico de raciocínio. Confira isso antes de ajustar um card.
Alias oficial: kimi-k3 · Base URL de exemplo: https://api.moonshot.ai/v1 · K3 mantém thinking sempre ativo.

COMO LER OS SINAIS
Kimi K3 pode escrever bem e ainda ter um endpoint errado ou uma mensagem de reasoning incompleta. Comece por estas três verificações.
01 / MODELO
A Moonshot documenta K3 como um modelo que sempre raciocina. A API aceita reasoning_effort low, high ou max. Uma resposta longa não prova que o preset falhou.
02 / PROVEDOR
O exemplo oficial usa https://api.moonshot.ai/v1 e kimi-k3. Proxies podem expor aliases, cotas, preços e parâmetros diferentes.
03 / RELATOS
Discussões públicas no X e Reddit citam lentidão, 429, excesso de pensamento e reasoning blocks. São relatos, não SLA ou benchmark.
CINCO VERIFICAÇÕES
Comece com um chat de teste pequeno. Mude uma opção, envie um turno e anote o resultado.
Os fatos de K3 vêm do guia oficial da Kimi. Painéis de provedores e extensões podem mudar separadamente.
Escolha Moonshot ou um provedor que liste Kimi K3 agora. Confirme cobrança, limites, slug e compatibilidade com OpenAI.
✓ A entrada Kimi K3 ou kimi-k3 aparece no provedor.
O Quickstart oficial envia a solicitação para /chat/completions. No SillyTavern, use Chat Completions, não um template de text completion.
✓ O teste chega a /v1/chat/completions sem erro de template.
Use um personagem, uma cena e pouco contexto. Escreva voz e limites uma vez para manter o diagnóstico claro.
✓ A primeira resposta mantém papel e formato antes do preset.
O streaming pode separar reasoning_content e content. Confirme que a interface lida com os dois e envia a mensagem assistant completa no turno seguinte.
✓ A próxima solicitação não perde raciocínio nem resposta final.
Extensões prefill e preserved-thinking podem ajudar em um comportamento específico, mas são ferramentas da comunidade, não exigências da Kimi.
✓ Você consegue ligar a melhora a uma única mudança.
COMECE PELO SINTOMA
Faça a verificação mais estreita para o sintoma. Não troque presets ao acaso enquanto houver erro de autenticação ou endpoint.
| O que aparece | Camada provável | Próxima verificação |
|---|---|---|
| 401 ou chave inválida | Chave ou conta | Crie uma chave nova, confirme a ativação da conta e remova espaços. |
| 404 ou modelo não encontrado | Base URL ou alias | Compare a lista atual com kimi-k3. Mantenha /v1 e deixe o conector adicionar /chat/completions. |
| 429, timeout ou ocupado | Cota ou limite | Confira concorrência, RPM/TPM, nível da conta e estado do provedor. Evite retry em loop. |
| Resposta vazia ou reasoning quebrado | Mapeamento | Separe reasoning_content de content, ative reasoning e preserve a mensagem assistant completa. |
| Pensamento longo, desvio ou repetição | Prompt e histórico | Reduza reasoning_effort se possível, encurte as instruções e teste um chat limpo antes do prefill. |
UM CAMINHO MAIS CURTO
Se você só quer ler uma ficha, wiki ou brief enquanto conversa, o Tabbit evita o primeiro ciclo de endpoint. Confira o acesso no seletor atual.
Abra a ficha, o lore ou o documento em uma aba. O Tabbit usa páginas, capturas e arquivos como contexto.
✓ A fonte continua visível durante a pergunta.

Selecione Kimi-K3 no seletor do Chat ou da nova aba. A lista muda; use a interface atual como referência.
✓ O modelo desejado aparece no seletor.

Use a barra lateral ou compare respostas numa mesma visão. O Tabbit não substitui cards, lorebooks, extensões nem grupos do ST.
✓ A pergunta mantém o contexto da página ou do arquivo.

FAQ DE CONFIGURAÇÃO
O Quickstart oficial usa kimi-k3 e a base URL de exemplo é https://api.moonshot.ai/v1. Confira a lista do provedor, pois aliases podem mudar.
Use Chat Completions compatível com OpenAI para a rota Moonshot. Text completion tem outro formato de solicitação.
Na API Moonshot, thinking fica ativo. Se o provedor permitir, reduza reasoning_effort, encurte as instruções e confirme a preservação da mensagem assistant completa.
Não para começar. Teste a conexão limpa e adicione uma técnica da comunidade quando souber qual comportamento quer mudar.
Confira nível da conta, concorrência, RPM/TPM, estado do provedor e retries repetidos do SillyTavern.
Não. O Tabbit serve para usar Kimi K3 ao lado de uma página ou arquivo. Cards, lorebooks, extensões e grupos continuam no SillyTavern.
Mantenha o SillyTavern para seu fluxo de personagens. Para começar com menos configuração, abra o Tabbit, escolha Kimi-K3 e leve o contexto da página.
Disponível para macOS e Windows. O acesso e as cotas podem variar por edição e plano.