K3 sempre raciocina
K3 usa `reasoning_effort` no nível superior, com `low`, `high` ou `max`. Não copie as configurações `thinking` do K2.x para uma requisição K3.
KIMI K3 / PREFILL DE RACIOCÍNIO
O Kimi K3 sempre raciocina. O Partial Mode continua um prefixo da mensagem assistant, enquanto o raciocínio e o conteúdo final podem chegar em campos diferentes. Essa separação explica respostas vazias, erros 400, raciocínio exposto e perda de contexto no turno seguinte.
A referência oficial de Chat Completions do Kimi documenta K3, Partial Mode e as diferenças com K2.x. Confira o suporte do provedor separadamente.

COMECE PELO CONTRATO
A documentação do Kimi é específica. Posts da comunidade ajudam a identificar sintomas em provedores e SillyTavern, mas não garantem uma solução universal.
K3 usa `reasoning_effort` no nível superior, com `low`, `high` ou `max`. Não copie as configurações `thinking` do K2.x para uma requisição K3.
Adicione uma mensagem `assistant` ao fim de `messages` e use `partial: true` para orientar o prefixo da saída. Isso não é uma forma documentada de injetar raciocínio privado.
Um gateway pode renomear, remover ou rejeitar `partial`, `reasoning_effort` ou `reasoning_content`. Compare primeiro o mesmo prompt sem prefill antes de mudar um cartão de personagem.
MAPA DE CAMPOS
Escolha o campo conforme a família do modelo. A tabela ajuda no diagnóstico, mas não garante que um gateway encaminhe todos os campos.
| Pergunta | Kimi K3 | Kimi K2.x |
|---|---|---|
| É possível desativar thinking? | Não. O K3 sempre raciocina. | Depende do modelo. O K2.6 documenta enabled ou disabled; o K2.7-code fica fixo em enabled. |
| Controle de raciocínio | No nível superior, `reasoning_effort`: low, high, max. | `thinking.type`, com padrões que variam conforme o modelo. |
| Histórico preservado | O K3 usa preserved thinking. Retorne o turno assistant completo quando o provedor exigir. | `thinking.keep` é documentado para K2.x e varia conforme o modelo. |
| Prefill | O Partial Mode continua o prefixo assistant com `partial: true`. | Consulte a documentação do modelo e do provedor. Não deduza suporte a partir dos exemplos do K3. |
Se uma requisição K3 contiver `thinking: { type: "enabled" }`, remova-o, a menos que o provedor documente explicitamente uma camada de tradução.
VERIFICAÇÃO DO PREFILL
Um teste curto e controlado separa prompt, mapeamento da resposta, histórico e provedor. Mantenha o mesmo modelo e endpoint e mude apenas uma coisa por vez.
Formato mínimo do Partial Mode
{
"model": "kimi-k3",
"messages": [
{"role": "user", "content": "Retorne um objeto de status."},
{"role": "assistant", "content": "{\"status\":", "partial": true}
],
"reasoning_effort": "low",
"stream": false
}O exemplo mostra a função de cada campo, não um preset universal do SillyTavern. Não coloque chaves de API no código.
Verifique o slug exato na lista do provedor. Na API oficial do Kimi, o alias K3 é `kimi-k3`; um gateway pode publicar outro alias.
Remova `partial`, use uma mensagem user normal e deixe apenas o campo de raciocínio documentado para K3. Salve `content` e qualquer `reasoning_content` retornado.
Coloque um prefixo pequeno na última mensagem assistant e defina `partial: true`. Comece com uma orientação de formato como `{"status":`, em vez de um bloco longo de roleplay.
No turno seguinte, preserve a mensagem assistant completa no formato documentado pelo provedor. Não misture um bloco de raciocínio ao prefixo do conteúdo.
PROVEDOR E FRONTEND
O SillyTavern aceita endpoints compatíveis com OpenAI e permite inserir manualmente o ID do modelo quando não há endpoint de models. O endpoint decide quais campos do K3 chegam intactos.
| Moonshot oficial | Gateway ou rota do SillyTavern | |
|---|---|---|
| Modelo | `kimi-k3` | Use o alias exato informado atualmente pelo provedor. |
| Raciocínio | `reasoning_effort` low, high, max | Confirme se é encaminhado, renomeado ou removido. |
| Partial Mode | Prefixo assistant e `partial: true` | Verifique se o campo é aceito para esse modelo. |
| Histórico da resposta | Preserve a mensagem assistant quando necessário | Verifique se reasoning e content permanecem separados. |
| Configuração do SillyTavern | Use a fonte de API documentada | Test Message e Bypass API status check ajudam a separar as verificações do frontend. |
DO SINTOMA AO TESTE
Estes testes mantêm o diagnóstico concentrado. Um relato da comunidade pode sugerir uma hipótese, mas a requisição e a resposta do provedor escolhido são as evidências.
400 depois de importar um preset K2.x
Esquema de raciocínio incorreto
Remova `thinking` e os campos de histórico do K2.x. Use `reasoning_effort` para K3 e o alias atual do provedor.
Resposta vazia depois de um raciocínio visível
Mapeamento da resposta ou histórico
Examine os deltas de streaming e os campos sem streaming. Preserve o turno assistant completo, não apenas `content`.
O prefill retorna uma recusa ou continuação estranha
Partial Mode ou provedor
Desative `partial` e compare uma conclusão limpa. Confirme se esse modelo e essa rota documentam suporte a prefill.
O raciocínio aparece na resposta final
Limite do renderizador
Renderize `reasoning_content` separado de `content`. Não concatene os dois campos para exibição.
O turno seguinte perde o contexto
Histórico truncado ou editado
Registre as messages enviadas, mantenha o objeto assistant completo e verifique o limite de contexto do provedor.
O raciocínio demora demais
Effort, prompt ou quota
Experimente o effort mais baixo documentado pelo provedor, encurte o histórico de teste e compare com o prefill desligado.
UMA ROTA COM MENOS CONFIGURAÇÃO
Para consultar uma ficha de personagem, um documento de API ou uma página de pesquisa, o Tabbit permite escolher um modelo atual e manter a fonte visível. Essa tarefa no navegador não exige configurar um endpoint; o SillyTavern continua indicado para cartões e extensões.
Use a página visível, uma captura de tela ou um arquivo local como contexto. Faça uma pergunta objetiva sem montar antes um payload de prefill.

Escolha Kimi-K3 quando ele aparecer na lista. A imagem é um exemplo de interface; o acesso depende da sua edição e do seu plano.

Faça uma pergunta na barra lateral ou compare várias respostas. Você terá uma base antes de voltar ao teste de Partial Mode específico do provedor.

FAQ DE PREFILL DE RACIOCÍNIO
A API oficial documenta o Partial Mode. Coloque uma mensagem assistant no fim de `messages` e use `partial: true` para continuar o prefixo. Confira também o provedor utilizado.
Não presuma que sim. O Partial Mode documentado trata do prefixo da saída assistant. O raciocínio é outro limite da resposta, e o provedor pode rejeitar ou reescrever uma tentativa de injeção.
Para K3, use `reasoning_effort` no nível superior com `low`, `high` ou `max`. O objeto `thinking` aparece nos exemplos do K2.x e não é um controle universal do Kimi.
Desative o prefill e faça uma requisição limpa. Verifique se `content` e `reasoning_content` chegam separados e se a mensagem assistant completa é preservada no turno seguinte.
Confira o alias do modelo, o endpoint, o JSON e o suporte do provedor. Remova os campos K2.x copiados e os samplers não suportados antes de alterar o prompt.
Uma discussão no Reddit relata que um usuário só encontrou suporte na Moonshot. É uma observação individual, não uma regra geral. Consulte a documentação da sua rota.
Use os nomes oficiais dos campos do K3, teste o Partial Mode com um prefixo curto e preserve o turno assistant esperado pelo provedor. Para perguntas sobre páginas ou arquivos, abra o Tabbit e escolha Kimi-K3 no seletor atual.
Disponível para macOS e Windows. O acesso aos modelos e as quotas dependem da edição e do plano atuais.