KIMI K3 / PREFILL DE RACIOCÍNIO

Faça prefill da resposta, não do bloco de raciocínio errado

O Kimi K3 sempre raciocina. O Partial Mode continua um prefixo da mensagem assistant, enquanto o raciocínio e o conteúdo final podem chegar em campos diferentes. Essa separação explica respostas vazias, erros 400, raciocínio exposto e perda de contexto no turno seguinte.

Ver o mapa de compatibilidade

A referência oficial de Chat Completions do Kimi documenta K3, Partial Mode e as diferenças com K2.x. Confira o suporte do provedor separadamente.

Nova aba do Tabbit com prompt central e seletor de modelos aberto para ver a lista atual.

COMECE PELO CONTRATO

Raciocínio e prefill têm limites diferentes

A documentação do Kimi é específica. Posts da comunidade ajudam a identificar sintomas em provedores e SillyTavern, mas não garantem uma solução universal.

K3 sempre raciocina

K3 usa `reasoning_effort` no nível superior, com `low`, `high` ou `max`. Não copie as configurações `thinking` do K2.x para uma requisição K3.

Partial Mode continua o conteúdo

Adicione uma mensagem `assistant` ao fim de `messages` e use `partial: true` para orientar o prefixo da saída. Isso não é uma forma documentada de injetar raciocínio privado.

O provedor também faz parte do teste

Um gateway pode renomear, remover ou rejeitar `partial`, `reasoning_effort` ou `reasoning_content`. Compare primeiro o mesmo prompt sem prefill antes de mudar um cartão de personagem.

MAPA DE CAMPOS

K3 e K2.x não usam o mesmo controle thinking

Escolha o campo conforme a família do modelo. A tabela ajuda no diagnóstico, mas não garante que um gateway encaminhe todos os campos.

K3 e K2.x não usam o mesmo controle thinking
PerguntaKimi K3Kimi K2.x
É possível desativar thinking?Não. O K3 sempre raciocina.Depende do modelo. O K2.6 documenta enabled ou disabled; o K2.7-code fica fixo em enabled.
Controle de raciocínioNo nível superior, `reasoning_effort`: low, high, max.`thinking.type`, com padrões que variam conforme o modelo.
Histórico preservadoO K3 usa preserved thinking. Retorne o turno assistant completo quando o provedor exigir.`thinking.keep` é documentado para K2.x e varia conforme o modelo.
PrefillO Partial Mode continua o prefixo assistant com `partial: true`.Consulte a documentação do modelo e do provedor. Não deduza suporte a partir dos exemplos do K3.

Se uma requisição K3 contiver `thinking: { type: "enabled" }`, remova-o, a menos que o provedor documente explicitamente uma camada de tradução.

VERIFICAÇÃO DO PREFILL

Faça um turno limpo antes de adicionar um prefixo

Um teste curto e controlado separa prompt, mapeamento da resposta, histórico e provedor. Mantenha o mesmo modelo e endpoint e mude apenas uma coisa por vez.

Formato mínimo do Partial Mode

{
  "model": "kimi-k3",
  "messages": [
    {"role": "user", "content": "Retorne um objeto de status."},
    {"role": "assistant", "content": "{\"status\":", "partial": true}
  ],
  "reasoning_effort": "low",
  "stream": false
}

O exemplo mostra a função de cada campo, não um preset universal do SillyTavern. Não coloque chaves de API no código.

  1. 01

    1. Confirme a família do modelo

    Verifique o slug exato na lista do provedor. Na API oficial do Kimi, o alias K3 é `kimi-k3`; um gateway pode publicar outro alias.

  2. 02

    2. Envie uma requisição limpa

    Remova `partial`, use uma mensagem user normal e deixe apenas o campo de raciocínio documentado para K3. Salve `content` e qualquer `reasoning_content` retornado.

  3. 03

    3. Adicione um prefixo assistant curto

    Coloque um prefixo pequeno na última mensagem assistant e defina `partial: true`. Comece com uma orientação de formato como `{"status":`, em vez de um bloco longo de roleplay.

  4. 04

    4. Reenvie o turno assistant completo

    No turno seguinte, preserve a mensagem assistant completa no formato documentado pelo provedor. Não misture um bloco de raciocínio ao prefixo do conteúdo.

PROVEDOR E FRONTEND

Compatibilidade com OpenAI descreve o formato, não a garantia

O SillyTavern aceita endpoints compatíveis com OpenAI e permite inserir manualmente o ID do modelo quando não há endpoint de models. O endpoint decide quais campos do K3 chegam intactos.

Moonshot oficialGateway ou rota do SillyTavern
Modelo`kimi-k3`Use o alias exato informado atualmente pelo provedor.
Raciocínio`reasoning_effort` low, high, maxConfirme se é encaminhado, renomeado ou removido.
Partial ModePrefixo assistant e `partial: true`Verifique se o campo é aceito para esse modelo.
Histórico da respostaPreserve a mensagem assistant quando necessárioVerifique se reasoning e content permanecem separados.
Configuração do SillyTavernUse a fonte de API documentadaTest Message e Bypass API status check ajudam a separar as verificações do frontend.

DO SINTOMA AO TESTE

Deixe o erro escolher a próxima mudança

Estes testes mantêm o diagnóstico concentrado. Um relato da comunidade pode sugerir uma hipótese, mas a requisição e a resposta do provedor escolhido são as evidências.

400 depois de importar um preset K2.x

Esquema de raciocínio incorreto

Remova `thinking` e os campos de histórico do K2.x. Use `reasoning_effort` para K3 e o alias atual do provedor.

Resposta vazia depois de um raciocínio visível

Mapeamento da resposta ou histórico

Examine os deltas de streaming e os campos sem streaming. Preserve o turno assistant completo, não apenas `content`.

O prefill retorna uma recusa ou continuação estranha

Partial Mode ou provedor

Desative `partial` e compare uma conclusão limpa. Confirme se esse modelo e essa rota documentam suporte a prefill.

O raciocínio aparece na resposta final

Limite do renderizador

Renderize `reasoning_content` separado de `content`. Não concatene os dois campos para exibição.

O turno seguinte perde o contexto

Histórico truncado ou editado

Registre as messages enviadas, mantenha o objeto assistant completo e verifique o limite de contexto do provedor.

O raciocínio demora demais

Effort, prompt ou quota

Experimente o effort mais baixo documentado pelo provedor, encurte o histórico de teste e compare com o prefill desligado.

UMA ROTA COM MENOS CONFIGURAÇÃO

Pergunte primeiro ao Kimi ao lado da fonte

Para consultar uma ficha de personagem, um documento de API ou uma página de pesquisa, o Tabbit permite escolher um modelo atual e manter a fonte visível. Essa tarefa no navegador não exige configurar um endpoint; o SillyTavern continua indicado para cartões e extensões.

01

Mantenha a página ou o arquivo aberto

Use a página visível, uma captura de tela ou um arquivo local como contexto. Faça uma pergunta objetiva sem montar antes um payload de prefill.

Seletor de modelos do Tabbit em uma nova aba, com o prompt e a lista de modelos visíveis.
02

Confira o seletor atual

Escolha Kimi-K3 quando ele aparecer na lista. A imagem é um exemplo de interface; o acesso depende da sua edição e do seu plano.

Chat do Tabbit com vários modelos e uma coluna Kimi-K3 para uma comparação limpa.
03

Compare uma resposta limpa

Faça uma pergunta na barra lateral ou compare várias respostas. Você terá uma base antes de voltar ao teste de Partial Mode específico do provedor.

Barra lateral de resumo do Tabbit ao lado de um artigo, mostrando contexto da página sem payload de prefill.

FAQ DE PREFILL DE RACIOCÍNIO

Respostas antes do próximo turno com erro

O Kimi K3 aceita assistant prefill?+

A API oficial documenta o Partial Mode. Coloque uma mensagem assistant no fim de `messages` e use `partial: true` para continuar o prefixo. Confira também o provedor utilizado.

Posso fazer prefill de reasoning_content no Kimi K3?+

Não presuma que sim. O Partial Mode documentado trata do prefixo da saída assistant. O raciocínio é outro limite da resposta, e o provedor pode rejeitar ou reescrever uma tentativa de injeção.

Devo enviar thinking ou reasoning_effort?+

Para K3, use `reasoning_effort` no nível superior com `low`, `high` ou `max`. O objeto `thinking` aparece nos exemplos do K2.x e não é um controle universal do Kimi.

Por que uma requisição com prefill retorna uma resposta vazia?+

Desative o prefill e faça uma requisição limpa. Verifique se `content` e `reasoning_content` chegam separados e se a mensagem assistant completa é preservada no turno seguinte.

Por que o SillyTavern mostra 400?+

Confira o alias do modelo, o endpoint, o JSON e o suporte do provedor. Remova os campos K2.x copiados e os samplers não suportados antes de alterar o prompt.

A Moonshot é o único provedor com suporte a prefill?+

Uma discussão no Reddit relata que um usuário só encontrou suporte na Moonshot. É uma observação individual, não uma regra geral. Consulte a documentação da sua rota.

Torne o limite visível e escolha seu fluxo

Use os nomes oficiais dos campos do K3, teste o Partial Mode com um prefixo curto e preserve o turno assistant esperado pelo provedor. Para perguntas sobre páginas ou arquivos, abra o Tabbit e escolha Kimi-K3 no seletor atual.

Disponível para macOS e Windows. O acesso aos modelos e as quotas dependem da edição e do plano atuais.

© 2026 Tabbit Browser. O navegador nativo de IA que entende o seu contexto.