K3 raisonne toujours
K3 utilise `reasoning_effort` au niveau supérieur avec `low`, `high` ou `max`. Ne copiez pas les réglages `thinking` de K2.x dans une requête K3.
KIMI K3 / PREFILL DE RAISONNEMENT
Kimi K3 raisonne toujours. Partial Mode poursuit le préfixe d’un message assistant, tandis que le raisonnement et le contenu final peuvent arriver dans des champs distincts. Cette frontière explique les réponses vides, les erreurs 400, le raisonnement visible et la perte de contexte au tour suivant.
La référence officielle Kimi Chat Completions décrit K3, Partial Mode et les différences avec K2.x. Vérifiez séparément le support de votre fournisseur.

COMMENCEZ PAR LE CONTRAT
La documentation Kimi est précise. Les publications de la communauté donnent des indices sur les fournisseurs et SillyTavern, sans garantir une solution universelle.
K3 utilise `reasoning_effort` au niveau supérieur avec `low`, `high` ou `max`. Ne copiez pas les réglages `thinking` de K2.x dans une requête K3.
Placez un message `assistant` à la fin de `messages` et ajoutez `partial: true` pour guider le préfixe de sortie. Ce n’est pas une méthode documentée pour injecter un raisonnement privé.
Une passerelle peut renommer, supprimer ou refuser `partial`, `reasoning_effort` ou `reasoning_content`. Comparez d’abord le même prompt sans prefill avant de modifier une fiche de rôle.
CARTE DES CHAMPS
Choisissez le champ selon la famille du modèle. Ce tableau aide au diagnostic, mais ne garantit pas qu’une passerelle transmette chaque champ.
| Question | Kimi K3 | Kimi K2.x |
|---|---|---|
| Peut-on désactiver thinking ? | Non. K3 raisonne toujours. | Cela dépend du modèle. K2.6 documente enabled ou disabled ; K2.7-code reste fixé sur enabled. |
| Contrôle du raisonnement | Au niveau supérieur, `reasoning_effort` : low, high, max. | `thinking.type`, avec des valeurs par défaut propres au modèle. |
| Historique conservé | K3 utilise preserved thinking. Retournez le tour assistant complet si le fournisseur le demande. | `thinking.keep` est documenté pour K2.x et varie selon le modèle. |
| Prefill | Partial Mode poursuit le préfixe assistant avec `partial: true`. | Consultez la documentation du modèle et du fournisseur. Ne déduisez pas le support des exemples K3. |
Si une requête K3 contient `thinking: { type: "enabled" }`, supprimez-le, sauf si votre fournisseur documente explicitement une couche de traduction.
VÉRIFICATION DU PREFILL
Un test court et contrôlé permet de distinguer le prompt, le mappage de réponse, l’historique et le fournisseur. Gardez le même modèle et le même endpoint, puis ne changez qu’un élément à la fois.
Forme minimale de Partial Mode
{
"model": "kimi-k3",
"messages": [
{"role": "user", "content": "Renvoyez un objet d’état."},
{"role": "assistant", "content": "{\"status\":", "partial": true}
],
"reasoning_effort": "low",
"stream": false
}Cet exemple montre le rôle des champs, pas un preset SillyTavern propre à un fournisseur. Ne mettez pas de clés API dans le code.
Vérifiez le slug exact dans la liste du fournisseur. Pour l’API Kimi officielle, l’alias K3 est `kimi-k3`, mais une passerelle peut en publier un autre.
Retirez `partial`, utilisez un message user normal et gardez seulement le champ de raisonnement documenté pour K3. Enregistrez `content` et tout `reasoning_content` renvoyé.
Placez un petit préfixe dans le dernier message assistant et activez `partial: true`. Commencez par un format comme `{"status":`, plutôt que par un long bloc de roleplay.
Au tour suivant, conservez le message assistant complet dans la forme indiquée par votre fournisseur. Ne mélangez pas un bloc de raisonnement avec le préfixe de contenu.
FOURNISSEUR ET FRONTEND
SillyTavern accepte les endpoints compatibles avec OpenAI et permet de saisir manuellement l’ID du modèle quand l’endpoint models est absent. L’endpoint décide quels champs K3 restent inchangés.
| Moonshot officiel | Passerelle ou route SillyTavern | |
|---|---|---|
| Modèle | `kimi-k3` | Utilisez l’alias exact actuellement fourni. |
| Raisonnement | `reasoning_effort` low, high, max | Confirmez s’il est transmis, renommé ou supprimé. |
| Partial Mode | Préfixe assistant et `partial: true` | Vérifiez que le champ est accepté pour ce modèle. |
| Historique de réponse | Conservez le message assistant si nécessaire | Vérifiez que reasoning et content restent séparés. |
| Réglage SillyTavern | Utilisez la source API documentée | Test Message et Bypass API status check aident à isoler les contrôles du frontend. |
DU SYMPTÔME AU TEST
Ces tests gardent le diagnostic ciblé. Un rapport de communauté peut suggérer une hypothèse, mais la requête et la réponse de votre fournisseur sont les éléments vérifiables.
400 après import d’un preset K2.x
Schéma de raisonnement incorrect
Supprimez `thinking` et les champs d’historique K2.x. Utilisez `reasoning_effort` pour K3 et l’alias actuel du fournisseur.
Réponse vide après un raisonnement visible
Mappage de réponse ou historique
Examinez les deltas de streaming et les champs hors streaming. Conservez le tour assistant complet, pas seulement `content`.
Le prefill renvoie un refus ou une suite étrange
Partial Mode ou fournisseur
Désactivez `partial` et comparez une complétion propre. Vérifiez que ce modèle et cette route documentent le prefill.
Le raisonnement apparaît dans la réponse finale
Frontière du rendu
Affichez `reasoning_content` séparément de `content`. Ne concaténez pas les deux champs à l’écran.
Le tour suivant perd son contexte
Historique tronqué ou modifié
Journalisez les messages sortants, gardez l’objet assistant complet et vérifiez la limite de contexte du fournisseur.
Le raisonnement dure trop longtemps
Effort, prompt ou quota
Essayez le niveau d’effort inférieur documenté, raccourcissez l’historique de test et comparez avec le prefill désactivé.
UNE ROUTE PLUS SIMPLE
Pour examiner une fiche de personnage, un document API ou une page de recherche, Tabbit vous permet de choisir un modèle actuel tout en gardant la source visible. Cette tâche de navigateur ne demande pas de câbler un endpoint ; SillyTavern reste adapté aux cartes et aux extensions.
Utilisez la page visible, une capture d’écran ou un fichier local comme contexte. Posez une question précise sans construire de payload de prefill.

Choisissez Kimi-K3 lorsqu’il apparaît dans la liste. La capture est un exemple d’interface ; l’accès dépend de votre édition et de votre forfait.

Posez une question dans la barre latérale ou comparez plusieurs réponses. Vous aurez une base avant de revenir à un test Partial Mode propre au fournisseur.

FAQ DU PREFILL DE RAISONNEMENT
L’API officielle documente Partial Mode. Ajoutez un message assistant à la fin de `messages` et `partial: true` pour poursuivre le préfixe. Vérifiez aussi le fournisseur utilisé.
Ne le supposez pas. Partial Mode documente le préfixe de sortie assistant. Le raisonnement est une autre frontière de réponse, et le fournisseur peut refuser ou réécrire une tentative d’injection.
Pour K3, utilisez `reasoning_effort` au niveau supérieur avec `low`, `high` ou `max`. L’objet `thinking` appartient aux exemples K2.x et n’est pas un réglage Kimi universel.
Désactivez le prefill et envoyez une requête propre. Vérifiez que `content` et `reasoning_content` arrivent séparément, puis que le message assistant complet est conservé au tour suivant.
Vérifiez l’alias du modèle, l’endpoint, le JSON et le support du fournisseur. Retirez les champs K2.x copiés et les samplers non pris en charge avant de modifier le prompt.
Un échange Reddit rapporte qu’un utilisateur n’a trouvé le support que chez Moonshot. C’est une observation individuelle, pas une règle générale. Consultez la documentation de votre route.
Utilisez les noms de champs officiels de K3, testez Partial Mode avec un préfixe court et conservez le tour assistant attendu par votre fournisseur. Pour une question sur une page ou un fichier, ouvrez Tabbit et choisissez Kimi-K3 dans le sélecteur actuel.
Disponible sur macOS et Windows. L’accès aux modèles et les quotas dépendent de l’édition et du forfait actuels.