Il réfléchit sans fin
Vérifiez si thinking est actif, si le budget de raisonnement suffit et si le fournisseur conserve les blocs thinking. Un reasoning effort plus bas peut accélérer un tour mais multiplier les reprises dans une longue tâche.
QWEN 3.8 + SILLYTAVERN
Si la réponse boucle, réfléchit trop longtemps, oublie un fait du personnage ou s’arrête, le sampler n’est qu’une cause possible. Vérifiez d’abord la connexion et le modèle de chat, puis modifiez une variable et refaites le même test court.
Ces valeurs sont des points de départ documentés, pas un preset universel. Le fournisseur, le backend, la quantification, la fiche et le budget de contexte changent aussi Qwen3.8-27B.

COMMENCEZ PAR LE PROBLÈME
Une même mauvaise réponse peut venir d’un endpoint incorrect, d’un modèle incompatible, d’un contexte trop court ou de samplers trop restrictifs. Notez les changements avant de copier un preset.
Vérifiez si thinking est actif, si le budget de raisonnement suffit et si le fournisseur conserve les blocs thinking. Un reasoning effort plus bas peut accélérer un tour mais multiplier les reprises dans une longue tâche.
Examinez la limite de contexte et l’allocation de réponse. SillyTavern envoie les données du personnage, les prompts système et l’historique dans le contexte. Les anciens messages peuvent être hors plage.
Vérifiez ensemble repetition penalty, DRY, top-p, top-k et min-p. Qwen documente des valeurs neutres pour plusieurs paramètres. Changez un seul contrôle.
Vérifiez l’ID du modèle, le modèle de chat, le traitement des balises de raisonnement et le post-traitement. Un sampler ne répare pas un format destiné à une autre famille.
ORDRE DE DIAGNOSTIC
Utilisez un court tour de personnage reproductible. Gardez la fiche, le prompt, la seed si disponible et la longueur de sortie identiques.
Confirmez que le fournisseur sert bien Qwen3.8-27B, copiez son ID exact et envoyez un Test Message. Pour un endpoint OpenAI-compatible, vérifiez aussi la base URL et /v1/models.
Utilisez le modèle prévu pour Qwen3.8. La carte officielle active thinking par défaut. Pour une réponse directe, désactivez-le avec le champ documenté par votre backend. Décidez aussi si le thinking historique doit rester.
Gardez assez de contexte pour la fiche et les tours récents, puis réservez de la place à la réponse. Une grande valeur ne garantit pas que le backend ou la quantification offre la même capacité.
Commencez par la ligne officielle ci-dessous. Changez un réglage, régénérez le même tour plusieurs fois et notez le résultat. Passez ensuite à la variable suivante.
Si un fournisseur ignore un champ, la valeur affichée ne prouve pas que le modèle l’a reçue. Consultez la requête ou les métadonnées quand c’est possible.
TABLEAU DE RÉFÉRENCE
Qwen sépare Thinking Mode et Instruct ou non-thinking. SillyTavern documente aussi des valeurs neutres pour désactiver des samplers. Choisissez la ligne du mode testé.
| Paramètre | Thinking mode | Instruct / non-thinking | À surveiller |
|---|---|---|---|
| temperature | 1.0 | 0.7 | Plus bas, plus prévisible; plus haut, plus varié. |
| top_p | 0.95 | 0.80 | 1 désactive le filtrage nucleus. |
| top_k | 20 | 20 | 0 ou -1 le désactive selon le backend. |
| min_p | 0.0 | 0.0 | Une valeur haute peut aggraver la répétition. |
| presence_penalty | 0.0 | 1.5 | Qwen indique 0 à 2 pour réduire les boucles. |
| repetition_penalty | 1.0 | 1.0 | 1 désactive l’effet. |
| reasoning_effort | xhigh | Sans objet | Qwen documente xhigh, medium et low. |
| preserve_thinking | true | true | Désactivez-le pour garder seulement le raisonnement récent. |
Ce sont les points de départ de la carte Qwen. Le support des samplers varie selon le framework et le fournisseur. Ils ne garantissent pas un meilleur RP pour chaque fiche.
CAS QUI RESSEMBLENT À UN PROBLÈME DE SAMPLER
Traitez-les comme des expériences séparées. Un preset communautaire peut masquer la couche qui a réellement changé.
SillyTavern définit context tokens comme le budget du prompt après allocation de la réponse. Une réponse longue prend plus de temps et laisse moins de place à la fiche et à l’historique. Qwen3.8-27B prend en charge 262 144 tokens nativement, mais le backend peut imposer moins.
La carte officielle décrit la compréhension des images et des vidéos. Si le connecteur ne transmet pas le média au format attendu, c’est un problème d’intégration, pas de temperature.
BF16, FP8 et les versions basse précision échangent mémoire et fidélité numérique différemment. Comparez le même prompt, contexte et sampler sur le même backend avant d’accuser le preset.
repetition_penalty 1 est neutre. Un range ou un slope élevé peut pénaliser les mots courants. DRY vise les séquences répétées et multiplier 0 le désactive. Ajoutez une seule barrière si la boucle est reproductible.
AUTRE CHEMIN DE CONTEXTE
SillyTavern reste adapté aux fiches et aux lorebooks. Tabbit convient quand le travail commence par une page, un PDF, une capture ou une recherche. Ouvrez la source, choisissez un modèle et gardez le contexte visible.
Utilisez le navigateur de bureau pour macOS ou Windows et gardez un wiki, un guide ou un document dans la vue principale.

Ouvrez le sélecteur de modèles Tabbit dans le prompt du nouvel onglet ou le chat latéral. La liste évolue avec le produit; ne supposez pas que tous les poids locaux sont disponibles.

Saisissez @ pour référencer un onglet, une capture ou un fichier. Demandez un plan de scène, une réécriture de fiche ou une comparaison sans cacher la source.

Saisissez @ pour référencer un onglet, une capture ou un fichier. Demandez un plan de scène, une réécriture de fiche ou une comparaison sans cacher la source.

FAQ
Pour Thinking Mode, la carte Qwen indique temperature 1.0, top_p 0.95, top_k 20, min_p 0.0, presence_penalty 0.0 et repetition_penalty 1.0. Pour Instruct ou non-thinking, elle indique 0.7, 0.80, 20, 0.0, 1.5 et 1.0.
Utilisez-le comme point de comparaison, pas comme garantie. Les discussions mélangent des versions et des backends. Notez ses champs puis testez la ligne officielle un changement à la fois.
La carte officielle active thinking par défaut. Vérifiez le modèle de chat du connecteur, les balises de raisonnement et le support du fournisseur avant de toucher aux samplers.
Réservez de la place pour la fiche, le prompt système et les tours récents, puis pour la réponse. La limite native annoncée est 262 144 tokens, mais votre stack peut en fournir moins.
Commencez par repetition_penalty 1 et DRY multiplier 0. Ce sont des valeurs neutres ou désactivées. Ajoutez un seul contrôle si le même test boucle encore.
Cette page ne le prétend pas. Tabbit fournit un sélecteur de modèles et des outils de contexte du navigateur. Vérifiez la liste actuelle et gardez SillyTavern pour les poids locaux.
Commencez par la ligne officielle, changez une variable et gardez la source visible. Si le travail part d’une page ou d’un document, ouvrez-le dans Tabbit et utilisez son contexte navigateur.
Disponible sur macOS et Windows. La disponibilité des modèles peut évoluer.