01 / MODELO
Thinking siempre está activo
Moonshot documenta K3 como un modelo que siempre razona. La API admite reasoning_effort low, high o max. Una respuesta larga no demuestra que el preset esté roto.
CONFIGURA ANTES DEL PRESET
Una conexión estable empieza por cuatro datos: el proveedor activo, el alias del modelo, la ruta Chat Completions y el tratamiento del historial de razonamiento. Compruébalos antes de ajustar una tarjeta.
Alias oficial: kimi-k3 · Base URL de ejemplo: https://api.moonshot.ai/v1 · K3 siempre tiene thinking activo.

QUÉ SIGNIFICA CADA SEÑAL
Kimi K3 puede escribir bien y, a la vez, tener un endpoint incorrecto o un mensaje de razonamiento incompleto. Estas tres comprobaciones mantienen el diagnóstico enfocado.
01 / MODELO
Moonshot documenta K3 como un modelo que siempre razona. La API admite reasoning_effort low, high o max. Una respuesta larga no demuestra que el preset esté roto.
02 / PROVEEDOR
El ejemplo oficial usa https://api.moonshot.ai/v1 y kimi-k3. Los proxies pueden exponer otros alias, cuotas, precios o parámetros.
03 / REPORTES
Conversaciones públicas en X y Reddit mencionan lentitud, 429, exceso de razonamiento y bloques reasoning. Son reportes personales, no un SLA.
CINCO COMPROBACIONES
Empieza con un chat de prueba pequeño. Cambia una opción, envía un turno y anota el resultado.
Los hechos de K3 vienen de la guía oficial de Kimi. Los paneles de proveedores y las extensiones pueden cambiar por separado.
Elige Moonshot o un proveedor que liste Kimi K3 ahora. Comprueba facturación, límites, slug y compatibilidad con OpenAI.
✓ Puedes señalar la entrada Kimi K3 o kimi-k3 del proveedor.
El Quickstart oficial envía la solicitud a /chat/completions. En SillyTavern usa Chat Completions, no una plantilla de text completion.
✓ La prueba llega a /v1/chat/completions sin error de plantilla.
Usa un personaje, una escena y poco contexto. Escribe voz y límites una sola vez; los parches contradictorios ocultan el problema real.
✓ La primera respuesta mantiene el rol y el formato antes del preset.
El streaming puede separar reasoning_content y content. Comprueba que la interfaz los gestione y envíe el mensaje assistant completo en el siguiente turno.
✓ La siguiente solicitud no pierde el razonamiento ni la respuesta final.
Las extensiones de prefill y preserved-thinking pueden ayudar en un caso concreto, pero son herramientas comunitarias, no requisitos de Kimi.
✓ Puedes identificar el único cambio que mejoró o empeoró la respuesta.
EMPIEZA POR EL SÍNTOMA
Haz la comprobación más pequeña que corresponda al síntoma. No cambies presets al azar mientras exista un error de autenticación o endpoint.
| Lo que ves | Capa probable | Siguiente comprobación |
|---|---|---|
| 401 o clave no válida | Clave o cuenta | Crea una clave nueva, confirma que la cuenta esté habilitada y elimina espacios. |
| 404 o modelo no encontrado | Base URL o alias | Compara la lista actual con kimi-k3. Conserva /v1 y deja que el conector añada /chat/completions. |
| 429, timeout o “ocupado” | Cuota o límite | Revisa concurrencia, RPM/TPM, nivel de cuenta y estado del proveedor. Confirma que no haya reintentos en bucle. |
| Respuesta vacía o reasoning roto | Mapeo de respuesta | Distingue reasoning_content de content, activa el ajuste reasoning y conserva el mensaje assistant completo. |
| Pensamiento largo, deriva o repetición | Prompt e historial | Baja reasoning_effort si el proveedor lo permite, acorta instrucciones y prueba un chat limpio antes de tocar prefill. |
UNA RUTA MÁS CORTA
Si solo quieres leer una ficha, wiki o brief mientras conversas, Tabbit evita el primer bucle de configuración del endpoint. Comprueba el selector actual para ver acceso y disponibilidad.
Abre la ficha, la página de lore o el documento de referencia en una pestaña. Tabbit puede usar páginas, capturas y archivos como contexto.
✓ La fuente sigue visible al hacer la pregunta.

Selecciona Kimi-K3 en el selector de Chat o nueva pestaña. La lista puede cambiar; usa la interfaz activa como referencia.
✓ El selector muestra el modelo que quieres usar.

Usa la barra lateral o compara respuestas en una vista. Tabbit no reemplaza las cards, lorebooks, extensiones ni grupos de ST.
✓ La pregunta conserva el contexto de la página o el archivo.

PREGUNTAS DE CONFIGURACIÓN
El Quickstart oficial usa kimi-k3 y la base URL de ejemplo es https://api.moonshot.ai/v1. Comprueba la lista del proveedor porque los alias pueden cambiar.
Usa Chat Completions compatible con OpenAI para la ruta Moonshot. Text completion tiene otro formato de solicitud.
En la API Moonshot thinking está siempre activo. Si el proveedor lo permite, baja reasoning_effort, acorta las instrucciones y confirma que se conserva el mensaje assistant completo.
No para empezar. Prueba primero la conexión limpia y añade una guía de la comunidad solo cuando sepas qué comportamiento quieres cambiar.
Revisa nivel de cuenta, concurrencia, RPM/TPM, estado del proveedor y posibles reintentos repetidos de SillyTavern.
No. Tabbit sirve para usar Kimi K3 junto a una página o archivo; las cards, lorebooks, extensiones y grupos siguen siendo funciones de SillyTavern.
Conserva SillyTavern para su flujo de personajes. Para empezar con menos configuración, abre Tabbit, elige Kimi-K3 y lleva contigo el contexto de la página.
Disponible para macOS y Windows. El acceso y las cuotas pueden variar según edición y plan.