Kimi K2.6 es el modelo generalista multimodal de Moonshot para código de larga duración, imágenes, vídeo, herramientas y agentes. La API nativa usa kimi-k2.6 y documenta modos con y sin razonamiento. No es Kimi K2.7 Code ni un nombre alternativo para Kimi K3.
El ancla de decisión es concreta, pero no debe exagerarse: Moonshot describe un agente K2.6 que funcionó más de 12 horas, realizó más de 4.000 llamadas a herramientas y elevó la inferencia local de Qwen3.5-0.8B de unos 15 a unos 193 tokens/s. Es una demostración del tipo de flujo que busca el modelo, no una promesa para tu harness. Consulta la página del modelo Kimi K2.6 (English) y comprueba después la ruta real de tu cuenta.
Decisión rápida
Empieza con K2.6 para tareas generales con contexto largo, visión, vídeo y herramientas.
En la API nativa usa
kimi-k2.6y registra modo, herramientas y tokens.Elige K2.7 Code cuando el trabajo principal sea implementar en repositorios.
Evalúa K3 por separado si necesitas su contexto de 1M y sus capacidades de flagship.
Los benchmarks y el caso de 4.000 llamadas son hipótesis que deben probarse.
Un agente largo necesita permisos mínimos, parada y rollback.
Kimi K2.6 en una tabla
| Elemento | Evidencia comprobada el 20/09/2026 | Límite |
|---|---|---|
| ID nativo | kimi-k2.6 | Los proveedores pueden usar otro alias. |
| Posición | Agente multimodal generalista | K2.7 Code es una ruta diferente. |
| Contexto | 256K en la guía; 262.144 en precios | Confirma el límite efectivo. |
| Entrada | Texto, imagen y vídeo en la guía nativa | Un proveedor puede omitir modalidades. |
| Modos | Con y sin razonamiento | Cambian uso de tokens y conducta. |
| API | $0.16/M cache hit, $0.95/M cache miss, $4/M salida | Impuestos, herramientas y reintentos aparte. |
| Pesos | modified-MIT, INT4, vLLM/SGLang/KTransformers | Hace falta revisar hardware y licencia. |
Qué es un navegador agéntico ayuda a separar sesión de navegador y API. Para la capa de producto, consulta AI browser comparison y las prácticas de Tabbit Browser.
Qué modelo es realmente
Moonshot presenta K2.6 como un modelo generalista con mejor escritura de código de larga duración, seguimiento de instrucciones, autocorrección y ejecución autónoma que K2.5. La ficha enumera un MoE de 1T total y 32B activos, 384 expertos, 8 seleccionados por token, atención MLA, un codificador visual MoonViT de 400M y contexto de 256K. La guía API incluye ejemplos de imagen y vídeo.
El caso de 4.000 llamadas importa porque combina un lenguaje poco común, profiling repetido y 14 iteraciones. También muestra el límite: los estados de herramientas, las pruebas y la parada importan más que una demostración de una sola respuesta. Guarda ID, modo, herramientas, tokens, reintentos y correcciones humanas.
Cambios desde K2.5
| Área | Información pública de K2.6 | Qué probar |
|---|---|---|
| Código largo | Rust, Go, Python, frontend, DevOps y optimización | ¿Conserva la arquitectura después de varias ediciones? |
| Multimodalidad | Texto, imagen y vídeo | ¿El proveedor expone las mismas entradas? |
| Agent Swarm | Hasta 300 subagentes y 4.000 pasos coordinados según el lanzamiento | ¿Puedes limitar coste, permisos y fan-out? |
| Ejecución persistente | Moonshot muestra agentes activos durante días | ¿Cómo se detiene un bucle o fallo de herramienta? |
| Diseño guiado por código | Flujos visuales y full-stack ligeros | ¿Pasa comprobaciones visuales y funcionales? |
La guía de Kimi K2.7 Code cubre la variante especializada: ID separado, razonamiento forzado y precios propios. La guía de precios de Kimi K3 cubre el contexto de 1M, cache writes y la separación entre suscripción y API. Para diseñar una fixture, combina la guía de automatización del navegador con los recursos de prompts de Kimi (English).
Cómo leer los benchmarks
Moonshot informa 58,6 en SWE-Bench Pro, 66,7 en Terminal-Bench 2.0, 54,0 en Humanity’s Last Exam con herramientas, 83,2 en BrowseComp, 92,5 en DeepSearchQA F1, 73,1 en OSWorld-Verified y 89,6 en LiveCodeBench v6. La ficha de Hugging Face añade 80,2 en SWE-Bench Verified, 76,7 en SWE-Bench Multilingual y 50,0 en Toolathlon.
Son tareas, herramientas y versiones diferentes. CodingFleet señala que el 58,6 frente a 58,4 de GLM-5.1 en SWE-Bench Pro es una diferencia de 0,2 puntos que no debería dirigir una estrategia. Artificial Analysis, en una instantánea independiente ahora marcada como deprecated, registra 35,8 tokens/s y describe respuestas lentas y verbosas; solo mantiene actualizado su trabajo con 10K tokens de entrada. Las condiciones detalladas están en las reseñas de Kimi (English).
La conclusión razonable es estrecha: K2.6 merece un piloto para código largo, multimodalidad y agentes, pero los números no prueban una victoria universal ni la tasa de éxito de tu entorno.
Acceso sin mezclar productos
API Moonshot: selecciona
kimi-k2.6y registra caché, razonamiento, herramientas y salida.Kimi.ai, aplicación y Kimi Code: son superficies distintas; cuota de consumo y facturación por tokens no son equivalentes.
Pesos abiertos: sigue la ficha de Hugging Face y revisa modified-MIT, memoria y cuantización.
Proveedores: ID, precio, modalidades, datos y fallback pueden cambiar. La página de DeepInfra muestra tarifas propias y dice que su API no expone entrada de imagen.
Tabbit Browser: la disponibilidad depende de la cuenta, no de la ficha pública.
Los ejemplos oficiales de imagen, vídeo y herramientas sirven para diseñar una prueba controlada. No copies prompts de sistema de terceros ni supongas que cada gateway conserva los mismos campos.
Comunidad y riesgos
En r/kimi, un usuario describe un acertijo sobre normas de tráfico chinas: K2.6 pensó 27 minutos, buscó más de diez veces y seguía buscando a los 32 minutos. Es una advertencia sobre bucles de herramientas y cuota, no una tasa general de fallos.
Otro hilo compara modelos chinos y asigna a Kimi una ventaja en frontend multimodal, mientras otros prefieren GLM para texto/backend. Varios usuarios recomiendan comparar dentro de un proyecto con control de versiones. No hay fixture ni harness común.
| Trabajo | Primera prueba reversible | Aceptación |
|---|---|---|
| Repositorio | Incidencia pequeña, tests fijos, rama temporal | Diff limitado, tests verdes y parada correcta. |
| Imagen a código | Mockup público y lista visual | Layout, interacciones y recursos se revisan por separado. |
| Vídeo | Clip público con eventos conocidos | Cada afirmación tiene timestamp. |
| Agent Swarm | Dos o tres sub tareas antes de ampliar | Fan-out, permisos y tokens acotados. |
| Investigación | Corpus fechado y formato de citas | Se comprueban recuperación, citas y parada. |
Los riesgos restantes son la paridad entre proveedores, el coste de bucles largos, la verbosidad, el rendimiento local, la mezcla de idiomas y el cumplimiento de datos. 256K de contexto no garantiza coherencia perfecta; los pesos abiertos no son un presupuesto de hardware.
Qué puede demostrar Tabbit
No se ejecutó una tarea autenticada de Kimi K2.6 en Tabbit ni se obtuvieron cuatro a ocho capturas cualificadas. Por tanto, no se afirma nada sobre selector, cuota, latencia, contexto efectivo, ruta de proveedor o calidad dentro de Tabbit. Si aparece en tu cuenta, usa una imagen pública o un repositorio descartable, exige citas y verifica cada cambio; no subas código confidencial al primer intento.
Veredicto
Kimi K2.6 es un candidato creíble para código de contexto largo, entradas multimodales y agentes con herramientas. El caso de 4.000 llamadas explica su ambición, pero sigue siendo una demostración del proveedor. Usa kimi-k2.6 cuando necesites controlar modo y uso; compara K2.7 Code para implementación especializada y K3 para su economía y contexto propios. Decide con una fixture reversible, no con un titular de leaderboard.
Fuentes
Preguntas frecuentes
¿Qué es Kimi K2.6?
Kimi K2.6 es el modelo multimodal generalista de Moonshot, expuesto como `kimi-k2.6`. La guía oficial indica entradas de texto, imagen y vídeo, modos con y sin razonamiento, herramientas y una ventana de 256K.
¿Cuál es su capacidad más importante?
El lanzamiento de Moonshot describe más de 4.000 llamadas a herramientas durante más de 12 horas en un despliegue local. Es un caso del proveedor sobre ejecución prolongada, no una garantía de latencia o tasa de éxito.
¿Cuánto cuesta Kimi K2.6?
La tabla de la API nativa, revisada el 20 de septiembre de 2026, muestra 0,16 dólares por millón de entrada con caché, 0,95 sin caché y 4 dólares de salida, con una fila de contexto de 262.144 tokens. Impuestos, proveedores y planes de consumo son distintos.
¿Es igual que K2.7 Code o K3?
No. K2.6 es la ruta generalista; K2.7 Code se especializa en código y fuerza el razonamiento; K3 es el nuevo buque insignia con otro perfil de contexto y precios. Sus resultados y tarifas no deben trasladarse a K2.6.
¿Cómo se obtiene?
Moonshot indica que K2.6 está disponible en Kimi.ai, la aplicación Kimi, la API y Kimi Code. Hugging Face ofrece pesos con licencia modified-MIT y rutas de despliegue; los proveedores pueden mostrar capacidades y límites distintos.
¿Está Kimi K2.6 en Tabbit?
Este artículo no ejecutó una tarea autenticada de Kimi K2.6 en Tabbit. Consulta el selector y las condiciones de la cuenta, y prueba una tarea reversible antes de asumir disponibilidad, cuota o latencia.