TL;DR: Moonshot AI lanzó Kimi K3 el 16 de julio de 2026: un modelo de pesos abiertos revolucionario de 2,8 billones de parámetros (el primero en la clase 3T) con multimodalidad nativa, contexto de 1 millón de tokens y un rendimiento de frontera que rivaliza o supera a modelos propietarios de primer nivel como Claude Fable 5 y GPT-5.6 Sol en programación, tareas agenticas, desarrollo frontend y trabajo de conocimiento.
Puntos clave
- Escala e innovación: 2,8T parámetros, MoE con 16/896 expertos activos, Kimi Delta Attention (KDA), Attention Residuals – ~2,5× de eficiencia de escalado sobre K2, Kimi K3 - Kimi API Platform
- Rendimiento: Artificial Analysis Intelligence Index ~57 (top 4, por delante de Claude Opus 4.8), líder en Frontend Code Arena, fuerte en Terminal-Bench (88,3%), BrowseComp (91,2%), GPQA-Diamond (93,5%). Por detrás de Fable 5/Sol en general pero supera a la mayoría; #1 en Arena.ai Frontend Code Arena (1.679 Elo, superando a Fable 5), publicación de Arena en X y cobertura de Tom's Hardware.
- Capacidades: Visión/video nativos, 1M de contexto para repositorios/bases de código masivos, programación agentica, razonamiento 3D, edición de video, paneles de investigación.
- Acceso: Inmediato vía kimi.com, API (modelo kimi-k3, guía de acceso); pesos abiertos próximamente. Moonshot pausó temporalmente nuevas suscripciones a Kimi K3 tras un pico de demanda. Integración sencilla mediante CometAPI.
- Valor: Menor costo por tarea (~$0,94 en algunas evaluaciones), menos rechazos, ideal para flujos de trabajo de programación/Visión.
El Blog técnico de Kimi K3 describe Kimi K3 como "Open Frontier Intelligence, Kimi K3 marca un momento crucial en la democratización de la IA. A medida que laboratorios chinos como Moonshot empujan los límites pese a las restricciones de cómputo, este modelo abierto desafía la dominancia de los frontiers cerrados de EE. UU. y empodera a desarrolladores de todo el mundo.
¿Qué es Kimi K3? Un modelo abierto de clase 3T de Moonshot AI
Moonshot AI, una startup con sede en Beijing, lanzó Kimi K3 el 16 de julio de 2026 como su modelo insignia. Se posiciona explícitamente como el primer modelo abierto en la clase de aproximadamente 3 billones de parámetros, con 2,8 billones de parámetros totales en una arquitectura dispersa Mixture-of-Experts (MoE). Solo 16 de 896 expertos se activan por token, equilibrando escala masiva con eficiencia.
Esto se construye sobre la serie Kimi K2 (K2.5, K2.6, etc.), que ya ganó tracción en programación y multimodalidad. K3 introduce innovaciones arquitectónicas: Kimi Delta Attention (KDA) y Attention Residuals (AttnRes), además de Stable LatentMoE y entrenamiento consciente de cuantización (pesos MXFP4, activaciones MXFP8 desde la etapa SFT). Esto produce ~2,5× mejor eficiencia de escalado y hasta 6,3× mayor velocidad de decodificación en comparación con sus predecesores.
Especificaciones clave (Kimi K3 Technical Specifications):
- Parámetros: 2,8T totales (MoE disperso).
- Ventana de contexto: 1.048.576 tokens (~1M).
- Modalidades: Comprensión nativa de texto + imagen + video; salida de texto.
- Salida máxima: Predeterminado 131k tokens, hasta el límite de contexto.
- Razonamiento: Esfuerzo máximo por defecto en el lanzamiento; modos inferior/superior próximamente.
- Pesos abiertos: Prometidos para el 27 de julio de 2026 (licencia tipo MIT modificada, según el precedente de K2).
K3 apunta a tareas de largo alcance: no solo respuestas rápidas, sino completar flujos complejos de ingeniería, investigación o agentes con retroalimentación visual ("Visión en el ciclo"). Las demos incluyen construcción autónoma de un compilador GPU (rivalizando con Triton), diseño de chips en proceso de 45 nm y rápida investigación en astrofísica.
La demanda ya ha tensionado la capacidad
La recepción temprana del modelo ha sido lo suficientemente fuerte como para crear presión de capacidad. Moonshot publicó en X que la demanda en las 48 horas previas había llevado cerca de sus límites actuales de GPU y que las nuevas suscripciones se pausarían temporalmente mientras la empresa agregaba capacidad. Business Insider informó la misma pausa de capacidad y señaló que los suscriptores existentes no se vieron afectados.
Esto importa para la planificación de producción. Un modelo puede ser excelente y aun así enfrentar restricciones de disponibilidad si la demanda supera el cómputo. Los equipos que evalúen Kimi K3 deberían evitar la dependencia de un solo proveedor, monitorear la latencia y las tasas de error, y usar enrutamiento de respaldo mediante un proveedor unificado como CometAPI cuando sea posible.
Benchmarks de programación: dónde Kimi K3 se ve más fuerte
El perfil de programación de Kimi K3 es la razón central por la que los desarrolladores están prestando atención. Está casi empatado con GPT-5.6 Sol en Terminal-Bench 2.1, supera ligeramente a GPT-5.6 Sol y Claude Fable 5 en Program Bench, y lidera a GPT-5.6 Sol por un margen significativo en FrontierSWE. También supera a los modelos comparados en SWE Marathon en la tabla de OpenLM.
El resultado de Arena en frontend añade otra señal práctica. Arena reportó a Kimi K3 con 1.679 puntos en Frontend Code Arena, por delante de Claude Fable 5. Ese benchmark importa porque el trabajo frontend a menudo se juzga por preferencia humana, no solo por pruebas unitarias. Un asistente de programación que puede producir una UI limpia y visualmente coherente a partir de un prompt es valioso para equipos de producto, agencias, creadores de SaaS y herramientas internas.
Rankings generales
- Artificial Analysis AI Leaderboard: Debutó en el #3. Las puntuaciones del Intelligence Index lo sitúan competitivamente (p. ej., ~57,1 en algunas evaluaciones).
- Evaluación privada de trabajo de conocimiento de largo alcance: Elo 1547 (+732 respecto a K2.6), solo por detrás de Fable 5.
Benchmarks de programación y agentes (autoinformados e independientes)
K3 brilla aquí, aprovechando su escala y arquitectura para un rendimiento agentico sostenido.
- Frontend Code Arena (Arena.ai): #1 con 1.679 puntos, superando a Fable 5 y GPT-5.6 Sol. Destaca en preferencia ciega de desarrolladores para desarrollo web.
- DeepSWE: 67,3–67,5 (sólido, con el arnés KimiCode).
- Program Bench: #1 con 77,8.
- SWE Marathon: #1 con 42,0 (algunos arneses).
- Terminal-Bench 2.1: Competitivo, cerca de GPT-5.6 Sol.
Visión y multimodal
El entrenamiento nativo (no añadido a posteriori) produce resultados sólidos:
- MMMU-Pro: 81,6%
- MathVision: Competitivo/altos 90 en algunos reportes.
- OmniDocBench: 91,1% (líder).
Admite capturas de pantalla, diagramas y video para tareas de lazo cerrado como refinamiento de UI o desarrollo de juegos.
Tabla de comparación: Kimi K3 vs. modelos líderes (aproximado/compilado de reportes; Max Effort donde se indica)
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Notas/Fuente |
|---|---|---|---|---|
| Frontend Code Arena | 1.679 (#1) | Inferior | Inferior | Arena.ai |
| DeepSWE | 67,3–67,5 | Competitivo | - | Moonshot/KimiCode |
| Program Bench | 77,8 (#1) | - | Cercano | Vals.ai |
| Intelligence Index (AA) | ~57,1 | ~59,9 | ~58,9 | Artificial Analysis |
| Long-Horizon Elo | 1547 | Superior | - | Moonshot interno |
| Costo por tarea (evals) | ~$0,94 | Más alto | Más alto | Independiente |
Datos obtenidos de el blog técnico de Moonshot, rankings independientes y análisis. Los resultados pueden variar según arnés/esfuerzo; verifique siempre lo último.
K3 muestra menos rechazos en temas sensibles y fuerte consistencia en flujos agenticos. Pruebas independientes (p. ej., evaluaciones en YouTube, Vals AI) lo confirman como uno de los modelos abiertos más fuertes para programación en el mundo real.
¿Qué puede hacer Kimi K3? Capacidades en programación, visión y más
Programación e ingeniería agentica
K3 sostiene sesiones largas con mínima supervisión: navega repositorios masivos, usa herramientas, depura mediante capturas de pantalla ("visión en el ciclo").
Ejemplos:
- Optimización de kernel y desarrollo de compiladores: Construyó MiniTriton (compilador tipo Triton) desde cero, rivalizando con pilas optimizadas. Optimizó kernels de GPU de forma competitiva con Fable 5.
- Desarrollo de juegos: Convierte conceptos/imágenes/videos en experiencias jugables 3D/multijugador con refinamiento iterativo.
- Diseño de chips: Ejecución autónoma de 48 horas diseñando un chip de nano-escala.
- Frontend: Lidera rankings para apps web y tareas full‑stack.
Visión y multimodal
La comprensión nativa de imágenes/video habilita:
- Edición de video: Editó su propio teaser a partir de 56 clips (selección, cortes, sincronización, revisiones): horas de trabajo en minutos.
- Razonamiento 3D, motion graphics, paneles interactivos.
- "Visión en el ciclo" para iteración de código mediante capturas de pantalla.
La documentación de la API de Kimi muestra entrada de imagen vía URLs de datos base64 y entrada de video mediante archivos subidos referenciados por ms://. También advierten que las URLs públicas de imagen no están soportadas en la entrada de visión, por lo que los desarrolladores deben enviar base64 o referencias a archivos subidos y hacer que el contenido del mensaje sea un arreglo de objetos. Ese es un detalle de implementación importante: no serializar un mensaje mixto de imagen y texto en una sola cadena plana.
Trabajo de conocimiento e investigación
Para las empresas, aquí es donde Kimi K3 puede ser más valioso que un chatbot normal. El modelo está diseñado para trabajo "agentico" donde puede mantener un plan, llamar herramientas, procesar resultados intermedios y producir un artefacto final. Ejemplos incluyen informes de investigación de mercado, asistentes de limpieza de datos, resúmenes de cumplimiento, mantenimiento de bases de conocimiento de soporte al cliente y copilotos de ingeniería internos.
- Genera informes de calidad consultora, visualizaciones interactivas, paneles (p. ej., análisis de 42 años de la industria ASIC a partir de miles de fuentes).
- Flujos científicos: Reprodujo relaciones de astrofísica, analizó ondas gravitacionales con subagentes.
- Widgets/Paneles en Kimi Work para vistas persistentes y basadas en datos.
K3 conecta literatura con código ejecutable, produciendo resultados de calidad de publicación de manera eficiente.
Kimi K3 frente a otros modelos de frontera: comparación práctica
| Modelo | Mejor encaje | Fortalezas | Precauciones | Recomendación de CometAPI |
|---|---|---|---|---|
| Kimi K3 | Programación de largo contexto, trabajo de conocimiento, agentes, razonamiento visual | Escala MoE de 2,8T, 1M de contexto, fuertes benchmarks de programación y agentes, hoja de ruta de pesos abiertos | Presión de capacidad en semana de lanzamiento, sensibilidad al historial de pensamiento, el soporte de visión puede variar según la ruta | Probar como modelo insignia para programación y largo contexto |
| GPT-5.6 Sol | Razonamiento difícil, programación, investigación, tareas de producción amplias | Perfil de benchmark muy fuerte y herramientas maduras | Precio más alto en muchas rutas | Usar como comparación y modelo de escalado |
| Claude Fable 5 | Redacción, programación, flujos agenticos, tareas de preferencia humana | UX fuerte y rendimiento de frontera amplio | Costo más alto y posibles retrocesos de políticas en algunas tareas | Comparar para agentes de cara al usuario y apps con mucha escritura |
| Claude Opus 4.8 | Razonamiento profundo y trabajo profesional confiable | Comportamiento de asistente estable de gama alta | Más antiguo que los lanzamientos insignia más nuevos | Mantener como respaldo o línea base de benchmark |
| GLM-5.2 | Evaluación de modelos abiertos sensibles a costo | Alternativa de modelo abierto competitiva | Más débil en varias comparaciones con K3 | Incluir en pruebas de enrutamiento costo/rendimiento |
Cómo acceder a Kimi K3: guía paso a paso
Cómo acceder a Kimi K3
1. Accede a Kimi K3 mediante los productos Kimi
La ruta más fácil para no desarrolladores es a través de los productos de consumo y productividad de Kimi: Kimi web, app, Kimi Work y Kimi Code. Esta es la forma más rápida de probar la redacción, programación, investigación y comportamiento orientado a UI del modelo sin construir primero una integración. La pausa temporal de suscripciones reportada el 20 de julio significa que el acceso puede variar, así que verifica la página de producto de Kimi antes de planificar un despliegue de equipo.
2. Accede a Kimi K3 mediante la Kimi API Platform
Los desarrolladores pueden invocar Kimi K3 mediante la Kimi API Platform usando un cliente estilo OpenAI. La documentación de Moonshot lista:
- URL base:
https://api.moonshot.ai/v1 - ID de modelo:
kimi-k3 - Variable de entorno en ejemplos:
MOONSHOT_API_KEY - Requisito del SDK de Python: OpenAI SDK 1.0 o posterior
Ejemplo básico en Python:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "Introduce Kimi K3 in one sentence."}
],
)
print(completion.choices[0].message.content)
Kimi K3 siempre tiene el modo de pensamiento habilitado y admite valores de reasoning_effort de low, high y max, con max como valor por defecto. La API soporta streaming, salida estructurada con esquema JSON estricto, Partial Mode, llamadas a herramientas, carga dinámica de herramientas, caché de contexto automática e integraciones oficiales de herramientas mediante Formula. La documentación también lista varios límites importantes: max_completion_tokens por defecto es 131.072 y puede establecerse hasta 1.048.576; temperature y top‑p están fijos; los desarrolladores deben devolver el mensaje completo del asistente en flujos multivuelta y de llamadas a herramientas; y la búsqueda web se está actualizando, por lo que no se recomienda para uso en producción en el corto plazo.
3. Accede a Kimi K3 mediante CometAPI
Para muchos equipos, CometAPI es la ruta más práctica porque proporciona una capa de API unificada entre muchos proveedores de modelos. La página de Kimi K3 en CometAPI lista el modelo como activo con:
- ID de modelo:
kimi-k3 - Proveedor: Moonshot AI
- Ventana de contexto: hasta 1.000.000 tokens
- Precio en CometAPI: $2,4 entrada y $12 salida por 1M tokens
- Precio oficial listado: $3 entrada y $15 salida por 1M tokens
- Endpoint:
/v1/chat/completions - URL base:
https://api.cometapi.com/v1
Ejemplo en Python con CometAPI:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "You are a careful software engineering assistant.",
},
{
"role": "user",
"content": "Review this migration plan and identify the riskiest steps.",
},
],
max_completion_tokens=1024,
)
print(completion.choices[0].message.content)
Si tu aplicación ya usa el SDK de OpenAI, el quickstart de CometAPI recomienda cambiar solo dos ajustes: establecer base_url en https://api.cometapi.com/v1 y usar COMETAPI_KEY en lugar de tu clave de proveedor anterior. Después de eso, pasa el ID de modelo de CometAPI en el campo model.
4. Accede a los pesos abiertos de Kimi K3 tras su publicación
Moonshot indica que los pesos completos de Kimi K3 se publicarán para el 27 de julio de 2026. Una vez ocurra, investigadores, equipos de infraestructura y usuarios empresariales avanzados podrán evaluar el autoalojamiento, la optimización o despliegues privados. Para la mayoría de las empresas, la cuestión clave será la economía: el modelo es abierto, pero servir un sistema MoE de 2,8T requiere infraestructura GPU seria, ingeniería de inferencia y monitoreo operativo.
Veredicto final
Kimi K3 es uno de los lanzamientos de modelos más importantes de 2026 hasta ahora. Combina una escala enorme, una estrategia seria de pesos abiertos, una ventana de contexto de 1M de tokens, comprensión visual nativa y resultados de benchmark que lo colocan cerca de la cima de los sistemas actuales de IA para programación y agentes. No elimina la necesidad de GPT, Claude, Gemini, DeepSeek, Qwen u otros modelos, pero ofrece a los desarrolladores una nueva opción creíble para los flujos de trabajo más difíciles de largo contexto.
Empieza hoy en kimi.com o vía CometAPI para una integración sin esfuerzo. Experimenta con sus fortalezas en programación y visión: los resultados hablan por sí solos.
