GPT Image 2.5 Sunburst and Flare are now live on CometAPI →
new/Investigación de CometAPI

Kimi K4 llegará pronto: lo que sabemos y lo que podemos esperar

Según se informa, Kimi K4 está en desarrollo. Explore sus especificaciones esperadas, arquitectura, objetivos de benchmarks, funciones y su probable posición frente a los modelos de frontera.

CometAPI
Mia MarenEquipo de investigación de modelos de IA y API
Actualizado Sep 3, 2026 18 min de lectura
Kimi K4 llegará pronto: lo que sabemos y lo que podemos esperar
Usa este patrón

Haz la primera llamada a la API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Primero, la respuesta

Kimi K4 no se ha lanzado oficialmente y Moonshot AI no ha publicado sus especificaciones finales, resultados de benchmarks, precios de API ni fecha de lanzamiento. La señal pública más sólida hasta ahora proviene de reportes de que Moonshot está buscando capacidad adicional de Nvidia Blackwell para un sucesor que se espera sea significativamente más grande que Kimi K3. Eso es una evidencia significativa de que se está preparando un modelo de próxima generación, pero no constituye un anuncio oficial de producto.

De lo que se puede hablar responsablemente es de la dirección que podría tomar K4. El actual Kimi K3 de 2,8 billones de parámetros ya combina escalado disperso Mixture-of-Experts, visión nativa, una ventana de contexto de un millón de tokens y capacidades de agentes de horizonte largo. Por tanto, es más probable que Kimi K4 sea evaluado por su ejecución basada en agentes confiable, profundidad en código, razonamiento multimodal y eficiencia de escalado que por el recuento de parámetros por sí solo.

La conclusión central es simple: Kimi K4 parece estar en desarrollo, pero casi todas las especificaciones numéricas que circulan fuera de la empresa siguen sin confirmarse. Cualquier adelanto creíble debe separar los hechos verificados de K3, los reportes sobre K4 y la inferencia prospectiva.

¿Qué es Kimi K4?4

Kimi K4 es el nombre público que se usa para el sucesor esperado de Moonshot AI de Kimi K3. Actualmente debe tratarse como un modelo en desarrollo, no como un producto de API anunciado. Moonshot AI no ha publicado una tarjeta del modelo K4, informe técnico, identificador de API, página de precios, licencia ni tabla de benchmarks.

The Information informa que Moonshot AI está discutiendo planes para Kimi K4. Citando a dos personas con conocimiento del tema, el reporte describe a K4 como significativamente más grande que K3 y dice que Moonshot busca acceso a chips Nvidia Blackwell adicionales para preparar el modelo. Sin embargo, no confirma un conteo exacto de parámetros de cinco billones, seis billones u otro, ni establece si K4 se lanzará con pesos abiertos, se ofrecerá solo a través de productos hospedados o se dividirá en múltiples variantes.

Esta incertidumbre importa porque los lanzamientos de Kimi han combinado históricamente pesos del modelo, APIs hospedadas, productos para usuarios finales y sistemas de agentes especializados. Un futuro anuncio de K4 podría referirse a un modelo, a una familia de modelos o a un sistema más amplio construido alrededor de enrutamiento, herramientas, memoria y componentes multimodales.

¿Por qué Kimi K4 está atrayendo atención tan pronto?

Kimi K3 elevó el techo de escalado con pesos abiertos

Kimi K3 estableció una línea base inusualmente ambiciosa. Su resumen oficial del modelo lista 2,8 billones de parámetros totales, 104 mil millones de parámetros activados, 93 capas, 896 expertos enrutados, 16 expertos seleccionados por token, dos expertos compartidos y una longitud de contexto de 1.048.576 tokens. El modelo también incluye un codificador de visión MoonViT-V2 de 401 millones de parámetros.

Esa combinación hace que K3 sea importante por dos razones diferentes. Primero, muestra que los modelos con pesos abiertos pueden escalar a la misma clase amplia de capacidades que los sistemas propietarios líderes. Segundo, su diseño disperso demuestra que el conteo total de parámetros y el costo de inferencia no son lo mismo: solo un subconjunto de expertos se activa para cada token.

Los reportes apuntan a un sucesor aún más grande

Los reportes de la industria dicen que Moonshot AI está buscando más cómputo de clase Blackwell para K4 y describen el modelo planificado como significativamente más grande que K3. El reporte es la mejor evidencia pública de que K4 es más que especulación de la comunidad, pero deja sin resolver la arquitectura final, el calendario de entrenamiento, el tamaño del modelo y el plan de despliegue.

La cuestión del cómputo es relevante porque la escala crea dos cuellos de botella separados. El entrenamiento requiere suficientes aceleradores, red, almacenamiento y estabilidad de ingeniería para completar una corrida de frontera. La operación luego requiere una estrategia de inferencia separada que pueda ofrecer latencia y costo aceptables. Por lo tanto, un K4 más grande necesitaría mejoras arquitectónicas y de sistemas, no solo más hardware.

La arquitectura de K3 fue diseñada para escalar más

El blog técnico de Kimi K3 de Moonshot describe Kimi Delta Attention y Attention Residuals como la columna vertebral arquitectónica de un modelo diseñado para escalar más allá del régimen del billón de parámetros. Kimi Delta Attention proporciona una base de atención eficiente, mientras que Attention Residuals recupera selectivamente representaciones a lo largo de la profundidad del modelo en lugar de acumularlas de manera uniforme.

K3 también usa Stable LatentMoE, activando efectivamente 16 de 896 expertos enrutados. Quantile Balancing deriva la asignación de expertos a partir de cuantiles de puntuación del enrutador, y Per-Head Muon optimiza cabezas de atención de forma independiente. Estas decisiones apuntan a los problemas que K4 debe resolver: enrutamiento estable, utilización equilibrada de expertos, atención de largo contexto eficiente y entrenamiento predecible a escala extrema.

¿Por qué importaría Kimi K4 si Kimi K3 ya es un modelo de 2,8T?

Kimi K3 ya opera a una escala inusualmente grande, por lo que K4 no puede evaluarse simplemente preguntando si tiene más parámetros. La pregunta más significativa es si el cómputo de entrenamiento adicional produce mejor finalización de tareas, mayor confiabilidad de horizonte largo y menor costo efectivo de inferencia.

Una evaluación útil de K4 debería centrarse en cuatro métricas:

  • Tasa de finalización de tareas
  • Confiabilidad de agentes de horizonte largo
  • Tasa de éxito en codificación
  • Costo por tarea completada con éxito

Esta última métrica es especialmente importante para los desarrolladores. Un modelo que cueste menos por corrección exitosa de un repositorio puede ser más valioso que un modelo con una puntuación de benchmark más alta pero con muchas más trayectorias fallidas.

Especificaciones esperadas de Kimi K4

La tabla a continuación distingue la línea base técnica confirmada de K3 de los reportes e inferencias sobre K4. Esperado no significa anunciado. Los campos desconocidos deben permanecer desconocidos hasta que Moonshot AI publique una tarjeta del modelo o documentación de API.

Specification basisKimi K3 confirmedKimi K4 public reportingConfidence
Model statusReleasedIn developmentReported
ArchitectureSparse MoENot disclosed; likely a sparse MoE evolutionInference
Total parameters2.8TReportedly significantly larger than K3Reported; exact value unknown
Activated parameters104BNot disclosedUnknown
Expert configuration896 routed; 16 selected; 2 sharedNot disclosedUnknown
Context window1,048,576 tokensLikely at least 1M, but not confirmedExpected
AttentionKDA plus Gated MLAPossible next-generation KDAInference
Native visionMoonViT-V2Multimodal continuation likelyExpected
Open weightsAvailableNot confirmedUnknown
API model IDkimi-k3Not announcedUnknown
Release dateAvailableNot announcedUnknown

La restricción más importante es la fila de parámetros. Significativamente más grande no establece un tamaño exacto. Del mismo modo, la ventana de contexto de un millón de tokens de K3, el diseño multimodal y la publicación con pesos abiertos no pueden copiarse en la ficha de especificaciones de K4 como hechos confirmados. Son expectativas plausibles en dirección, no compromisos de producto publicados.

¿Qué funciones podría introducir Kimi K4?

  1. Escalado Sparse MoE más grande pero más eficiente

La expectativa obvia es un modelo Mixture-of-Experts más grande. La cuestión más importante es si K4 mejora la relación entre capacidad total, capacidad activada y costo de servicio. Incrementar el pool de expertos sin mejorar el enrutamiento podría crear especialistas infrautilizados, expertos sobrecargados, cuellos de botella de comunicación y entrenamiento inestable.

Un avance creíble de K4 combinaría capacidad adicional con mejor equilibrio de carga, expertos más especializados, menores ratios de activación o coordinación más sólida entre expertos. Ninguno de esos detalles ha sido divulgado, por lo que un artículo debería describirlos como objetivos de ingeniería en lugar de funciones filtradas.

Un Kimi Delta Attention más avanzado

Kimi Delta Attention es central en el diseño de largo contexto de K3. Una versión de próxima generación podría mejorar la recuperación en entradas de millones de tokens, reducir la memoria del estado de atención y preservar información importante durante corridas de agentes largas. La prueba práctica no sería solo el tamaño de la ventana de contexto, sino si el modelo puede encontrar, combinar y actuar sobre evidencia distante sin fragmentación agresiva o recuperación repetida.

Agentes de horizonte largo más confiables

Kimi K3 ya está posicionado para trabajo técnico y de conocimiento de larga duración. Sus demostraciones oficiales incluyen desarrollo de compiladores, optimización de kernels GPU, programación científica, investigación interactiva, desarrollo de juegos y flujos de diseño de chips. K4 necesitaría convertir estas demostraciones impresionantes en una ejecución cotidiana más consistente.

Las métricas que importan son menos llamadas a herramientas innecesarias, mayor retención de objetivos, mejor recuperación tras acciones fallidas, verificación más confiable y menor varianza entre corridas. Un modelo que completa un benchmark difícil una vez pero se comporta de forma impredecible en producción es menos útil que un modelo ligeramente más débil con ejecución confiable.

Codificación e ingeniería de software más sólidas

Es probable que K4 siga fuertemente enfocado en código, pero la frontera ha superado la generación de funciones aisladas. Los modelos competitivos de ingeniería de software deben mapear repositorios, entender dependencias, operar terminales, modificar múltiples archivos, ejecutar pruebas, diagnosticar fallos y revisar su enfoque.

K3 ya es fuerte en ProgramBench, SWE-Marathon, FrontierSWE y tareas de terminal. La oportunidad más clara de K4 es cerrar la brecha restante en reparación profunda de repositorios preservando la ventaja de K3 en trabajo sostenido de múltiples pasos.

Multimodalidad nativa más profunda

K3 combina texto y visión a nivel de modelo, y los ejemplos de producto de Moonshot extienden esa capacidad al montaje de video y desarrollo con visión en el bucle. K4 podría mejorar flujos de captura de pantalla a código, razonamiento sobre gráficos y documentos, comprensión temporal de video, pruebas de interfaz y agentes que inspeccionan resultados visuales antes de continuar.

La distinción clave es entre aceptar imágenes y usar la percepción dentro de un bucle cerrado. Un agente multimodal debe observar un resultado renderizado, identificar el desajuste, editar su trabajo y verificar la revisión. Esto es más exigente que responder una sola pregunta de imagen.

Mejor eficiencia de inferencia y despliegue

Un modelo más grande que K3 podría ser difícil de autoalojar incluso si se publican sus pesos. K4 se beneficiaría de entrenamiento consciente de la cuantización, paralelismo eficiente de expertos, decodificación especulativa, gestión optimizada del estado KV y variantes acompañantes más pequeñas. Para la mayoría de equipos, el acceso vía API hospedada puede seguir siendo más práctico que operar directamente un modelo disperso de escala de frontera.

¿Qué rendimiento en benchmarks necesitaría Kimi K4?

K4 no tiene resultados de benchmark publicados. El enfoque responsable es establecer el listón de rendimiento creado por K3 y los competidores de frontera actuales, luego identificar dónde un sucesor debería mejorar. La línea base ampliada a continuación cubre razonamiento, codificación, operación de terminal, investigación profunda, trabajo de conocimiento con agentes y tareas de hojas de cálculo. Todos los valores provienen de la tarjeta oficial de Kimi K3 enlazada en el encabezado de la tabla.

Official benchmark suiteKimi K3GPT-5.6 SolClaude Fable 5Claude Opus 4.8
GPQA Diamond93.594.192.691.0
DeepSWE67.573.070.059.0
ProgramBench77.877.676.871.9
Terminal-Bench 2.188.388.888.084.6
FrontierSWE81.271.386.666.7
SWE-Marathon42.039.035.040.0
Kimi Code Bench 2.072.964.876.971.7
BrowseComp91.290.488.084.3
DeepSearchQA (F1)95.0Not reported94.293.1
ResearchRubrics76.273.8Not reported73.5
GDPval-AA v2 (Elo)1686173617471593
SpreadsheetBench 234.832.434.731.6

Estos son resultados de comparación reportados por Moonshot en lugar de un único ranking independiente controlado. Algunos modelos se evaluaron a través de diferentes entornos de agentes, y las notas oficiales describen mecanismos de respaldo, cyberguards, sustituciones de hardware, configuraciones de razonamiento y procedimientos específicos por benchmark. GDPval-AA v2 es una calificación Elo y no debe compararse numéricamente con filas basadas en porcentaje. Diferencias pequeñas no deben interpretarse como superioridad universal.

Instantánea oficial de benchmarks de código

Kimi K4 llegará pronto: lo que sabemos y lo que podemos esperar

Comparativa oficial de codificación de Kimi K3. La imagen es un gráfico publicado por Moonshot; consulte la tarjeta del modelo y notas actuales para la última tabla numérica y la metodología de evaluación.

Resultados de benchmarks e interpretación

GPT-5.6 Sol supera a Kimi K3 en DeepSWE, lo que indica una ventaja en reparación de software a nivel de repositorio difícil. Claude Fable 5 lidera en FrontierSWE, mientras que K3 se mantiene cómodamente por delante de GPT-5.6 Sol y Claude Opus 4.8 en ese benchmark.

El perfil de K3 se vuelve más distintivo en el trabajo sostenido. Lidera ligeramente en ProgramBench y registra el resultado más fuerte en SWE-Marathon en la comparación seleccionada. También lidera en BrowseComp y esencialmente empata con Claude Fable 5 en SpreadsheetBench 2.

Para K4, el objetivo no debería ser un aumento porcentual fijo en cada gráfico. El objetivo más útil es mejorar la reparación profunda de bases de código y la confiabilidad en el uso de computadoras sin perder las fortalezas de K3 en codificación de horizonte largo, navegación y trabajo de conocimiento basado en agentes.

Kimi K4 llegará pronto: lo que sabemos y lo que podemos esperar

Comparativa oficial de agentes generales y visuales de Kimi K3. Fuente: página del modelo Kimi K3 de Moonshot AI.

Kimi K4 vs Kimi K3, GPT-5.6 Sol y Claude Fable 5

Una comparación previa al lanzamiento no puede asignar a K4 puntuaciones que no existen. Sin embargo, puede mostrar la posición competitiva que se esperaría que K4 ocupe si extiende la línea K3.

DimensionKimi K4 expected positionKimi K3 confirmedClosed references: GPT-5.6 Sol and Claude Fable 5
AvailabilityIn developmentAvailableAvailable
Model opennessUnknownOpen weightsProprietary
Confirmed contextUnknown1M tokensProvider-defined or 1M-class
Primary strengthExpected larger-scale frontier intelligenceLong-horizon coding and knowledge workFrontier reasoning, coding, and computer use
MultimodalityExpected; not confirmedNative visionMultimodal
Self-hostingUnknownPossible with substantial infrastructureNot available
Agent maturityExpected to improveStrongStrong
Deployment costUnknown and potentially highHigh for self-hosting; hosted API availableHosted API only
Main reason to watchScale plus possible opennessVerified open frontier baselineMaximum closed-model capability

Resultado de la comparación

Kimi K3 se diferencia por pesos abiertos, una ventana de contexto de un millón de tokens y un desempeño sólido en trabajos de horizonte largo. GPT-5.6 Sol sigue siendo más fuerte en algunas tareas difíciles de razonamiento y reparación de repositorios, mientras que Claude Fable 5 es particularmente competitivo en ingeniería de software y agentes de uso de computadora.

Si K4 se mantiene abierto o ampliamente accesible mientras cierra estas brechas de capacidad, su importancia iría más allá de un mayor conteo de parámetros. Mostrará que sistemas abiertos o semiabiertos pueden acercarse a la confiabilidad de las plataformas de agentes propietarios más fuertes. Si K4 se vuelve cerrado y extremadamente costoso de servir, la distinción práctica sería mucho menor.

¿Qué podría significar Kimi K4 para la IA con pesos abiertos?

K3 ya demuestra que el desarrollo con pesos abiertos está entrando en una escala asociada casi exclusivamente con laboratorios propietarios. K4 podría empujar ese límite más allá, pero la apertura tiene varias capas: pesos descargables, código utilizable, una licencia viable, inferencia reproducible, requisitos de hardware asequibles y APIs hospedadas accesibles.

Un modelo puede ser técnicamente abierto pero económicamente inaccesible. La escala de 2,8T de K3 significa que el autoalojamiento serio requiere infraestructura sustancial incluso con activación dispersa y cuantización. Un K4 aún más grande podría ampliar la brecha entre investigadores que pueden inspeccionar los pesos y organizaciones que pueden operar el modelo eficientemente.

Para el ecosistema en general, el lanzamiento ideal de K4 combinaría pesos transparentes, recetas de inferencia eficientes, comportamiento sólido en el uso de herramientas y una API hospedada. Esa combinación permitiría a los investigadores estudiar el modelo, a las empresas desplegarlo a través de una API y a equipos especializados adaptarlo para cargas de trabajo privadas o reguladas.

¿Cuándo se lanzará Kimi K4?

Moonshot AI no ha anunciado una fecha de lanzamiento de Kimi K4. Los reportes públicos conectan el modelo con la adquisición de cómputo y la planificación de desarrollo. Eso hace poco confiable un mes, trimestre o cuenta regresiva precisos.

También se desconoce si K4 aparecerá simultáneamente en el producto web de Kimi, Kimi Code, Kimi Work, la API de Moonshot y un repositorio de pesos abiertos. K3 está disponible en varias de esas superficies, pero K4 podría seguir un despliegue escalonado o una estrategia de distribución diferente.

Las señales que vale la pena observar son un blog técnico oficial de Moonshot, un repositorio de modelo verificado, documentación de Kimi Platform, una licencia publicada y una tarjeta del modelo con detalles de evaluación reproducibles. Las publicaciones sociales y los rumores sobre parámetros deben seguir siendo secundarios hasta que aparezca una de esas fuentes.

Cómo acceder a los modelos Kimi mientras se espera K4

K4 no se puede invocar actualmente. Los desarrolladores pueden evaluar la arquitectura actual a través de Kimi K3 en CometAPI. El ID de modelo actual es texto de código simple: kimi-k3. La solicitud usa POST /v1/chat/completions. No envíe solicitudes de producción a un identificador especulativo kimi-k4 hasta que una página de integración oficial lo publique.

Cree una cuenta en CometAPI y genere una clave de API. Guarde la clave en una variable de entorno en lugar de incrustarla en el código fuente de la aplicación.

from openai import OpenAI​ client = OpenAI(    api_key="YOUR_COMETAPI_KEY",    base_url="https://api.cometapi.com/v1", )​ response = client.chat.completions.create(    model="kimi-k3",    messages=[        {            "role": "user",            "content": "Analyze the architecture of this software project."        }    ], )​ print(response.choices[0].message.content)

El bloque de código es Python. El endpoint, ID del modelo, nombres de parámetros y palabras clave del código se presentan intencionalmente como código en lugar de hipervínculos. Cuando K4 esté disponible, los desarrolladores deben confirmar su identificador real del modelo, compatibilidad de endpoint, modalidades admitidas y precios antes de cambiar el enrutamiento de producción.

Lo que aún no sabemos sobre Kimi K4

Un artículo responsable previo al lanzamiento debe preservar las siguientes incógnitas en lugar de llenarlas con estimaciones de la comunidad:

  • Conteos finales de parámetros totales y activados
  • Número de expertos, expertos compartidos y estrategia de enrutamiento
  • Ventana de contexto y longitud máxima de salida
  • Modalidades de entrada y salida admitidas
  • Estado de pesos abiertos, repositorio y licencia
  • ID de modelo de API, endpoints, modos de razonamiento y precios
  • Resultados oficiales de benchmarks y entornos de evaluación
  • Formatos de cuantización y requisitos de hardware para autoalojamiento
  • Disponibilidad de producto y fecha de lanzamiento

Mantener esta sección explícita evita que las especificaciones previstas se repitan más tarde como hechos oficiales. También facilita actualizar el artículo cuando Moonshot AI publique documentación primaria.

Preguntas frecuentes

¿Se ha lanzado Kimi K4?

No. No existe una tarjeta de modelo Kimi K4, documentación de API o anuncio público de lanzamiento. La discusión actual se basa principalmente en reportes de que Moonshot AI está preparando un sucesor más grande de K3.

¿Qué tan grande será Kimi K4?

Se desconoce el tamaño exacto. Los reportes dicen que puede ser significativamente más grande que K3, pero Moonshot AI no ha confirmado reclamos específicos de parámetros multibillonarios.

¿Kimi K4 será de código abierto?

No se ha confirmado. K3 tiene pesos abiertos bajo la Kimi K3 License, pero una estrategia de lanzamientos previa no garantiza la misma distribución para K4.

¿Kimi K4 tendrá una ventana de contexto de un millón de tokens?

Es razonable esperar que K4 mantenga o mejore la capacidad de largo contexto de K3, pero Moonshot AI no ha publicado un límite de contexto para K4.

¿Pueden los desarrolladores usar Kimi K4 a través de CometAPI ahora?

No hay una ruta confirmada del modelo K4 disponible. Los desarrolladores pueden probar actualmente Kimi K3 y compararlo con otros modelos de frontera a través de la misma capa de integración.

Conclusión

Kimi K4 no debe reducirse a un conteo de parámetros rumoreado. K3 ya prueba que Moonshot AI puede combinar escala extrema de modelo disperso, contexto de un millón de tokens, visión nativa, pesos abiertos y comportamiento de agentes de horizonte largo. La verdadera pregunta es si K4 puede convertir esa escala en ingeniería de software más confiable, mejor uso de computadora, bucles de retroalimentación multimodal más sólidos y una inferencia más eficiente.

Los detalles más importantes siguen siendo desconocidos: arquitectura exacta, fecha de lanzamiento, puntuaciones de benchmarks, licencia, acceso a la API y costo de servicio. Hasta que Moonshot publique documentación primaria, toda especificación de K4 más allá de la señal de desarrollo reportada debe etiquetarse como expectativa o inferencia.

Los desarrolladores no necesitan esperar para evaluar la dirección actual de Moonshot AI. Kimi K3 ya está disponible a través de CometAPI, proporcionando una línea base práctica para codificación, razonamiento de largo contexto, análisis multimodal y flujos de trabajo con agentes antes de que llegue Kimi K4.

Seguir aprendiendo

Conecta este artículo con la siguiente decisión.

Ver todos los temas
Publicado el Aug 31, 2026
Última actualización Sep 3, 2026
126 visitas
Revisado para mayor claridad, atribución de fuentes y terminología API actual.

¿Listo para reducir los costos de desarrollo de IA en un 20%?

Comienza gratis en minutos. Créditos de prueba gratuitos incluidos. No se requiere tarjeta de crédito.

Leer Más