TL;DR
Kimi K3 cuesta $0.30 por 1M de tokens de entrada con acierto de caché, $3.00 por 1M de tokens de entrada con fallo de caché y $15.00 por 1M de tokens de salida, con una ventana de contexto de 1,048,576 tokens.
En comparación con K2.7 Code, K3 es significativamente más caro por token, pero ofrece una ventana de contexto 4× mayor, además de visión nativa y un soporte más sólido para cargas de trabajo agénticas de largo horizonte.
Conclusión: K2.7 Code sigue siendo la opción más económica para tareas rutinarias de programación dentro de 256K de contexto. Use K3 cuando necesite un contexto mayor, capacidades multimodales o como ruta de escalamiento para tareas que K2.7 no pueda completar de forma fiable.
Precios de la API de Kimi K3 de un vistazo
| Elemento | Kimi K3 |
|---|---|
| ID del modelo API | kimi-k3 |
| Entrada con acierto de caché | $0.30 / 1M tokens |
| Entrada con fallo de caché | $3.00 / 1M tokens |
| Salida | $15.00 / 1M tokens |
| Ventana de contexto | 1,048,576 tokens |
| Razonamiento | Siempre habilitado |
| Esfuerzo de razonamiento | solo max |
| Máximo de finalización por defecto | 131,072 tokens |
| Máximo de finalización configurable | Hasta 1,048,576 tokens, sujeto al límite total de contexto |
| Capacidades clave | Visión nativa, llamadas a herramientas, salida estructurada, Partial Mode, carga dinámica de herramientas, almacenamiento automático en caché de contexto |
| Batch API | K3 no aparece actualmente entre los modelos Batch compatibles |
Consulte el Kimi K3 quickstart de Moonshot para parámetros actuales de la API y detalles de integración.
Qué aporta Kimi K3 respecto a K2.7 Code
La mejora más evidente es la longitud del contexto.
K2.7 Code admite 262,144 tokens, mientras que K3 aumenta ese límite a 1,048,576 tokens. Esto hace que K3 sea más práctico para repositorios grandes, historiales largos de agentes, documentación extensa y flujos que de otro modo requerirían reducción de contexto.
K3 también admite:
- comprensión visual nativa
- salida estrictamente estructurada
tool_choice- carga dinámica de herramientas
- almacenamiento automático en caché de contexto
- flujos de trabajo de programación y de conocimiento de larga duración
El blog técnico de Kimi K3 de Moonshot reporta 88.3 en Terminal-Bench 2.1, 77.8 en Program Bench y 81.2 en FrontierSWE.
Son benchmarks reportados por el proveedor y deben tomarse como motivos para evaluar K3, no como garantías de que superará a K2.7 Code en todas las cargas de trabajo en producción.
Para antecedentes sobre la generación anterior, consulte la guía de la API de Kimi K2 de CometAPI.
Precios de Kimi K3 vs Kimi K2.7 Code
| Modelo | Entrada con acierto de caché | Entrada con fallo de caché | Salida | Contexto |
|---|---|---|---|---|
| kimi-k3 | $0.30 / 1M | $3.00 / 1M | $15.00 / 1M | 1,048,576 |
| kimi-k2.7-code | $0.19 / 1M | $0.95 / 1M | $4.00 / 1M | 262,144 |
| kimi-k2.7-code-highspeed | $0.38 / 1M | $1.90 / 1M | $8.00 / 1M | 262,144 |
Las tarifas de K2.7 provienen de la documentación oficial de precios de Kimi K2.7 Code de Moonshot.
En comparación con K2.7 Code estándar, K3 es:
- 1.58× el precio para entrada con acierto de caché
- 3.16× el precio para entrada con fallo de caché
- 3.75× el precio para salida
La prima de K3 es menor respecto a K2.7 Code HighSpeed, pero los dos modelos apuntan a prioridades diferentes: HighSpeed se centra en una salida de código más rápida, mientras que K3 está orientado a cargas de trabajo de contexto largo y agénticas más exigentes.
La documentación actual de precios del Batch API de Moonshot no lista K3, por lo que no se debe asumir que los descuentos de Batch aplicables a otros modelos de Kimi también apliquen aquí.
Caché de contexto en Kimi K3: cómo funciona el 90% de descuento en la entrada
K3 admite almacenamiento en caché de contexto automático.
Los desarrolladores no necesitan crear manualmente un ID de caché o TTL. Mantener prefijos grandes estables en solicitudes repetidas da a las solicitudes posteriores la oportunidad de recibir la tarifa de acierto de caché.
La diferencia de precio es:
- Fallo de caché: $3.00 / 1M tokens de entrada
- Acierto de caché: $0.30 / 1M tokens de entrada
Así, los tokens de entrada con acierto de caché cuestan un 90% menos que los tokens de entrada con fallo de caché.
Sin embargo, la salida sigue costando $15 por millón de tokens, por lo que el costo total de la solicitud no cae un 90%.
Por ejemplo, supongamos:
- 600,000 tokens de entrada
- 20,000 tokens de salida
| Estado de caché | Costo de entrada | Costo de salida | Total |
|---|---|---|---|
| Toda la entrada falla | $1.80 | $0.30 | $2.10 |
| Toda la entrada acierta | $0.18 | $0.30 | $0.48 |
En este caso simplificado, el costo total cae alrededor de un 77%.
El ahorro real depende de la proporción de tokens de entrada que reciban la tarifa de acierto de caché.
Ejemplo: cuánto cuesta una tarea de programación en K3 vs K2.7
Supongamos que una tarea de programación usa:
- 200,000 tokens de entrada
- 20,000 tokens de salida
| Ruta | Total en frío | Total con caché completa |
|---|---|---|
| kimi-k3 | $0.90 | $0.36 |
| kimi-k2.7-code | $0.27 | $0.12 |
| kimi-k2.7-code-highspeed | $0.54 | $0.24 |
Para esta carga de trabajo, K3 cuesta aproximadamente 3.33× más que K2.7 Code estándar en una solicitud en frío.
Dentro de K3, pasar de entrada totalmente con fallo de caché a entrada totalmente con acierto de caché reduce el costo estimado de la solicitud de $0.90 a $0.36, una reducción del 60% en este ejemplo.
Pero el costo por solicitud es solo parte de la ecuación.
Costo por tarea exitosa = Gasto total del flujo de trabajo ÷ Tareas que pasan las verificaciones de aceptación
Una comparación de producción también debe incluir reintentos, llamadas de respaldo, ejecuciones de herramientas y tiempo de revisión humana.
Una solicitud de K3 que tiene éxito a la primera puede ser más económica que varios intentos más baratos que fallen.
Un caso límite real: costo de tokens de razonamiento
K3 siempre utiliza razonamiento, por lo que el consumo de tokens de salida puede convertirse en una parte significativa de la factura.
En una prueba del día de lanzamiento de Simon Willison, un prompt que pedía a K3 generar un SVG consumió 13,241 tokens de razonamiento antes de producir 3,417 tokens de respuesta, para un costo total de aproximadamente $0.25.
Fue una prueba informal de un solo prompt, pero destaca una consideración importante de costos: la respuesta final visible puede representar solo una parte de la salida facturada.
Dado que K3 actualmente solo admite el esfuerzo de razonamiento máximo, los equipos deberían medir el uso real de tokens de salida en sus propias cargas de trabajo.
Un mejor valor por defecto: K2.7 primero, K3 bajo escalamiento
Para cargas de trabajo mixtas de programación, el enrutamiento puede ser más económico que enviar cada solicitud directamente a K3.
Una estrategia simple es:
Start with K2.7 Code
↓
Task exceeds 256K context?
→ Yes: use K3
↓ No
Run task and validation
↓
Validation failed?
→ Yes: escalate to K3
↓ No
Return result
Usando el ejemplo anterior:
- K2.7 Code cuesta $0.27 por intento en frío
- K3 cuesta $0.90
- K2.7 completa con éxito el 70% de las tareas
- El 30% se reintenta una vez en K3
El costo promedio queda:
$0.27 + (30% × $0.90) = $0.54 per task
Enviar cada tarea directamente a K3 costaría $0.90 por tarea bajo los mismos supuestos de tokens.
Eso hace que la estrategia de enrutamiento sea un 40% más barata en este escenario simplificado.
El ahorro exacto variará, pero el principio es útil: enrute el trabajo rutinario al modelo más barato y escale cuando realmente se necesite capacidad adicional.
¿Cuándo merece la pena Kimi K3?
K3 es más convincente cuando:
- El contexto requerido supera el límite de 262,144 tokens de K2.7 Code.
- La tarea combina código con entrada visual.
- Un agente de larga duración necesita trabajar en repositorios grandes y herramientas externas.
- K2.7 requiere reintentos o llamadas de respaldo con frecuencia.
- La tarea es lo suficientemente valiosa como para que la calidad de finalización importe más que minimizar el costo de la primera llamada.
K2.7 Code sigue siendo una opción sólida para tareas de programación repetitivas y bien delimitadas que ya logran una alta tasa de éxito dentro de 256K de contexto.
Para aplicaciones de programación sensibles a la latencia, también debería probarse por separado K2.7 Code HighSpeed.
Migrar de K2.7 a K3: cinco comprobaciones de ingeniería
-
El razonamiento de K3 no puede reducirse actualmente
K3 siempre razona y la API actual solo admite:
reasoning_effort="max"
Dado que max es el valor por defecto, el parámetro también puede omitirse.
-
Elimine los parámetros
thinkingespecíficos de K2
No use el parámetro thinking de K2.x con K3.
Use en su lugar el campo de nivel superior reasoning_effort.
-
Omita los parámetros de muestreo fijos
K3 utiliza actualmente valores fijos para parámetros como:
temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0
Moonshot recomienda omitir estos campos en lugar de sobrescribirlos.
-
Conserve los mensajes completos del asistente
Para conversaciones de varios turnos y bucles de llamadas a herramientas, pase el mensaje completo del asistente a la siguiente solicitud en lugar de conservar solo el content visible.
-
Valide visión y búsqueda antes de producción
La API de visión actual de K3 no admite directamente URLs públicas de imágenes. Use un formato de imagen compatible como datos base64 o el mecanismo de referencia de archivos de Moonshot.
Moonshot también desaconseja depender de su funcionalidad actual de Web Search para uso en producción a corto plazo mientras se actualiza la función.
Ejemplo de la API de Kimi K3 en Python
K3 puede llamarse a través de una interfaz de API compatible con OpenAI:
from openai import OpenAI
client = OpenAI(
base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
api_key="YOUR_API_KEY",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "You are an expert software engineer.",
},
{
"role": "user",
"content": "Analyze this repository logic and identify potential issues.",
},
],
reasoning_effort="max", # Optional while "max" is the default
)
assistant_message = response.choices[0].message
print(assistant_message)
Evite sobrescribir los parámetros de muestreo fijos de K3. Para flujos de varios turnos y llamadas a herramientas, conserve el mensaje completo del asistente.
Cómo evaluar Kimi K3 antes de actualizar
Pruebe K3 en cargas de trabajo reales en lugar de solo prompts de benchmark.
Un conjunto de evaluación práctico podría incluir:
- ediciones rutinarias de repositorios
- tareas cercanas al límite de contexto de 256K
- tareas que superan 256K
- tareas de ingeniería visual
- tareas agénticas o de trabajo del conocimiento de largo horizonte
Compare K3, K2.7 Code y K2.7 Code HighSpeed cuando corresponda.
Haga seguimiento de:
- tasa de éxito de tareas
- tokens de entrada en caché y sin caché
- tokens de salida y de razonamiento
- reintentos y llamadas de respaldo
- latencia p50 y p95
- errores de llamadas a herramientas
- tiempo de revisión humana
- costo por tarea exitosa
Luego compare tres políticas:
- Todo K2.7 Code
- Todo K3
- K2.7 Code con escalamiento a K3
La mejor ruta es la que cumple sus requisitos de calidad y latencia al menor costo por tarea exitosa.
Precios de Kimi K3 en CometAPI
Los cálculos anteriores usan los precios oficiales de la API de Moonshot AI para mantener consistente la comparación entre K3 y K2.7.
En el momento de la publicación, Kimi K3 en CometAPI tiene un precio 20% más bajo que las tarifas estándar de la API de Moonshot AI:
| Ruta | Entrada | Salida |
|---|---|---|
| Moonshot AI | $3.00 / 1M | $15.00 / 1M |
| CometAPI | $2.40 / 1M | $12.00 / 1M |
Dado que los precios de la API pueden cambiar, consulte la página del modelo en vivo antes de usar estas cifras para presupuestos de producción.
La API compatible con OpenAI de CometAPI facilita probar kimi-k3 junto a otras rutas de modelos usando los mismos prompts y flujo de evaluación.
¿Listo para probar Kimi K3? Vea Kimi K3 en CometAPI y compare precios antes de llevarlo a producción.
Para ejemplos de integración y evaluación, consulte el CometAPI Cookbook en GitHub.
Preguntas frecuentes
¿Cuánto cuesta la API de Kimi K3?
Moonshot AI lista Kimi K3 a $0.30 por 1 millón de tokens de entrada con acierto de caché, $3.00 por 1 millón de tokens de entrada con fallo de caché y $15.00 por 1 millón de tokens de salida.
El ID del modelo API es kimi-k3.
¿Kimi K3 es más barato que Kimi K2.7 Code?
No. Según las tarifas oficiales de Moonshot, K3 cuesta aproximadamente 3.16× para entrada con fallo de caché y 3.75× para salida.
Aún puede reducir costos del flujo si mejora el éxito de tareas o reduce reintentos.
¿Kimi K3 tiene una ventana de contexto de 1M tokens?
Sí. Kimi K3 admite una ventana de contexto de 1,048,576 tokens, frente a 262,144 tokens de Kimi K2.7 Code.
¿Kimi K3 admite almacenamiento automático en caché de contexto?
Sí. El almacenamiento en caché de contexto es automático. Los tokens de entrada con acierto de caché cuestan $0.30 por millón frente a $3.00 por millón para tokens con fallo de caché.
¿Puedo desactivar el razonamiento de Kimi K3 para reducir costos?
Actualmente no. K3 siempre usa razonamiento y reasoning_effort="max" es el único nivel de esfuerzo de razonamiento admitido.
Reflexiones finales
Kimi K3 ofrece un contexto sustancialmente mayor y capacidades más amplias que K2.7 Code, pero a un precio por token más alto.
Para programación rutinaria dentro de 256K de contexto, K2.7 Code suele ser la opción más económica. Para tareas de contexto largo, multimodales o agénticas difíciles, K3 puede justificar su prima, especialmente cuando mejora la finalización exitosa.
Para muchos sistemas de producción, la estrategia más eficiente no es reemplazar K2.7 por completo, sino usar K2.7 como predeterminado y K3 como ruta de escalamiento.
La métrica que finalmente importa no es el costo por llamada a la API, sino el costo por tarea exitosa.
