Kimi K3 is now live on CometAPI →

Tarification de l'API Kimi K3 (2026) : ce que cela coûte & comparaison du code avec K2.7

CometAPI
Mia MarenJul 17, 2026
Tarification de l'API Kimi K3 (2026) : ce que cela coûte & comparaison du code avec K2.7

TL;DR

Kimi K3 coûte $0.30 par 1M de jetons d’entrée cache-hit, $3.00 par 1M de jetons d’entrée cache-miss, et $15.00 par 1M de jetons de sortie, avec une fenêtre de contexte de 1,048,576 jetons.

Comparé à K2.7 Code, K3 est nettement plus cher par jeton, mais offre une fenêtre de contexte 4× plus grande, une vision native et un meilleur support des charges de travail agentiques à long horizon.

Conclusion: K2.7 Code reste le choix le plus économique pour les tâches de code routinières dans un contexte de 256K. Utilisez K3 quand vous avez besoin d’un contexte plus grand, de capacités multimodales, ou comme voie d’escalade pour les tâches que K2.7 ne parvient pas à mener à bien de manière fiable.

Kimi K3 API Pricing at a Glance

ItemKimi K3
API model IDkimi-k3
Cache-hit input$0.30 / 1M tokens
Cache-miss input$3.00 / 1M tokens
Output$15.00 / 1M tokens
Context window1,048,576 tokens
ReasoningAlways enabled
Supported reasoning effortmax only
Default maximum completion131,072 tokens
Configurable maximum completionUp to 1,048,576 tokens, subject to the total context limit
Key capabilitiesVision native, appels d’outils, sortie structurée, Partial Mode, chargement dynamique d’outils, mise en cache automatique du contexte
Batch APIK3 n’est pas actuellement listé parmi les modèles Batch pris en charge

Voir le Kimi K3 quickstart de Moonshot pour les paramètres API actuels et les détails d’intégration.

What Kimi K3 Adds Over K2.7 Code

L’amélioration la plus évidente est la longueur du contexte.

K2.7 Code supporte 262,144 jetons, tandis que K3 porte cette limite à 1,048,576 jetons. Cela rend K3 plus pratique pour les grands dépôts, les historiques d’agents longs, la documentation étendue et les workflows qui nécessiteraient autrement une réduction de contexte.

K3 prend également en charge :

  • compréhension visuelle native
  • sortie strictement structurée
  • tool_choice
  • chargement dynamique d’outils
  • mise en cache automatique du contexte
  • workflows de code et de travail de connaissance longue durée

Le blog technique Kimi K3 de Moonshot annonce 88.3 sur Terminal-Bench 2.1, 77.8 sur Program Bench, et 81.2 sur FrontierSWE.

Ce sont des benchmarks rapportés par le fournisseur et doivent être considérés comme des raisons d’évaluer K3 — pas des garanties qu’il surpassera K2.7 Code sur toutes les charges de travail en production.

Pour le contexte sur la génération précédente, voir le Kimi K2 API guide de CometAPI.

Kimi K3 vs Kimi K2.7 Code Pricing

ModelCache-hit inputCache-miss inputOutputContext
kimi-k3$0.30 / 1M$3.00 / 1M$15.00 / 1M1,048,576
kimi-k2.7-code$0.19 / 1M$0.95 / 1M$4.00 / 1M262,144
kimi-k2.7-code-highspeed$0.38 / 1M$1.90 / 1M$8.00 / 1M262,144

Les tarifs K2.7 proviennent de la documentation officielle de tarification Kimi K2.7 Code de Moonshot.

Comparé à K2.7 Code standard, K3 est :

  • 1.58× le prix pour l’entrée cache-hit
  • 3.16× le prix pour l’entrée cache-miss
  • 3.75× le prix pour la sortie

La prime de K3 est plus faible par rapport à K2.7 Code HighSpeed, mais les deux modèles visent des priorités différentes : HighSpeed se concentre sur une sortie de code plus rapide, tandis que K3 cible des charges de travail plus exigeantes en long contexte et agentiques.

La documentation de tarification Batch API actuelle de Moonshot ne liste pas K3, donc n’assumez pas que les remises Batch applicables à d’autres modèles Kimi s’appliquent ici.

Kimi K3 Context Caching: How the 90% Input Discount Works

K3 prend en charge la mise en cache automatique du contexte.

Les développeurs n’ont pas besoin de créer manuellement un ID de cache ou un TTL. Maintenir de grands préfixes stables sur des requêtes répétées donne aux requêtes suivantes la possibilité de bénéficier du tarif cache-hit.

La différence de prix est :

  • Cache miss : $3.00 / 1M jetons d’entrée
  • Cache hit : $0.30 / 1M jetons d’entrée

Ainsi, les jetons d’entrée cache-hit coûtent 90 % de moins que les jetons d’entrée cache-miss.

Cependant, la sortie reste facturée à $15 par million de jetons, donc le coût total de la requête ne baisse pas de 90 %.

Par exemple, supposons :

  • 600,000 jetons d’entrée
  • 20,000 jetons de sortie
Cache stateInput costOutput costTotal
All input cache miss$1.80$0.30$2.10
All input cache hit$0.18$0.30$0.48

Dans ce cas simplifié, le coût total diminue d’environ 77 %.

Les économies réelles dépendent de la part de jetons d’entrée facturés au tarif cache-hit.

Example: What a Coding Task Costs on K3 vs K2.7

Supposons qu’une tâche de code utilise :

  • 200,000 jetons d’entrée
  • 20,000 jetons de sortie
RouteCold totalFully cached total
kimi-k3$0.90$0.36
kimi-k2.7-code$0.27$0.12
kimi-k2.7-code-highspeed$0.54$0.24

Pour cette charge, K3 coûte environ 3.33× plus que K2.7 Code standard sur une requête à froid.

Au sein de K3 lui-même, passer d’une entrée entièrement cache-miss à une entrée entièrement cache-hit réduit le coût estimé de la requête de $0.90 à $0.36, soit une réduction de 60 % dans cet exemple.

Mais le coût par requête n’est qu’une partie de l’équation.

Coût par tâche réussie = Dépense totale du workflow ÷ Tâches qui passent les critères d’acceptation

Une comparaison en production doit également inclure les retries, les appels de secours, les exécutions d’outils et le temps de revue humaine.

Une requête K3 qui réussit du premier coup peut être plus économique que plusieurs tentatives moins chères qui échouent.

A Real-World Edge Case: Reasoning Token Cost

K3 utilise toujours le raisonnement, donc la consommation de jetons de sortie peut devenir une partie significative de la facture.

Dans un test du jour de lancement par Simon Willison, une invite demandant à K3 de générer un SVG a consommé 13,241 jetons de raisonnement avant de produire 3,417 jetons de réponse, pour un coût total d’environ $0.25.

Il s’agissait d’un test informel sur une seule invite plutôt qu’un benchmark, mais cela met en évidence une considération importante de coût : la réponse finale visible peut ne représenter qu’une partie de la sortie facturée.

Comme K3 ne prend actuellement en charge que l’effort de raisonnement maximal, les équipes devraient mesurer l’utilisation réelle des jetons de sortie sur leurs propres charges de travail.

A Better Default: K2.7 First, K3 on Escalation

Pour des charges de travail de code mixtes, le routage peut être plus économique que d’envoyer chaque requête directement à K3.

Une stratégie simple est :

Start with K2.7 Code
        ↓
Task exceeds 256K context?
        → Yes: use K3
        ↓ No
Run task and validation
        ↓
Validation failed?
        → Yes: escalate to K3
        ↓ No
Return result

En reprenant l’exemple précédent :

  • K2.7 Code coûte $0.27 par tentative à froid
  • K3 coûte $0.90
  • K2.7 réussit 70 % des tâches
  • 30 % sont réessayées une fois sur K3

Le coût moyen devient :

$0.27 + (30% × $0.90) = $0.54 per task

Envoyer chaque tâche directement à K3 coûterait $0.90 par tâche avec les mêmes hypothèses de jetons.

Cela rend la stratégie routée 40 % moins chère dans ce scénario simplifié.

Les économies exactes varieront, mais le principe est utile : routez le travail routinier vers le modèle le moins cher et n’escaladez que lorsque des capacités supplémentaires sont réellement nécessaires.

When Is Kimi K3 Worth the Upgrade?

K3 est le plus convaincant lorsque :

  • Le contexte requis dépasse la limite de 262,144 jetons de K2.7 Code.
  • La tâche combine du code avec une entrée visuelle.
  • Un agent longue durée doit travailler sur de grands dépôts et des outils externes.
  • K2.7 nécessite des retries fréquents ou des appels de secours.
  • La tâche est suffisamment précieuse pour que la qualité de complétion prime sur la minimisation du coût du premier appel.

K2.7 Code reste une option solide pour les tâches de code répétitives et bien cadrées qui atteignent déjà un taux de réussite élevé dans un contexte de 256K.

Pour les applications de code sensibles à la latence, K2.7 Code HighSpeed devrait également être testé séparément.

Migrating from K2.7 to K3: Five Engineering Checks

  1. K3 Reasoning Cannot Currently Be Reduced

K3 raisonne toujours, et l’API actuelle ne prend en charge que :

reasoning_effort="max"

Comme « max » est la valeur par défaut, le paramètre peut également être omis.

  1. Remove K2-Specific thinking Parameters

N’utilisez pas le paramètre thinking de K2.x avec K3.

Utilisez à la place le champ de niveau supérieur reasoning_effort.

  1. Omit Fixed Sampling Parameters

K3 utilise actuellement des valeurs fixes pour des paramètres incluant :

temperature=1.0
top_p=0.95
n=1
presence_penalty=0
frequency_penalty=0

Moonshot recommande d’omettre ces champs plutôt que de les surcharger.

  1. Preserve Complete Assistant Messages

Pour les conversations multi-tours et les boucles d’appels d’outils, transmettez le message d’assistant complet dans la requête suivante plutôt que de ne retenir que le content visible.

  1. Validate Vision and Search Before Production

L’API de vision actuelle de K3 ne prend pas en charge directement les URLs d’images publiques. Utilisez un format d’image pris en charge tel que des données base64 ou le mécanisme de référence de fichier de Moonshot.

Moonshot déconseille également de s’appuyer sur sa fonctionnalité actuelle Web Search pour un usage de production à court terme pendant que la fonctionnalité est en cours de mise à jour.

Kimi K3 API Example in Python

K3 peut être appelé via une interface API compatible OpenAI :

from openai import OpenAI

client = OpenAI(
    base_url="YOUR_OPENAI_COMPATIBLE_BASE_URL",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "system",
            "content": "You are an expert software engineer.",
        },
        {
            "role": "user",
            "content": "Analyze this repository logic and identify potential issues.",
        },
    ],
    reasoning_effort="max",  # Optional while "max" is the default
)

assistant_message = response.choices[0].message
print(assistant_message)

Évitez de surcharger les paramètres d’échantillonnage fixes de K3. Pour les workflows multi-tours et d’appels d’outils, conservez le message d’assistant complet.

How to Evaluate Kimi K3 Before Upgrading

Testez K3 sur des charges de travail réelles plutôt que sur des invites de benchmark uniquement.

Un ensemble d’évaluation pratique peut inclure :

  • modifications routinières de dépôts
  • tâches proches de la limite de contexte 256K
  • tâches qui dépassent 256K
  • tâches d’ingénierie visuelle
  • tâches agentiques ou de travail de connaissance à long horizon

Comparez K3, K2.7 Code, et K2.7 Code HighSpeed lorsque pertinent.

Suivez :

  • taux de réussite des tâches
  • jetons d’entrée mis en cache et non mis en cache
  • jetons de sortie et de raisonnement
  • retries et appels de secours
  • latence p50 et p95
  • erreurs d’appels d’outils
  • temps de revue humaine
  • coût par tâche réussie

Comparez ensuite trois politiques :

  1. Tout en K2.7 Code
  2. Tout en K3
  3. K2.7 Code avec escalade vers K3

La meilleure voie est celle qui répond à vos exigences de qualité et de latence au coût le plus bas par tâche réussie.

Kimi K3 Pricing on CometAPI

Les calculs ci-dessus utilisent les tarifs API officiels de Moonshot AI pour garder la comparaison K3 et K2.7 cohérente.

Au moment de la publication, Kimi K3 sur CometAPI est tarifé 20 % en dessous des tarifs API standard de Moonshot AI :

RouteInputOutput
Moonshot AI$3.00 / 1M$15.00 / 1M
CometAPI$2.40 / 1M$12.00 / 1M

Comme les tarifs API peuvent changer, vérifiez la page du modèle en direct avant d’utiliser ces chiffres pour la budgétisation de production.

L’API compatible OpenAI de CometAPI facilite les tests de kimi-k3 aux côtés d’autres routes de modèle en utilisant les mêmes invites et workflow d’évaluation.

Prêt à tester Kimi K3 ? Voir Kimi K3 sur CometAPI et comparez les prix avant de le passer en production.

Pour des exemples d’intégration et d’évaluation, consultez le CometAPI Cookbook on GitHub.

FAQ

Combien coûte l’API Kimi K3 ?

Moonshot AI liste Kimi K3 à $0.30 par 1 million de jetons d’entrée cache-hit, $3.00 par 1 million de jetons d’entrée cache-miss, et $15.00 par 1 million de jetons de sortie.

L’ID du modèle API est kimi-k3.

Kimi K3 est-il moins cher que Kimi K2.7 Code ?

Non. D’après les tarifs officiels de Moonshot, K3 est environ 3.16× le prix pour l’entrée cache-miss et 3.75× le prix pour la sortie.

Il peut néanmoins réduire les coûts de workflow s’il améliore la réussite des tâches ou diminue les retries.

Kimi K3 a-t-il une fenêtre de contexte de 1M jetons ?

Oui. Kimi K3 supporte une fenêtre de contexte de 1,048,576 jetons, contre 262,144 jetons pour Kimi K2.7 Code.

Kimi K3 prend-il en charge la mise en cache automatique du contexte ?

Oui. La mise en cache du contexte est automatique. Les jetons d’entrée cache-hit coûtent $0.30 par million contre $3.00 par million pour les jetons d’entrée cache-miss.

Puis-je désactiver le raisonnement de Kimi K3 pour réduire les coûts ?

Pas pour le moment. K3 utilise toujours le raisonnement, et reasoning_effort="max" est le seul niveau d’effort de raisonnement pris en charge.

Conclusion

Kimi K3 offre un contexte substantiellement plus grand et des capacités plus larges que K2.7 Code, mais à un prix par jeton plus élevé.

Pour le code routinier dans un contexte de 256K, K2.7 Code est généralement le choix le plus économique. Pour les tâches à long contexte, multimodales ou agentiques difficiles, K3 peut justifier sa prime — surtout s’il améliore la réussite.

Pour de nombreux systèmes de production, la stratégie la plus efficace n’est donc pas de remplacer K2.7 entièrement, mais d’utiliser K2.7 par défaut et K3 en route d’escalade.

La métrique qui compte au final n’est pas le coût par appel API, mais le coût par tâche réussie.

Prêt à réduire vos coûts de développement IA de 20 % ?

Démarrez gratuitement en quelques minutes. Crédits d'essai offerts. Aucune carte bancaire requise.

En savoir plus