TLDR : Moonshot AI a lancé Kimi K3 le 16 juillet 2026 – un modèle à poids ouverts révolutionnaire de 2,8 billions de paramètres (premier dans la classe 3T) avec multimodalité native, contexte d’1 million de jetons et des performances de pointe qui rivalisent avec ou dépassent les meilleurs modèles propriétaires comme Claude Fable 5 et GPT-5.6 Sol en codage, tâches agentiques, développement front-end et travail de connaissance.
Points clés
- Échelle et innovation : 2,8T de paramètres, MoE avec 16/896 experts actifs, Kimi Delta Attention (KDA), Attention Residuals – ~2,5x d’efficacité de passage à l’échelle par rapport à K2, Kimi K3 - Kimi API Platform
- Performances : Artificial Analysis Intelligence Index ~57 (top 4, devant Claude Opus 4.8), leader sur Frontend Code Arena, fort sur Terminal-Bench (88,3 %), BrowseComp (91,2 %), GPQA-Diamond (93,5 %). Derrière Fable 5/Sol au global mais devant la plupart des autres ; #1 sur Arena.ai Frontend Code Arena (1 679 Elo, devant Fable 5), publication d’Arena sur X et couverture par Tom’s Hardware.
- Capacités : Vision/vidéo natives, contexte 1M pour d’immenses dépôts/bases de code, codage agentique, raisonnement 3D, montage vidéo, tableaux de recherche.
- Accès : Immédiat via kimi.com, API (modèle kimi-k3, guide d’accès) ; poids ouverts bientôt. Moonshot a temporairement suspendu les nouvelles souscriptions Kimi K3 après un pic de demande. Intégration facile via CometAPI.
- Valeur : Coût par tâche plus faible (~$0.94 dans certains évaluations), moins de refus, idéal pour les workflows de codage/Vision.
Le Kimi K3 Tech Blog décrit Kimi K3 comme « Open Frontier Intelligence, Kimi K3 marque un moment charnière dans la démocratisation de l’IA. Alors que des laboratoires chinois comme Moonshot repoussent les limites malgré des contraintes de calcul, ce modèle ouvert remet en cause la domination des frontières fermées américaines et donne du pouvoir aux développeurs du monde entier. »
Qu’est-ce que Kimi K3 ? Un modèle ouvert de classe 3T de Moonshot AI
Moonshot AI, une startup basée à Pékin, a lancé Kimi K3 le 16 juillet 2026 comme son modèle phare. Il est explicitement présenté comme le premier modèle ouvert dans la classe d’environ 3 billions de paramètres, avec 2,8 billions de paramètres totaux dans une architecture Mixture-of-Experts (MoE) clairsemée. Seuls 16 des 896 experts sont activés par jeton, conciliant échelle massive et efficacité.
Cela s’appuie sur la série Kimi K2 (K2.5, K2.6, etc.), déjà remarquée pour le codage et la multimodalité. K3 introduit des innovations architecturales : Kimi Delta Attention (KDA) et Attention Residuals (AttnRes), plus Stable LatentMoE et l’entraînement conscient de la quantification (poids MXFP4, activations MXFP8 dès l’étape SFT). Cela apporte ~2,5x d’efficacité de scaling et jusqu’à 6,3x de décodage plus rapide par rapport aux prédécesseurs.
Caractéristiques clés (Kimi K3 Technical Specifications) :
- Paramètres : 2,8T au total (MoE clairsemé).
- Fenêtre de contexte : 1 048 576 jetons (~1M).
- Modalités : Compréhension native texte + image + vidéo ; sortie texte.
- Sortie maximale : Par défaut 131k jetons, jusqu’à la limite de contexte.
- Raisonnement : Effort maximal par défaut au lancement ; modes plus bas/plus haut à venir.
- Poids ouverts : Promis d’ici le 27 juillet 2026 (licence de type MIT modifiée, selon le précédent K2).
K3 vise les tâches à long horizon — pas seulement des réponses rapides, mais l’accomplissement de workflows d’ingénierie, de recherche ou d’agents complexes avec retour visuel (« Vision in the Loop »). Les démos incluent la construction autonome d’un compilateur GPU (rivalisant avec Triton), la conception de puces sur un procédé 45 nm et une recherche astrophysique rapide.
La demande a déjà mis la capacité sous tension
L’accueil initial a été assez fort pour créer une pression de capacité. Moonshot a publié sur X que la demande au cours des 48 heures précédentes avait frôlé ses limites GPU actuelles et que les nouvelles souscriptions seraient temporairement suspendues pendant l’augmentation de capacité. Business Insider a rapporté la même pause de capacité et a noté que les abonnés existants n’étaient pas affectés.
Ceci compte pour la planification de production. Un modèle peut être excellent et néanmoins subir des contraintes de disponibilité si la demande dépasse le calcul. Les équipes évaluant Kimi K3 devraient éviter la dépendance à un seul fournisseur, suivre la latence et les taux d’erreur, et utiliser un routage de repli via un fournisseur unifié comme CometAPI lorsque c’est possible.
Référentiels de codage : là où Kimi K3 semble le plus fort
Le profil de codage de Kimi K3 est la raison principale pour laquelle les développeurs s’y intéressent. Il est quasiment à égalité avec GPT-5.6 Sol sur Terminal-Bench 2.1, devance GPT-5.6 Sol et Claude Fable 5 sur Program Bench, et mène GPT-5.6 Sol d’une marge significative sur FrontierSWE. Il surpasse également les modèles comparés sur SWE Marathon dans le tableau OpenLM.
Le résultat sur le front-end d’Arena ajoute un signal pratique. Arena a rapporté Kimi K3 à 1679 points sur Frontend Code Arena, devant Claude Fable 5. Ce benchmark compte car le travail front-end est souvent jugé par préférence humaine, pas seulement par des tests unitaires. Un assistant de codage capable de produire une UI propre et visuellement cohérente à partir d’un prompt est précieux pour les équipes produit, les agences, les éditeurs SaaS et les outils internes.
Classements globaux
- Artificial Analysis AI Leaderboard : Débuts à la 3e place. Les scores de l’Indice d’intelligence le placent de manière compétitive (par ex., ~57,1 dans certains évaluations).
- Évaluation privée de travail de connaissance à long horizon : Elo 1547 (+732 par rapport à K2.6), derrière seulement Fable 5.
Référentiels de codage et agentiques (autodéclarés et indépendants)
K3 brille ici, tirant parti de son échelle et de son architecture pour des performances agentiques soutenues.
- Frontend Code Arena (Arena.ai) : #1 avec 1 679 points, devant Fable 5 et GPT-5.6 Sol. Excelle en préférence développeur à l’aveugle pour le développement web.
- DeepSWE : 67,3–67,5 (solide, avec le harnais KimiCode).
- Program Bench : #1 à 77,8.
- SWE Marathon : #1 à 42,0 (certains harnais).
- Terminal-Bench 2.1 : Compétitif, proche de GPT-5.6 Sol.
Vision et multimodal
L’entraînement natif (et non greffé) produit de bons résultats :
- MMMU-Pro : 81,6 %
- MathVision : Compétitif/haut 90s dans certains rapports.
- OmniDocBench : 91,1 % (leader).
Prend en charge captures d’écran, schémas, vidéo pour des tâches en boucle fermée comme l’affinage d’UI ou le développement de jeux.
Tableau de comparaison : Kimi K3 vs. modèles leaders (Approx./compilé à partir de rapports ; Effort max lorsque indiqué)
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Notes/Source |
|---|---|---|---|---|
| Frontend Code Arena | 1,679 (#1) | Inférieur | Inférieur | Arena.ai |
| DeepSWE | 67,3–67,5 | Compétitif | - | Moonshot/KimiCode |
| Program Bench | 77,8 (#1) | - | Proche | Vals.ai |
| Intelligence Index (AA) | ~57,1 | ~59,9 | ~58,9 | Artificial Analysis |
| Long-Horizon Elo | 1547 | Plus élevé | - | Interne Moonshot |
| Coût par tâche (evals) | ~$0.94 | Plus élevé | Plus élevé | Indépendant |
Données issues du blog technique de Moonshot, de classements indépendants et d’analyses. Les résultats peuvent varier selon le harnais/effort ; toujours vérifier les derniers éléments.
K3 montre moins de refus sur des sujets sensibles et une forte cohérence dans les flux agentiques. Des tests indépendants (par ex., évaluations YouTube, Vals AI) le confirment comme l’un des meilleurs modèles ouverts pour le codage en conditions réelles.
Que peut faire Kimi K3 ? Capacités en codage, vision et au-delà
Codage et ingénierie agentique
K3 soutient de longues sessions avec un minimum de supervision : il navigue dans d’immenses dépôts, utilise des outils, débogue via captures d’écran (« vision in the loop »).
Exemples :
- Optimisation de noyaux et dev de compilateur : a construit MiniTriton (compilateur de type Triton) from scratch, rivalisant avec des piles optimisées. A optimisé des noyaux GPU de manière compétitive face à Fable 5.
- Développement de jeux : transforme des concepts/images/vidéos en expériences jouables 3D/multijoueur avec affinements itératifs.
- Conception de puces : exécution autonome de 48 heures concevant une puce nano-modèle.
- Front-end : en tête des classements pour applis web, tâches full-stack.
Vision et multimodal
La compréhension native d’images/vidéo permet :
- Montage vidéo : a monté son propre teaser à partir de 56 clips (sélection, coupes, synchronisation, révisions) – des heures de travail en minutes.
- Raisonnement 3D, motion design, tableaux de bord interactifs.
- « Vision in the loop » pour l’itération de code via captures d’écran.
La documentation de l’API Kimi montre l’entrée image via des URL de données base64 et l’entrée vidéo via des fichiers téléversés référencés par ms://. Elle avertit également que les URL d’images publiques ne sont pas prises en charge en entrée vision, donc les développeurs doivent envoyer du base64 ou des références de fichier téléversé et faire du contenu de message un tableau d’objets. C’est un détail d’implémentation important : ne sérialisez pas un message mixte image et texte en une simple chaîne.
Travail de connaissance et recherche
Pour les entreprises, c’est là que Kimi K3 peut être plus précieux qu’un chatbot normal. Le modèle est conçu pour un travail « agentique » où il peut maintenir un plan, appeler des outils, traiter des résultats intermédiaires et produire un artefact final. Exemples : rapports d’étude de marché, assistants de nettoyage de données, synthèses de conformité, maintenance de base de connaissances support client, et copilotes d’ingénierie internes.
- Génère des rapports de niveau conseil, des visualisations interactives, des tableaux de bord (par ex., analyse de 42 ans de l’industrie des ASIC à partir de milliers de sources).
- Pipelines scientifiques : a reproduit des relations en astrophysique, analysé des ondes gravitationnelles avec des sous-agents.
- Widgets/Tableaux de bord dans Kimi Work pour des vues persistantes et pilotées par les données.
K3 fait le pont entre la littérature et le code exécutable, produisant des sorties de qualité publication efficacement.
Kimi K3 vs autres modèles de pointe : comparaison pratique
| Modèle | Meilleur usage | Atouts | Points d’attention | Recommandation CometAPI |
|---|---|---|---|---|
| Kimi K3 | Codage long-contexte, travail de connaissance, agents, vision | Échelle MoE 2,8T, contexte 1M, benchmarks forts en codage et agentique, poids ouverts | Pression de capacité en semaine de lancement, sensibilité à l’historique de pensée, vision variable selon l’acheminement | Tester comme modèle phare de codage et long-contexte |
| GPT-5.6 Sol | Raisonnement dur, codage, recherche, tâches de production | Profil de benchmark très solide et outillage mature | Prix plus élevé sur de nombreuses voies | Utiliser comme modèle de comparaison/échelonnement |
| Claude Fable 5 | Rédaction, codage, workflows agentiques, tâches à préférence humaine | Expérience utilisateur forte et performances de pointe | Coût plus élevé et possibles retours de politique sur certaines tâches | Comparer pour agents orientés utilisateur et écriture |
| Claude Opus 4.8 | Raisonnement profond et travail professionnel fiable | Comportement d’assistant stable haut de gamme | Plus ancien que les dernières versions phares | Garder comme secours ou base de référence |
| GLM-5.2 | Évaluation de modèle ouvert sensible au coût | Alternative ouverte compétitive | Plus faible dans plusieurs comparaisons listées face à K3 | Inclure dans les tests de routage coût/performance |
Comment accéder à Kimi K3 : guide étape par étape
Comment accéder à Kimi K3
1. Accéder à Kimi K3 via les produits Kimi
La voie la plus simple pour les non-développeurs est via les produits grand public et de productivité de Kimi : Kimi web, app, Kimi Work et Kimi Code. C’est le moyen le plus rapide de tester l’écriture, le codage, la recherche et le comportement orienté UI du modèle sans construire d’intégration d’abord. La suspension temporaire des souscriptions signalée le 20 juillet signifie que l’accès peut varier, donc vérifiez la page produit Kimi actuelle avant de planifier un déploiement d’équipe.
2. Accéder à Kimi K3 via la Kimi API Platform
Les développeurs peuvent appeler Kimi K3 via la Kimi API Platform en utilisant un client de type OpenAI. La documentation de Moonshot liste :
- base URL :
https://api.moonshot.ai/v1 - ID de modèle :
kimi-k3 - variable d’environnement dans les exemples :
MOONSHOT_API_KEY - exigence SDK Python : OpenAI SDK 1.0 ou plus récent
Exemple Python de base :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "Introduce Kimi K3 in one sentence."}
],
)
print(completion.choices[0].message.content)
Kimi K3 a toujours le mode pensée activé et prend en charge des valeurs reasoning_effort de low, high et max, avec max par défaut. L’API prend en charge le streaming, la sortie structurée avec schéma JSON strict, le Partial Mode, l’appel d’outils, le chargement dynamique d’outils, la mise en cache de contexte automatique, et des intégrations d’outils officielles via Formula. La documentation liste aussi plusieurs limites importantes : max_completion_tokens est par défaut à 131 072 et peut être défini jusqu’à 1 048 576 ; temperature et top-p sont fixes ; les développeurs doivent renvoyer le message assistant complet dans les workflows multi-tours et d’appel d’outils ; et la recherche web est en cours de mise à jour, donc elle n’est pas recommandée pour un usage en production à court terme.
3. Accéder à Kimi K3 via CometAPI
Pour de nombreuses équipes, CometAPI est la voie la plus pratique car elle fournit une couche API unifiée sur de nombreux fournisseurs de modèles. La page Kimi K3 de CometAPI liste le modèle comme en ligne avec :
- ID de modèle :
kimi-k3 - fournisseur : Moonshot AI
- fenêtre de contexte : jusqu’à 1 000 000 jetons
- prix CometAPI : $2.4 entrée et $12 sortie par 1M de jetons
- prix officiel listé : $3 entrée et $15 sortie par 1M de jetons
- endpoint :
/v1/chat/completions - base URL :
https://api.cometapi.com/v1
Exemple Python CometAPI :
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "You are a careful software engineering assistant.",
},
{
"role": "user",
"content": "Review this migration plan and identify the riskiest steps.",
},
],
max_completion_tokens=1024,
)
print(completion.choices[0].message.content)
Si votre application utilise déjà le SDK OpenAI, le quickstart de CometAPI recommande de ne changer que deux paramètres : définir base_url sur https://api.cometapi.com/v1 et utiliser COMETAPI_KEY à la place de votre clé fournisseur précédente. Ensuite, passez l’ID de modèle CometAPI dans le champ model.
4. Accéder aux poids ouverts de Kimi K3 après publication
Moonshot indique que les poids complets de Kimi K3 seront publiés d’ici le 27 juillet 2026. Une fois cela fait, les chercheurs, équipes d’infrastructure et utilisateurs entreprise avancés peuvent évaluer l’auto-hébergement, l’optimisation ou des déploiements privés. Pour la plupart des entreprises, la question clé sera l’économie : le modèle est ouvert, mais servir un système MoE 2,8T exige une infrastructure GPU sérieuse, de l’ingénierie d’inférence et une supervision opérationnelle.
Verdict final
Kimi K3 est l’un des lancements de modèles les plus importants de 2026 à ce jour. Il combine une échelle massive, une stratégie de poids ouverts sérieuse, une fenêtre de contexte d’1M de jetons, une compréhension visuelle native, et des résultats de benchmarks qui le placent près du sommet des systèmes d’IA de codage et agentiques actuels. Il n’efface pas le besoin de GPT, Claude, Gemini, DeepSeek, Qwen ou d’autres modèles, mais il offre aux développeurs une nouvelle option crédible pour les workflows long-contexte les plus difficiles.
Commencez dès aujourd’hui sur kimi.com ou via CometAPI pour une intégration sans effort. Expérimentez ses forces en codage et vision – les résultats parlent d’eux-mêmes.
