Caractéristiques techniques de Kimi k2.5
| Élément | Valeur / remarques |
|---|---|
| Nom du modèle / éditeur | Kimi-K2.5 (v1.0) — Moonshot AI (poids ouverts). |
| Famille d’architecture | Mixture-of-Experts (MoE), modèle de raisonnement hybride (MoE de style DeepSeek). |
| Paramètres (total / actifs) | ≈ 1 trillion de paramètres au total; ~32B actifs par jeton (384 experts, 8 sélectionnés par jeton signalés). |
| Modalités (entrée / sortie) | Entrée : texte, images, vidéo (multimodal). Sortie : principalement du texte (traces de raisonnement riches), éventuellement des appels d’outils structurés / sorties multi‑étapes. |
| Fenêtre de contexte | 256k jetons |
| Données d’entraînement | Pré‑entraînement continu sur ~15 trillion de jetons mixtes visuel + texte (déclaré par l’éditeur). Libellés d’entraînement/composition du jeu de données : non divulgués. |
| Modes | Mode Thinking (renvoie des traces de raisonnement internes ; temp recommandée = 1.0) et mode Instant (pas de traces de raisonnement ; temp recommandée = 0.6). |
| Fonctionnalités d’agent | Agent Swarm / sous‑agents parallèles : l’orchestrateur peut engendrer jusqu’à 100 sous‑agents et exécuter un grand nombre d’appels d’outils (le fournisseur revendique jusqu’à ~1,500 appels d’outils ; l’exécution parallèle réduit le temps d’exécution). |
Qu’est-ce que Kimi K2.5 ?
Kimi K2.5 est le modèle de langage de grande taille phare à poids ouverts de Moonshot AI, conçu comme un système nativement multimodal et orienté agents, plutôt qu’un LLM texte‑seulement agrégé de composants additionnels. Il intègre le raisonnement linguistique, la compréhension visuelle et le traitement de long contexte dans une architecture unique, permettant des tâches complexes multi‑étapes impliquant documents, images, vidéos, outils et agents.
Il est conçu pour des workflows à long horizon augmentés par des outils (codage, recherche multi‑étapes, compréhension de documents/vidéos) et est livré avec deux modes d’interaction (Thinking et Instant) ainsi qu’une quantification INT4 native pour une inférence efficace.
Fonctionnalités clés de Kimi K2.5
- Raisonnement multimodal natif
La vision et le langage sont entraînés conjointement dès le pré‑entraînement. Kimi K2.5 peut raisonner à partir d’images, de captures d’écran, de schémas et de trames vidéo sans recourir à des adaptateurs de vision externes. - Fenêtre de contexte ultra‑longue (256K jetons)
Permet un raisonnement persistant sur des bases de code entières, de longs articles de recherche, des documents juridiques ou des conversations étendues de plusieurs heures sans troncature du contexte. - Modèle d’exécution Agent Swarm
Prend en charge la création et la coordination dynamiques de jusqu’à ~100 sous‑agents spécialisés, permettant la planification parallèle, l’utilisation d’outils et la décomposition des tâches pour des workflows complexes. - Multiples modes d’inférence
- Instant mode pour des réponses à faible latence
- Thinking mode pour un raisonnement approfondi multi‑étapes
- Agent / Swarm mode pour l’exécution autonome des tâches et l’orchestration
- Solide capacité de vision‑vers‑code
Capable de convertir des maquettes d’interface, des captures d’écran ou des démonstrations vidéo en code front‑end opérationnel, et de déboguer des logiciels à l’aide de contexte visuel. - Mise à l’échelle MoE efficace
L’architecture MoE n’active qu’un sous‑ensemble d’experts par jeton, offrant une capacité de l’ordre du trillion de paramètres avec un coût d’inférence maîtrisé par rapport aux modèles denses.
Performances de référence de Kimi K2.5
Résultats de benchmarks rapportés publiquement (principalement dans des scénarios axés sur le raisonnement) :
Benchmarks de raisonnement et de connaissances
| Benchmark | Kimi K2.5 | GPT-5.2 (xhigh) | Claude Opus 4.5 | Gemini 3 Pro |
|---|---|---|---|---|
| HLE-Full (with tools) | 50.2 | 45.5 | 43.2 | 45.8 |
| AIME 2025 | 96.1 | 100 | 92.8 | 95.0 |
| GPQA-Diamond | 87.6 | 92.4 | 87.0 | 91.9 |
| IMO-AnswerBench | 81.8 | 86.3 | 78.5 | 83.1 |
Benchmarks de vision et vidéo
| Benchmark | Kimi K2.5 | GPT-5.2 | Claude Opus 4.5 | Gemini 3 Pro |
|---|---|---|---|---|
| MMMU-Pro | 78.5 | 79.5* | 74.0 | 81.0 |
| MathVista (Mini) | 90.1 | 82.8* | 80.2* | 89.8* |
| VideoMMMU | 87.4 | 86.0 | — | 88.4 |
Les scores marqués d’un astérisque reflètent des différences de protocoles d’évaluation rapportées par les sources originales.
Dans l’ensemble, Kimi K2.5 démontre une forte compétitivité en raisonnement multimodal, tâches à long contexte et workflows de type agent, en particulier au‑delà des scénarios de questions‑réponses courtes.
Kimi K2.5 vs autres modèles de pointe
| Dimension | Kimi K2.5 | GPT-5.2 | Gemini 3 Pro |
|---|---|---|---|
| Multimodalité | Native (vision + texte) | Modules intégrés | Modules intégrés |
| Longueur de contexte | 256K jetons | Longue (limite exacte non divulguée) | Longue (<256K typique) |
| Orchestration d’agents | Essaim multi‑agents | Focalisé sur un seul agent | Focalisé sur un seul agent |
| Accès au modèle | Poids ouverts | Propriétaire | Propriétaire |
| Déploiement | Local / cloud / personnalisé | API uniquement | API uniquement |
Conseils de sélection du modèle :
- Choisissez Kimi K2.5 pour un déploiement à poids ouverts, la recherche, le raisonnement à long contexte ou des workflows d’agents complexes.
- Choisissez GPT-5.2 pour une intelligence générale de niveau production avec un écosystème d’outils robuste.
- Choisissez Gemini 3 Pro pour une intégration approfondie avec la suite de productivité et de recherche de Google.
Cas d’usage représentatifs
- Analyse de documents et de code à grande échelle
Traiter des dépôts complets, des corpus juridiques ou des archives de recherche dans une seule fenêtre de contexte. - Workflows d’ingénierie logicielle visuelle
Générer, refactoriser ou déboguer du code à partir de captures d’écran, de designs UI ou d’enregistrements d’interactions. - Pipelines d’agents autonomes
Exécuter des workflows de bout en bout impliquant planification, récupération, appels d’outils et synthèse via des essaims d’agents. - Automatisation des connaissances d’entreprise
Analyser des documents internes, des feuilles de calcul, des PDF et des présentations pour produire des rapports et des insights structurés. - Recherche et personnalisation de modèle
Le fine‑tuning, la recherche d’alignement et l’expérimentation sont facilités par les poids ouverts du modèle.
Limitations et considérations
- Exigences matérielles élevées : un déploiement en pleine précision nécessite une mémoire GPU substantielle ; l’usage en production s’appuie généralement sur la quantification (p. ex., INT4).
- Maturité d’Agent Swarm : les comportements multi‑agents avancés évoluent encore et peuvent nécessiter une conception d’orchestration soignée.
- Complexité de l’inférence : les performances optimales dépendent du moteur d’inférence, de la stratégie de quantification et de la configuration de routage.
Comment accéder à l’API Kimi k2.5 via CometAPI
Étape 1 : S’inscrire pour obtenir une clé API
Connectez-vous à cometapi.com. Si vous n’êtes pas encore utilisateur, veuillez d’abord vous inscrire. Connectez-vous à votre console CometAPI. Obtenez la clé API d’accès à l’interface. Cliquez sur « Add Token » dans la section API token du centre personnel, récupérez la clé de jeton : sk-xxxxx et soumettez.

Étape 2 : Envoyer des requêtes à l’API Kimi k2.5
Sélectionnez le « kimi-k2.5 » endpoint pour envoyer la requête API et définissez le corps de la requête. La méthode et le corps de la requête sont obtenus depuis la documentation API de notre site. Notre site fournit également un test Apifox pour votre commodité. Remplacez par votre clé CometAPI réelle depuis votre compte. L’URL de base est Chat Completions.
Insérez votre question ou votre demande dans le champ content — c’est à cela que le modèle répondra. Traitez la réponse de l’API pour obtenir la réponse générée.
Étape 3 : Récupérer et vérifier les résultats
Traitez la réponse de l’API pour obtenir la réponse générée. Après traitement, l’API répond avec l’état de la tâche et les données de sortie.