GPT-5.6 Luna price down 80%, Terra down 20% →

La vague de modèles de juillet 2026 : GPT-5.6, Gemini 3.6 Flash, Grok 4.5, Kimi K3, etc.

CometAPI
AnnaAug 1, 2026
La vague de modèles de juillet 2026 : GPT-5.6, Gemini 3.6 Flash, Grok 4.5, Kimi K3, etc.

TL;DR : Six lancements majeurs de modèles sont arrivés à environ trois semaines d’intervalle en juillet 2026 : la famille GPT-5.6 à trois niveaux d’OpenAI (Sol/Terra/Luna), Gemini 3.6 Flash de Google, Grok 4.5 de xAI, Kimi K3 de Moonshot AI, Claude Opus 5 d’Anthropic et GLM-5.2 de Zhipu. Aucun n’est universellement « le meilleur ». Le choix pragmatique dépend de la profondeur de raisonnement, des performances en code, du coût par token, des besoins de contexte et de l’importance d’un déploiement en poids ouverts. Cette comparaison s’appuie sur les informations officielles actuelles des fournisseurs et sur les listings CometAPI, avec des revendications de benchmarks étiquetées par source au lieu d’être traitées comme un classement universel unique.

Points clés :

  • GPT-5.6 n’est pas un seul modèle — c’est une famille de trois (Sol, Terra, Luna) à trois niveaux de prix, et choisir le mauvais niveau est une erreur de coût plus grave que de choisir la mauvaise famille de modèles.
  • Gemini 3.6 Flash et GLM-5.2 publient tous deux une fenêtre de contexte de 1,000,000 tokens ; Kimi K3 correspond également à ce chiffre — la taille du contexte a cessé d’être un élément de différenciation parmi les modèles de cette génération.
  • GLM-5.2 et Kimi K3 prennent en charge un déploiement en poids ouverts, mais n’utilisent pas la même licence. GLM-5.2 est publié sous licence MIT ; Kimi K3 utilise la licence Kimi K3 distincte, dont les conditions commerciales doivent être examinées avant un auto-hébergement ou une offre de modèle en tant que service.
  • Claude Opus 5 est officiellement sorti. Anthropic l’a annoncé le 24 juillet 2026 avec une fenêtre de contexte de 1M tokens, jusqu’à 128K de sortie synchrone, et un tarif officiel de 5 $ par million de tokens en entrée et 25 $ par million de tokens en sortie ; CometAPI l’affiche actuellement à 4 $/20 $.

Ce qui a réellement été livré ce mois-ci

Juillet 2026 a été un mois exceptionnellement dense pour les sorties de modèles de pointe et proches de la pointe. En environ trois semaines, OpenAI a livré la famille GPT-5.6 (9 juil.), xAI a publié Grok 4.5 (8 juil.), Moonshot AI a sorti Kimi K3 (16 juil.), Google a publié Gemini 3.6 Flash (21 juil.) et Anthropic a officiellement lancé Claude Opus 5 (24 juil.). GLM-5.2 de Zhipu est arrivé un peu plus tôt en juin, mais sa fenêtre de contexte de 1M tokens et sa publication sous licence MIT le rendent pertinent pour la même décision d’achat et de déploiement.

La question pratique pour quiconque s’appuie sur ces modèles n’est pas lequel est le meilleur en théorie, mais quelle option confirmée convient à un cas précis. Les six diffèrent sensiblement en coût, contexte, comportement de codage, licence et flexibilité de déploiement.

Tarifs et spécifications, côte à côte

Tous les prix ci-dessous sont par million de tokens. Lorsqu’un modèle a plusieurs niveaux, chacun est listé séparément.

ModèleEntréeSortieFenêtre de contexteLicenceDate de sortie
GPT-5.6 Sol$5.00$30.00Non spécifiée publiquementPropriétaireJul 9, 2026
GPT-5.6 Terra$2.50$15.00Non spécifiée publiquementPropriétaireJul 9, 2026
GPT-5.6 Luna$1.00$6.00Non spécifiée publiquementPropriétaireJul 9, 2026
Grok 4.5$2.00$4.00Non spécifiée publiquementPropriétaireJul 8, 2026
Kimi K3$3.00$15.001,048,576 tokensPoids ouverts (licence Kimi K3)Jul 16, 2026
Gemini 3.6 Flash$1.50$7.501,048,576 tokens (65,536 sortie)PropriétaireJul 21, 2026
GLM-5.2$1.40$4.411,000,000 tokensOuvert (licence MIT)Jun 13, 2026
Claude Opus 5$5.00$25.001,000,000 tokens (128K sortie)PropriétaireJul 24, 2026

*Les tarifs officiels des fournisseurs sont indiqués ci-dessus ; une API unifiée appliquant une remise standard les réduirait tous proportionnellement — l’objectif du tableau est l’écart relatif entre modèles, pas le prix d’un vendeur spécifique à l’achat.

Quelques points ressortent du tableau des tarifs et spécifications. Sol, le niveau supérieur de GPT-5.6, est tarifé pour le raisonnement de pointe et le travail agentique plutôt que pour un usage quotidien, tandis que le prix de sortie de Grok 4.5 est relativement bas compte tenu de son positionnement. GLM-5.2 affiche le prix de sortie le plus bas de ce groupe et utilise la licence MIT permissive. Kimi K3 propose également des poids téléchargeables et un contexte de 1M tokens, mais sous la licence Kimi K3 plutôt que MIT. Gemini 3.6 Flash, Kimi K3, GLM-5.2 et Claude Opus 5 publient tous une fenêtre de contexte d’environ 1M tokens, donc la capacité de contexte seule ne suffit plus pour les départager. Les tarifs listés par CometAPI sont généralement inférieurs aux prix catalogue des fournisseurs, mais l’évaluation au niveau des charges réelles reste plus utile que la comparaison des prix par token isolément.

Ce pour quoi chacun est réellement optimisé

GPT-5.6 Sol est positionné pour le raisonnement de pointe, le codage agentique et les travaux techniques de longue haleine — il prend en charge un mode « Max Reasoning Effort » et un « Ultra Mode » qui déploie des sous-agents en parallèle. C’est le niveau à privilégier pour les problèmes difficiles et multi-étapes, pas pour les tâches routinières, étant donné l’écart de prix avec Terra et Luna.

GPT-5.6 Terra est le niveau intermédiaire équilibré — productivité au quotidien, documentation, assistance au codage et automatisation métier. Pour la plupart des backends d’application qui n’ont pas spécifiquement besoin de la profondeur de raisonnement de Sol, Terra est le choix par défaut le plus défendable.

GPT-5.6 Luna vise des usages légers et à fort volume : classification, parcours de support client, onboarding, génération répétée de contenu. À $1.00/$6.00 par million de tokens (avant toute remise de passerelle), il est tarifé précisément pour ce type de charge volumétrique et peu complexe — et il prend aussi en charge une tarification des entrées mises en cache avec une remise de 90 % sur le tarif d’entrée standard, ce qui compte davantage ici que pour les niveaux supérieurs étant donné la nature répétitive de ces charges.

Grok 4.5 ne publie pas de spécialisation déclarée comme le font les niveaux de GPT-5.6, mais sa tarification le place entre une option économique et milieu de gamme — il vaut la peine d’être comparé directement à Terra ou Kimi K3 pour une charge spécifique plutôt que de déduire son positionnement du prix seul.

Kimi K3 est un modèle Mixture-of-Experts de 2,8 billions de paramètres conçu pour le codage de longue haleine, le travail de connaissance multimodal et l’analyse poussée de documents ou de dépôts au sein d’un contexte de 1M tokens. Moonshot AI a publié les poids complets, donc l’auto-hébergement est possible, mais la publication utilise la licence Kimi K3, qui inclut des conditions commerciales différentes d’une licence MIT standard.

Gemini 3.6 Flash est la version axée sur l’efficacité de Google : elle est explicitement présentée comme un suivi incrémental, optimisé en coût et latence, de 3.5 Flash plutôt qu’un nouveau modèle de pointe, avec de réels gains sur les benchmarks de codage et d’agenticité, ainsi qu’un prix par token de sortie inférieur à son prédécesseur. C’est le choix pour des charges agentiques où l’efficacité en tokens et le coût par tâche terminée comptent autant que la capacité brute.

GLM-5.2 est l’option ouverte sous licence plus permissive dans cette comparaison. Z.ai l’a publiée sous licence MIT avec un contexte de 1M tokens et un accent explicite sur le codage de longue haleine, l’utilisation d’outils et un effort de réflexion ajustable. Les équipes peuvent y accéder via une API ou exécuter les poids publiés en local, sous réserve de leur propre infrastructure et de leurs exigences d’évaluation.

Comparaison des capacités de codage

Les six sorties visent des schémas d’ingénierie différents, donc l’aptitude en codage s’appréhende mieux comme une adéquation à la charge plutôt qu’un classement unique.

  • Claude Opus 5 est le meilleur choix ici pour le débogage difficile, l’analyse des causes profondes, les refactorisations de grande ampleur et les agents logiciels longue durée ; Anthropic met en avant une meilleure vérification et itération.
  • GPT-5.6 Sol, Terra et Luna offrent une trajectoire par niveaux allant du codage et du raisonnement complexes au travail de développement équilibré et à l’assistance au code à grand volume.
  • Gemini 3.6 Flash est optimisé pour des boucles de codage agentiques rapides où la latence et le coût par itération comptent.
  • Kimi K3 est conçu pour le codage de longue haleine sur de très grands dépôts, avec un contexte de 1M tokens et des poids téléchargeables.
  • GLM-5.2 combine codage de longue haleine, utilisation d’outils, effort de réflexion ajustable et déploiement local sous licence MIT.
  • Grok 4.5 est à traiter comme un candidat à évaluer directement face aux autres, car son positionnement officiel ne fournit pas la même spécialisation en codage que la famille GPT par niveaux.

Le compromis des comparaisons (et des bascules) aussi fréquentes entre modèles

Il ne s’agit pas d’inciter à courir après chaque nouvelle sortie. Basculer des charges de production vers un nouveau modèle à chaque publication a des coûts bien réels : re-tester les prompts, re-valider la qualité de sortie et re-vérifier le coût par tâche par rapport à votre trafic réel, et non celui d’un benchmark synthétique. Une API unifiée ne supprime pas ce travail d’évaluation, mais elle supprime la charge de comptes séparés et de facturations séparées pour effectuer réellement la comparaison — pouvoir appeler GPT-5.6 Terra, Gemini 3.6 Flash, Kimi K3 et GLM-5.2 via la même forme de requête et une seule facture rend réaliste le test de plus d’un candidat avant de s’engager, plutôt que de se rabattre sur le fournisseur pour lequel vous aviez déjà une clé.

C’est un avantage réel, pas une solution complète — cela ne remplace pas la lecture de la documentation propre à chaque modèle, et cela ne rend pas le choix de modèle exempt des coûts de bascule décrits ci-dessus. Ce que cela fait, c’est réduire le coût pour découvrir quel modèle est réellement adapté à une charge donnée, ce qui est une affirmation différente (et plus honnête) que « ce modèle est le meilleur ».

FAQ

Quel est le meilleur modèle d’IA sorti en juillet 2026 ? Il n’y a pas de réponse unique. GPT-5.6 Sol et Claude Opus 5 visent le raisonnement exigeant et le travail de codage ; Gemini 3.6 Flash met l’accent sur des boucles agentiques efficientes ; Kimi K3 combine long contexte et poids ouverts ; et GLM-5.2 combine des capacités de longue haleine avec une licence MIT. Le bon choix dépend de la charge et des contraintes de déploiement.

GPT-5.6 est-il un seul modèle ou plusieurs ? Trois : Sol (vaisseau amiral, raisonnement de pointe), Terra (équilibré, usage quotidien) et Luna (rapide et peu coûteux, tâches à fort volume) — chacun tarifé séparément, de $0.80/$4.80 par million de tokens pour Luna jusqu’à $4.00/$24.00 pour Sol.

Claude Opus 5 est-il officiellement sorti ? Oui. Anthropic a annoncé Claude Opus 5 le 24 juillet 2026. La sortie officielle décrit une fenêtre de contexte de 1M tokens et positionne le modèle pour un codage agentique complexe et un travail de connaissance ; la tarification API officielle est de 5 $ par million de tokens en entrée et 25 $ par million de tokens en sortie.

Lequel de ces modèles est le moins cher à exploiter à l’échelle ? D’après les prix de sortie listés par les fournisseurs dans le tableau, GLM-5.2 est l’option la moins coûteuse et est disponible sous licence MIT. Kimi K3 propose aussi des poids ouverts, mais sa licence Kimi K3 distincte et l’empreinte de modèle beaucoup plus grande modifient l’économie de l’auto-hébergement. GPT-5.6 Luna est l’option propriétaire la moins chère, accessible uniquement via API, présentée ici.

Dois-je choisir un modèle et m’engager, ou puis-je en tester plusieurs ? Tester plus d’un modèle avec vos prompts et votre trafic réels vaut généralement le coût de mise en place avant d’engager du trafic de production — une API unifiée (CometAPI entre autres) rend cela spécifiquement moins cher, puisqu’elle supprime la charge de comptes séparés pour mener la comparaison, même si cela ne remplace pas la lecture de la documentation propre à chaque modèle.

Conclusion

La vague de sorties de juillet 2026 n’a pas produit un vainqueur clair. Elle a produit six options confirmées qui font des compromis différents en profondeur de raisonnement, performances de codage, coût en tokens, contexte et licences. GPT-5.6 Sol et Claude Opus 5 ciblent les travaux de raisonnement et d’ingénierie logicielle les plus difficiles ; Gemini 3.6 Flash et GPT-5.6 Luna mettent l’accent sur l’efficacité ; Kimi K3 apporte des poids ouverts et un contexte multimodal de 1M sous sa propre licence ; et GLM-5.2 offre une alternative à 1M tokens sous licence MIT. Toutes sont accessibles via CometAPI avec une seule clé, ce qui facilite les tests contrôlés, mais la sélection d’un modèle doit toujours se baser sur les prompts, les outils, les objectifs de latence et les critères de réussite de la charge réelle.

Prêt à réduire vos coûts de développement IA de 20 % ?

Démarrez gratuitement en quelques minutes. Crédits d'essai offerts. Aucune carte bancaire requise.

En savoir plus