TL;DR: Innerhalb von rund drei Wochen im Juli 2026 erschienen sechs große Modellreleases: OpenAIs dreistufige GPT-5.6-Familie (Sol/Terra/Luna), Googles Gemini 3.6 Flash, xAIs Grok 4.5, Moonshot AIs Kimi K3, Anthropics Claude Opus 5 und Zhipus GLM-5.2. Keines ist universell die beste Wahl. Die praktische Entscheidung hängt von Tiefe des Reasonings, Coding-Leistung, Kosten pro Token, Kontextanforderungen und davon ab, ob der Einsatz mit offenen Gewichten relevant ist. Dieser Vergleich nutzt aktuelle offizielle Anbieterinformationen und CometAPI-Listings; Benchmark-Angaben sind mit Quelle gekennzeichnet statt als ein einziges universelles Ranking behandelt zu werden.
Wichtigste Erkenntnisse:
- GPT-5.6 ist nicht ein Modell — es sind drei (Sol, Terra, Luna) zu drei unterschiedlichen Preispunkten, und die falsche Stufe zu wählen ist ein größerer Kostenfehler als die falsche Modellfamilie insgesamt zu wählen.
- Gemini 3.6 Flash und GLM-5.2 veröffentlichen beide ein Kontextfenster von 1.000.000 Tokens; Kimi K3 erreicht diesen Wert ebenfalls — die Kontextgröße ist bei dieser Modellgeneration kein Differenzierungsmerkmal mehr.
- GLM-5.2 und Kimi K3 unterstützen beide den Einsatz mit offenen Gewichten, nutzen jedoch nicht dieselbe Lizenz. GLM-5.2 steht unter der MIT-Lizenz; Kimi K3 verwendet die separate Kimi K3 License, deren kommerzielle Bedingungen vor dem Self-Hosting oder dem Angebot eines Model-as-a-Service geprüft werden sollten.
- Claude Opus 5 ist offiziell veröffentlicht. Anthropic kündigte es am 24. Juli 2026 mit einem Kontextfenster von 1 Mio. Tokens, bis zu 128K synchronem Output und offiziellen Preisen von $5 pro Mio. Input-Tokens und $25 pro Mio. Output-Tokens an; CometAPI listet es derzeit mit $4/$20.
Was diesen Monat tatsächlich ausgeliefert wurde
Der Juli 2026 war ein ungewöhnlich dichter Monat für Frontier- und Near-Frontier-Modelle. In etwa drei Wochen veröffentlichte OpenAI die GPT-5.6-Familie (Jul 9), xAI brachte Grok 4.5 heraus (Jul 8), Moonshot AI veröffentlichte Kimi K3 (Jul 16), Google brachte Gemini 3.6 Flash (Jul 21) und Anthropic lancierte offiziell Claude Opus 5 (Jul 24). Zhipus GLM-5.2 kam etwas früher im Juni, aber sein 1M-Token-Kontext und die MIT-lizenzierte offene Veröffentlichung machen es für dieselbe Kauf- und Deployment-Entscheidung relevant.
Die praktische Frage für alle, die auf diesen Modellen aufbauen, ist nicht, welches im Abstrakten das beste ist, sondern welche bestätigte Option zu einer konkreten Aufgabe passt. Die sechs unterscheiden sich spürbar bei Kosten, Kontext, Coding-Verhalten, Lizenzierung und Deployment-Flexibilität.
Preise und Spezifikationen im direkten Vergleich
Alle untenstehenden Preise gelten pro eine Million Tokens. Wenn ein Modell mehrere Stufen hat, ist jede separat aufgeführt.
| Modell | Input | Output | Kontextfenster | Lizenz | Veröffentlichung |
|---|---|---|---|---|---|
| GPT-5.6 Sol | $5.00 | $30.00 | Nicht öffentlich spezifiziert | Proprietär | Jul 9, 2026 |
| GPT-5.6 Terra | $2.50 | $15.00 | Nicht öffentlich spezifiziert | Proprietär | Jul 9, 2026 |
| GPT-5.6 Luna | $1.00 | $6.00 | Nicht öffentlich spezifiziert | Proprietär | Jul 9, 2026 |
| Grok 4.5 | $2.00 | $4.00 | Nicht öffentlich spezifiziert | Proprietär | Jul 8, 2026 |
| Kimi K3 | $3.00 | $15.00 | 1,048,576 Tokens | Offene Gewichte (Kimi K3 License) | Jul 16, 2026 |
| Gemini 3.6 Flash | $1.50 | $7.50 | 1,048,576 Tokens (65,536 Output) | Proprietär | Jul 21, 2026 |
| GLM-5.2 | $1.40 | $4.41 | 1,000,000 Tokens | Offen (MIT-Lizenz) | Jun 13, 2026 |
| Claude Opus 5 | $5.00 | $25.00 | 1,000,000 Tokens (128K Output) | Proprietär | Jul 24, 2026 |
*Offizielle Anbieterpreise oben; eine einheitliche API mit Standardrabatt würde jeden dieser Preise proportional senken — der Punkt der Tabelle ist die relative Lücke zwischen den Modellen, nicht der Checkout-Preis eines bestimmten Anbieters.
Einige Dinge stechen aus der Preis- und Spezifikationstabelle heraus. Sol, die höchste GPT-5.6-Stufe, ist für Frontier-Reasoning und agentische Arbeit statt für den Alltag bepreist, während Grok 4.5 beim Outputpreis vergleichsweise niedrig ist für seine Positionierung. GLM-5.2 hat den niedrigsten ausgewiesenen Outputpreis in dieser Gruppe und nutzt die permissive MIT-Lizenz. Kimi K3 stellt ebenfalls herunterladbare Gewichte und einen 1M-Token-Kontext bereit, jedoch unter der separaten Kimi K3 License statt MIT. Gemini 3.6 Flash, Kimi K3, GLM-5.2 und Claude Opus 5 veröffentlichen alle ungefähr 1M-Token-Kontextfenster, sodass die Kontextkapazität allein nicht mehr ausreicht, um zwischen ihnen zu wählen. Die von CometAPI gelisteten Tarife liegen im Allgemeinen unter den Listenpreisen der Anbieter, aber die Bewertung auf Workload-Ebene bleibt nützlicher als der isolierte Vergleich von Tokenpreisen.
Wofür die einzelnen Modelle tatsächlich getunt sind
GPT-5.6 Sol ist für Frontier-Reasoning, agentisches Coding und langfristige technische Arbeiten positioniert — es unterstützt einen "Max Reasoning Effort"-Modus und einen "Ultra Mode", der Sub-Agenten parallel einsetzt. Angesichts der Preisdifferenz zu Terra und Luna ist dies die Stufe für harte, mehrstufige Probleme, nicht für Routineaufgaben.
GPT-5.6 Terra ist die ausgewogene Mittelstufe — alltägliche Produktivität, Dokumentation, Coding-Support und Business-Automatisierung. Für die meisten Anwendungs-Backends, die nicht spezifisch Sols Reasoning-Tiefe benötigen, ist Terra die vertretbarere Standardeinstellung.
GPT-5.6 Luna zielt auf leichte, hochvolumige Nutzung: Klassifikation, Customer-Support-Flows, Onboarding, wiederholte Inhaltserstellung. Mit $1.00/$6.00 pro Mio. Tokens (vor einem etwaigen Gateway-Rabatt) ist es genau für diese Art von hohem Aufrufvolumen bei geringer Komplexität bepreist — und es unterstützt außerdem eine Cached-Input-Bepreisung mit 90% Rabatt auf den Standard-Inputpreis, was hier mehr ins Gewicht fällt als bei den höheren Stufen, da hochvolumige Workloads tendenziell repetitiv sind.
Grok 4.5 veröffentlicht keine ausgewiesene Spezialisierung wie die GPT-5.6-Stufen, aber seine Bepreisung positioniert es zwischen einer Budget- und Mittelklasse-Option — eine direkte Benchmark-Gegenüberstellung mit Terra oder Kimi K3 für einen spezifischen Workload ist sinnvoller, als allein aus dem Preis auf die Positionierung zu schließen.
Kimi K3 ist ein Mixture-of-Experts-Modell mit 2,8 Billionen Parametern, ausgelegt für langfristiges Coding, multimodale Wissensarbeit sowie umfangreiche Dokument- oder Repository-Analysen innerhalb eines 1M-Token-Kontexts. Moonshot AI hat die vollständigen Gewichte veröffentlicht, sodass Self-Hosting möglich ist, die Veröffentlichung erfolgt jedoch unter der Kimi K3 License, die kommerzielle Bedingungen enthält, die sich von einer Standard-MIT-Veröffentlichung unterscheiden.
Gemini 3.6 Flash ist Googles effizienzfokussiertes Release: Es wird ausdrücklich als inkrementelle, kosten- und latenzoptimierte Weiterführung von 3.5 Flash statt als neues Frontier-Modell gerahmt, mit realen Zugewinnen bei Coding- und agentischen Benchmarks sowie einem niedrigeren Outputpreis pro Token als sein Vorgänger. Es ist die Wahl für agentische Workloads, bei denen Token-Effizienz und Kosten pro erledigter Aufgabe ebenso wichtig sind wie die reine Fähigkeit.
GLM-5.2 ist die offener lizenzierte Option in diesem Vergleich. Z.ai veröffentlichte es unter der MIT-Lizenz mit einem 1M-Token-Kontext und explizitem Schwerpunkt auf langfristigem Coding, Tool-Nutzung und anpassbarem Denkaufwand. Teams können über eine API darauf zugreifen oder die veröffentlichten Gewichte lokal betreiben — abhängig von ihrer eigenen Infrastruktur und Evaluierungsanforderungen.
Vergleich der Coding-Fähigkeiten
Die sechs Releases zielen auf unterschiedliche Engineering-Muster, daher lässt sich die Coding-Fähigkeit am besten als Workload-Fit statt als einzelnes Ranking verstehen.
- Claude Opus 5 ist hier die stärkste Wahl für schwieriges Debugging, Root-Cause-Analysen, große Refactorings und langlaufende Software-Agenten; Anthropic hebt stärkeres Verifizieren und Iterationsverhalten hervor.
- GPT-5.6 Sol, Terra und Luna bieten einen gestuften Pfad von komplexem Coding und Reasoning über ausgewogene Entwicklungsarbeit bis hin zu hochvolumiger Codeunterstützung.
- Gemini 3.6 Flash ist für schnelle agentische Coding-Loops getunt, bei denen Latenz und Kosten pro Iteration wichtig sind.
- Kimi K3 ist auf langfristiges Coding über sehr große Repositories ausgelegt, mit 1M-Token-Kontext und herunterladbaren Gewichten.
- GLM-5.2 kombiniert langfristiges Coding, Tool-Nutzung, anpassbaren Denkaufwand und MIT-lizenziertes lokales Deployment.
- Grok 4.5 sollte als Kandidat für eine direkte Evaluierung gegenüber den anderen behandelt werden, da seine offizielle Positionierung nicht dieselbe Coding-Spezialisierungsaufteilung wie die gestaffelte GPT-Familie bietet.
Die Abwägung beim so häufigen Vergleichen (und Wechseln) von Modellen
Das ist kein Plädoyer dafür, jeder neuen Veröffentlichung hinterherzulaufen. Produktions-Workloads bei jedem Release auf ein neues Modell umzustellen, hat reale Kosten: Prompts neu testen, Output-Qualität neu validieren und die Kosten-pro-Aufgabe-Mathematik gegen den tatsächlichen Traffic neu prüfen, nicht gegen die synthetische eines Benchmarks. Eine einheitliche API entfernt diese Evaluierungsarbeit nicht, aber sie entfernt den Overhead separater Accounts und separater Abrechnungen für die tatsächliche Durchführung des Vergleichs — die Möglichkeit, GPT-5.6 Terra, Gemini 3.6 Flash, Kimi K3 und GLM-5.2 über dieselbe Request-Form und eine Rechnung aufzurufen, macht es realistisch, mehr als einen Kandidaten vor der Festlegung tatsächlich zu testen, statt standardmäßig bei dem Anbieter zu bleiben, für den man bereits einen Key hatte.
Das ist ein echter Vorteil, aber keine vollständige Lösung — es ersetzt nicht das Lesen der jeweiligen Modelldokumentation und macht eine Modellwahl nicht frei von den oben beschriebenen Wechselkosten. Es senkt die Kosten dafür, herauszufinden, welches Modell für einen bestimmten Workload tatsächlich richtig ist — was eine andere (und ehrlichere) Aussage ist als „dieses Modell ist das beste“.
FAQ
Welches ist das beste KI-Modell, das im Juli 2026 veröffentlicht wurde? Es gibt keine einzige beste Antwort. GPT-5.6 Sol und Claude Opus 5 zielen auf anspruchsvolles Reasoning und Coding; Gemini 3.6 Flash betont effiziente agentische Loops; Kimi K3 kombiniert langen Kontext mit offenen Gewichten; und GLM-5.2 kombiniert langfristige Fähigkeiten mit einer MIT-Lizenz. Die richtige Wahl hängt vom Workload und den Deployment-Bedingungen ab.
Ist GPT-5.6 ein Modell oder mehrere? Drei: Sol (Flaggschiff, Frontier-Reasoning), Terra (ausgewogen, alltägliche Nutzung) und Luna (schnell und kostengünstig, hochvolumige Aufgaben) — jeweils separat bepreist, von $0.80/$4.80 pro Mio. Tokens für Luna bis zu $4.00/$24.00 für Sol.
Ist Claude Opus 5 offiziell veröffentlicht? Ja. Anthropic kündigte Claude Opus 5 am 24. Juli 2026 an. Die offizielle Veröffentlichung beschreibt ein Kontextfenster von 1 Mio. Tokens und positioniert das Modell für komplexes agentisches Coding und Wissensarbeit; die offiziellen API-Preise betragen $5 pro Mio. Input-Tokens und $25 pro Mio. Output-Tokens.
Welches dieser Modelle ist im großen Maßstab am günstigsten zu betreiben? Nach den in der Tabelle aufgeführten Anbieter-Outputpreisen ist GLM-5.2 die günstigste Option und unter der MIT-Lizenz verfügbar. Kimi K3 bietet ebenfalls offene Gewichte, aber seine separate Kimi K3 License und die deutlich größere Modellausprägung verändern die Self-Hosting-Ökonomie. GPT-5.6 Luna ist die günstigste proprietäre, nur per API zugängliche Option in diesem Vergleich.
Muss ich ein Modell auswählen und mich festlegen, oder kann ich mehrere testen? Mehr als eines gegen die eigenen Prompts und den eigenen Traffic zu testen, lohnt sich in der Regel vor der Produktionsfreigabe — eine einheitliche API (CometAPI unter anderen) macht das konkret günstiger, da sie den Overhead separater Accounts für den Vergleich entfernt, ersetzt jedoch nicht das Lesen der jeweiligen Modelldokumentation.
Fazit
Die Veröffentlichungswelle im Juli 2026 hat keinen klaren Gewinner hervorgebracht. Sie brachte sechs bestätigte Optionen, die unterschiedlich zwischen Reasoning-Tiefe, Coding-Performance, Tokenkosten, Kontext und Lizenzierung abwägen. GPT-5.6 Sol und Claude Opus 5 zielen auf die schwierigste Reasoning- und Software-Engineering-Arbeit; Gemini 3.6 Flash und GPT-5.6 Luna betonen Effizienz; Kimi K3 bringt offene Gewichte und einen 1M-Token-multimodalen Kontext unter eigener Lizenz; und GLM-5.2 bietet eine 1M-Token-, MIT-lizenzierte Alternative. Alle sind über CometAPI mit einem Key zugänglich, was kontrolliertes Testen erleichtert, aber die Modellauswahl sollte weiterhin auf den Prompts, Tools, Latenz-Zielen und Erfolgskriterien des tatsächlichen Workloads basieren.
