TLDR: Moonshot AI hat am 16. Juli 2026 Kimi K3 veröffentlicht – ein bahnbrechendes Open-Weights-Modell mit 2,8 Billionen Parametern (erstes in der 3T-Klasse) mit nativer Multimodalität, 1-Million-Token-Kontext und Frontier-Leistung, die in Coding, agentischen Aufgaben, Frontend-Entwicklung und Wissensarbeit mit proprietären Topmodellen wie Claude Fable 5 und GPT-5.6 Sol konkurriert oder diese übertrifft.
Zentrale Erkenntnisse
- Skalierung & Innovation: 2,8T Parameter, MoE mit 16/896 aktiven Experten, Kimi Delta Attention (KDA), Attention Residuals – ~2,5x Skalierungseffizienz gegenüber K2, Kimi K3 - Kimi API Platform
- Leistung: Artificial Analysis Intelligence Index ~57 (Top 4, vor Claude Opus 4.8), führt die Frontend-Code Arena, stark auf Terminal-Bench (88,3%), BrowseComp (91,2%), GPQA-Diamond (93,5%). Insgesamt knapp hinter Fable 5/Sol, aber besser als die meisten anderen; #1 auf Arena.ai Frontend Code Arena (1.679 Elo, vor Fable 5), Arena-Posting auf X und Bericht von Tom’s Hardware.
- Fähigkeiten: Native Vision/Video, 1M-Kontext für riesige Repos/Codebasen, agentisches Coding, 3D-Reasoning, Video-Editing, Research-Dashboards.
- Zugang: Sofort über kimi.com, API (Modell kimi-k3, Zugriffsanleitung); Open Weights in Kürze. Moonshot hat neue Kimi K3-Abos nach einem Nachfragesprung vorübergehend pausiert. Einfache Integration über CometAPI.
- Wert: Geringere Kosten pro Aufgabe (~$0.94 in manchen Evals), weniger Refusals, ideal für Coding/Vision-Workflows.
Im Kimi K3 Tech Blog wird Kimi K3 als „Open Frontier Intelligence“ beschrieben: „Kimi K3 markiert einen Wendepunkt in der Demokratisierung von KI. Während chinesische KI-Labore wie Moonshot trotz Compute-Beschränkungen die Grenzen verschieben, stellt dieses offene Modell die Dominanz geschlossener US-Frontier-Modelle in Frage und befähigt Entwickler weltweit.“
Was ist Kimi K3? Ein offenes Modell der 3T-Klasse von Moonshot AI
Moonshot AI, ein Start-up aus Peking, hat Kimi K3 am 16. Juli 2026 als sein Flaggschiffmodell gestartet. Es wird ausdrücklich als das erste offene Modell in der rund 3-Billionen-Parameter-Klasse positioniert – mit insgesamt 2,8 Billionen Parametern in einer sparsamen Mixture-of-Experts-(MoE)-Architektur. Pro Token werden nur 16 von 896 Experten aktiviert, was massive Skalierung mit Effizienz verbindet.
Darauf baut die Kimi K2-Serie (K2.5, K2.6 usw.) auf, die bereits für Coding und Multimodalität an Zugkraft gewonnen hat. K3 führt architektonische Neuerungen ein: Kimi Delta Attention (KDA) und Attention Residuals (AttnRes), plus Stable LatentMoE und quantisierungsbewusstes Training (MXFP4-Gewichte, MXFP8-Aktivierungen ab SFT-Phase). Das ergibt ~2,5x bessere Skalierungseffizienz und bis zu 6,3x schnelleres Decoding gegenüber den Vorgängern.
Wichtige Spezifikationen (Kimi K3 Technical Specifications):
- Parameter: insgesamt 2,8T (sparse MoE).
- Kontextfenster: 1.048.576 Token (~1M).
- Modalitäten: Native Text- + Bild- + Video-Verständnis; Textausgabe.
- Max. Ausgabe: Standard 131k Token, bis zur Kontextgrenze.
- Reasoning: Zum Start standardmäßig maximale Anstrengung; niedrigere/höhere Modi folgen.
- Open Weights: Bis 27. Juli 2026 versprochen (modifizierter MIT-Stil, nach K2-Präzedenz).
K3 zielt auf Langzeithorizont-Aufgaben – nicht nur schnelle Antworten, sondern die Fertigstellung komplexer Engineering-, Forschungs- oder Agent-Workflows mit visuellem Feedback („Vision-in-the-Loop“). Demos umfassen den autonomen Aufbau eines GPU-Compilers (vergleichbar mit Triton), Chipdesign im 45nm-Prozess und schnelle Astrophysikforschung.
Die Nachfrage hat die Kapazität bereits belastet
Die frühe Resonanz war so stark, dass sie die Kapazitäten strapazierte. Moonshot postete auf X, dass die Nachfrage der letzten 48 Stunden nahe an die aktuellen GPU-Grenzen gedrückt habe und neue Abos vorübergehend pausiert würden, während Kapazität ausgebaut wird. Business Insider berichtete von derselben Pause und merkte an, dass bestehende Abonnenten nicht betroffen seien.
Das ist wichtig für die Produktionsplanung. Ein Modell kann ausgezeichnet sein und dennoch Verfügbarkeitsprobleme bekommen, wenn die Nachfrage die Compute-Ressourcen übersteigt. Teams, die Kimi K3 evaluieren, sollten Single-Provider-Abhängigkeiten vermeiden, Latenz und Fehlerraten beobachten und nach Möglichkeit Fallback-Routing über einen einheitlichen Anbieter wie CometAPI nutzen.
Coding-Benchmarks: Wo Kimi K3 am stärksten wirkt
Kimis Coding-Profil ist der Hauptgrund für die Aufmerksamkeit der Entwickler. Es liegt auf Terminal-Bench 2.1 fast gleichauf mit GPT-5.6 Sol, übertrifft GPT-5.6 Sol und Claude Fable 5 knapp auf Program Bench und führt GPT-5.6 Sol mit spürbarem Abstand auf FrontierSWE. Auch auf der SWE Marathon in der OpenLM-Tabelle schneidet es besser ab als die verglichenen Modelle.
Das Arena-Frontend-Ergebnis liefert ein weiteres praktisches Signal. Arena meldete Kimi K3 mit 1679 Punkten auf der Frontend Code Arena, vor Claude Fable 5. Dieser Benchmark ist wichtig, weil Frontend-Arbeit oft nach menschlicher Präferenz beurteilt wird, nicht nur nach Unit-Tests. Ein Coding-Assistent, der aus einem Prompt saubere, visuell stimmige UIs erzeugen kann, ist für Produktteams, Agenturen, SaaS-Anbieter und interne Tools wertvoll.
Übergreifende Ranglisten
- Artificial Analysis AI Leaderboard: Debüt auf #3. Intelligence-Index-Werte positionieren es wettbewerbsfähig (z. B. ~57,1 in manchen Evals).
- Private Long-Horizon Knowledge Work Eval: Elo 1547 (+732 gegenüber K2.6), nur hinter Fable 5.
Coding- & Agentik-Benchmarks (selbst berichtet & unabhängig)
K3 glänzt hier und nutzt seine Skalierung und Architektur für anhaltende agentische Leistung.
- Frontend Code Arena (Arena.ai): #1 mit 1.679 Punkten, vor Fable 5 und GPT-5.6 Sol. Überzeugt in Blindtests der Entwicklerpräferenz für Webentwicklung.
- DeepSWE: 67,3–67,5 (stark, mit KimiCode-Harness).
- Program Bench: #1 mit 77,8.
- SWE Marathon: #1 mit 42,0 (manche Harnesses).
- Terminal-Bench 2.1: Wettbewerbsfähig, nahe GPT-5.6 Sol.
Vision & Multimodal
Nativem Training (nicht nachträglich aufgesetzt) verdankt K3 solide Ergebnisse:
- MMMU-Pro: 81,6%
- MathVision: Wettbewerbsfähig/hohe 90er in manchen Berichten.
- OmniDocBench: 91,1% (führt).
Unterstützt Screenshots, Diagramme, Video für Closed-Loop-Aufgaben wie UI-Verfeinerung oder Game-Dev.
Vergleichstabelle: Kimi K3 vs. führende Modelle (ungefähr/aus Berichten kompiliert; maximaler Effort, wo angegeben)
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Hinweise/Quelle |
|---|---|---|---|---|
| Frontend Code Arena | 1,679 (#1) | Niedriger | Niedriger | Arena.ai |
| DeepSWE | 67.3–67.5 | Wettbewerbsfähig | - | Moonshot/KimiCode |
| Program Bench | 77.8 (#1) | - | Nah dran | Vals.ai |
| Intelligence Index (AA) | ~57.1 | ~59.9 | ~58.9 | Artificial Analysis |
| Long-Horizon Elo | 1547 | Höher | - | Intern (Moonshot) |
| Kosten pro Aufgabe (Evals) | ~$0.94 | Höher | Höher | Unabhängig |
Datenquelle: Moonshots technischer Blog, unabhängige Leaderboards und Analysen. Ergebnisse variieren je nach Harness/Effort; stets den neuesten Stand verifizieren.
K3 zeigt weniger Refusals bei sensiblen Themen und starke Konsistenz in agentischen Flows. Unabhängige Tests (z. B. YouTube-Evals, Vals AI) bestätigen es als eines der stärksten offenen Modelle für praktisches Coding.
Was kann Kimi K3? Fähigkeiten in Coding, Vision und darüber hinaus
Coding & agentisches Engineering
K3 hält lange Sessions mit minimaler Aufsicht durch: navigiert riesige Repos, nutzt Tools, debuggt via Screenshots („Vision-in-the-Loop“).
Beispiele:
- Kernel-Optimierung & Compiler-Entwicklung: Baute MiniTriton (Triton-ähnlicher Compiler) von Grund auf, konkurriert mit optimierten Stacks. Optimierte GPU-Kernels auf Augenhöhe mit Fable 5.
- Game-Entwicklung: Wandelt Konzepte/Bilder/Videos mit iterativer Verfeinerung in spielbare 3D-/Multiplayer-Erlebnisse.
- Chipdesign: Autonomer 48-Stunden-Lauf zur Entwicklung eines Nano-Modell-Chips.
- Frontend: Führt Ranglisten für Web-Apps und Full-Stack-Aufgaben an.
Vision & Multimodal
Das native Verständnis von Bildern/Video ermöglicht:
- Video-Editing: Schnitt des eigenen Teasers aus 56 Clips (Auswahl, Schnitte, Sync, Revisionen) – Stundenarbeit in Minuten.
- 3D-Reasoning, Motion Graphics, interaktive Dashboards.
- „Vision-in-the-Loop“ für Code-Iteration via Screenshots.
Die Kimi-API-Dokumente zeigen Bildeingabe über Base64-Data-URLs und Videoeingabe über hochgeladene Dateien, referenziert über ms://. Zudem wird darauf hingewiesen, dass öffentliche Bild-URLs in der Vision-Eingabe nicht unterstützt werden. Entwickler sollten daher Base64 oder Referenzen auf hochgeladene Dateien senden und den Nachrichteninhalt als Array von Objekten strukturieren. Das ist ein wichtiges Implementierungsdetail: keine gemischten Bild- und Textnachrichten als eine einzige Plain-String-Nachricht serialisieren.
Wissensarbeit & Forschung
Für Unternehmen ist dies oft wertvoller als ein normaler Chatbot. Das Modell ist für „agentische“ Arbeit ausgelegt, bei der es einen Plan halten, Tools aufrufen, Zwischenergebnisse verarbeiten und ein finales Artefakt produzieren kann. Beispiele: Marktforschungsberichte, Data-Cleaning-Assistenten, Compliance-Zusammenfassungen, Pflege von Support-Wissensbasen und interne Engineering-Copilots.
- Erstellt Beratungsberichte in hoher Qualität, interaktive Visualisierungen, Dashboards (z. B. 42-jährige ASIC-Industrieanalyse aus Tausenden Quellen).
- Wissenschaftliche Pipelines: Reproduzierte Astrophysik-Relationen, analysierte Gravitationswellen mit Subagenten.
- Widgets/Dashboards in Kimi Work für persistente, datengesteuerte Ansichten.
K3 überbrückt Literatur und ausführbaren Code und liefert Publikationsqualität effizient.
Kimi K3 vs. andere Frontier-Modelle: Praktischer Vergleich
| Modell | Am besten geeignet | Stärken | Zu beachten | Empfehlung von CometAPI |
|---|---|---|---|---|
| Kimi K3 | Coding mit langem Kontext, Wissensarbeit, Agenten, visuelles Schlussfolgern | 2.8T-MoE-Skalierung, 1M-Kontext, starke Coding- und Agentik-Benchmarks, Open-Weight-Roadmap | Kapazitätsdruck in der Launch-Woche, Sensitivität gegenüber Denkverlauf, Vision-Support je nach Route | Als Flaggschiff für Coding und langen Kontext testen |
| GPT-5.6 Sol | Hartes Reasoning, Coding, Forschung, breite Produktion | Sehr starkes Gesamt-Benchmark-Profil und reifes Tooling | Höherer Preis in vielen Routen | Als Vergleichs- und Eskalationsmodell nutzen |
| Claude Fable 5 | Schreiben, Coding, agentische Workflows, präferenzbasierte Aufgaben | Starke UX und breite Frontier-Leistung | Höhere Kosten und mögliche Policy-Fallbacks bei manchen Aufgaben | Für nutzernahe Agenten und schreiblastige Apps vergleichen |
| Claude Opus 4.8 | Tiefes Reasoning und verlässliche professionelle Arbeit | Stabiles High-End-Assistant-Verhalten | Älter als die neuesten Flaggschiff-Releases | Als Fallback oder Benchmark-Baseline behalten |
| GLM-5.2 | Kostensensitive Open-Model-Evaluierung | Wettbewerbsfähige Open-Model-Alternative | Schwächer in mehreren K3-Vergleichen | In Kosten-/Leistungs-Routingtests einbeziehen |
So greifen Sie auf Kimi K3 zu: Schritt-für-Schritt-Anleitung
So greifen Sie auf Kimi K3 zu
1. Zugriff auf Kimi K3 über Kimi-Produkte
Der einfachste Nicht-Developer-Weg führt über Kimi’s Consumer- und Produktivitätstools: Kimi Web, App, Kimi Work und Kimi Code. So lässt sich das Modell schnell in Schreiben, Coding, Research und UI-orientiertem Verhalten testen, ohne zuerst eine Integration zu bauen. Die am 20. Juli gemeldete vorübergehende Abopause bedeutet, dass der Zugang variieren kann; prüfen Sie die aktuelle Kimi-Produktseite, bevor Sie einen Team-Rollout planen.
2. Zugriff auf Kimi K3 über die Kimi API Platform
Entwickler können Kimi K3 über die Kimi API Platform mit einem OpenAI-ähnlichen Client aufrufen. Moonshots Doku listet:
- Basis-URL:
https://api.moonshot.ai/v1 - Modell-ID:
kimi-k3 - Umgebungsvariable in Beispielen:
MOONSHOT_API_KEY - Python-SDK-Anforderung: OpenAI SDK 1.0 oder neuer
Basic-Python-Beispiel:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["MOONSHOT_API_KEY"],
base_url="https://api.moonshot.ai/v1",
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "Introduce Kimi K3 in one sentence."}
],
)
print(completion.choices[0].message.content)
Kimi K3 hat den Thinking-Modus immer aktiviert und unterstützt reasoning_effort-Werte low, high und max, mit max als Standard. Die API unterstützt Streaming, strukturierte Ausgaben mit strikt definiertem JSON-Schema, Partial Mode, Tool Calling, dynamisches Tool Loading, automatisches Kontext-Caching und offizielle Tool-Integrationen über Formula. Die Doku listet zudem wichtige Limits: max_completion_tokens ist standardmäßig 131.072 und kann bis 1.048.576 gesetzt werden; temperature und top-p sind fix; Entwickler sollten in Multi-Turn- und Tool-Call-Workflows die vollständige Assistant-Nachricht zurückgeben; und Websuche wird aktualisiert, daher kurzfristig nicht für Produktion empfohlen.
3. Zugriff auf Kimi K3 über CometAPI
Für viele Teams ist CometAPI der praktischste Weg, weil es eine einheitliche API-Schicht über viele Modellanbieter bietet. CometAPIs Kimi K3-Seite listet das Modell als live mit:
- Modell-ID:
kimi-k3 - Anbieter: Moonshot AI
- Kontextfenster: bis zu 1,000,000 Token
- CometAPI-Preis: $2.4 Input und $12 Output pro 1M Token
- Offiziell gelisteter Preis: $3 Input und $15 Output pro 1M Token
- Endpoint:
/v1/chat/completions - Basis-URL:
https://api.cometapi.com/v1
CometAPI-Python-Beispiel:
import os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["COMETAPI_KEY"],
base_url="https://api.cometapi.com/v1",
max_retries=0,
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "system",
"content": "You are a careful software engineering assistant.",
},
{
"role": "user",
"content": "Review this migration plan and identify the riskiest steps.",
},
],
max_completion_tokens=1024,
)
print(completion.choices[0].message.content)
Wenn Ihre Anwendung bereits das OpenAI SDK nutzt, empfiehlt der CometAPI-Quickstart, nur zwei Einstellungen zu ändern: base_url auf https://api.cometapi.com/v1 setzen und COMETAPI_KEY statt des bisherigen Provider-Keys nutzen. Danach die CometAPI-Modell-ID im Feld model übergeben.
4. Zugriff auf die offenen Kimi K3-Gewichte nach Veröffentlichung
Moonshot kündigt an, die vollständigen Kimi K3-Gewichte bis zum 27. Juli 2026 zu veröffentlichen. Dann können Forscher, Infrastrukturteams und fortgeschrittene Enterprise-Nutzer Self-Hosting, Optimierung oder private Deployments evaluieren. Für die meisten Unternehmen stellt sich die wirtschaftliche Frage: Das Modell ist offen, aber das Serving eines 2,8T-MoE-Systems erfordert ernsthafte GPU-Infrastruktur, Inferenz-Engineering und operatives Monitoring.
Fazit
Kimi K3 ist eines der wichtigsten Modell-Launches des Jahres 2026. Es kombiniert enorme Skalierung, eine ernsthafte Open-Weight-Strategie, ein 1M-Token-Kontextfenster, natives visuelles Verständnis und Benchmarks, die es nahe an die Spitze aktueller Coding- und agentischer KI-Systeme rücken. Es ersetzt nicht die Notwendigkeit von GPT, Claude, Gemini, DeepSeek, Qwen oder anderen Modellen, bietet Entwicklern aber eine glaubwürdige neue Option für die härtesten Long-Context-Workflows.
Starten Sie noch heute auf kimi.com oder über CometAPI für eine nahtlose Integration. Experimentieren Sie mit den Stärken in Coding und Vision – die Ergebnisse sprechen für sich.
