TLDR: Moonshot AI hat am 16. Juli 2026 Kimi K3 veröffentlicht – ein bahnbrechendes Open-Weights-Modell mit 2,8 Billionen Parametern (erstes in der 3T-Klasse) mit nativer Multimodalität, 1-Million-Token-Kontext und Frontier-Performance, die in Coding, agentischen Aufgaben, Frontend-Entwicklung und Wissensarbeit mit proprietären Top-Modellen wie Claude Fable 5 und GPT-5.6 Sol konkurriert oder diese übertrifft.
Zentrale Erkenntnisse
- Skalierung & Innovation: 2,8T Parameter, MoE mit 16/896 aktiven Experten, Kimi Delta Attention (KDA), Attention Residuals – ~2,5x Skalierungseffizienz gegenüber K2, Kimi K3 - Kimi API Platform
- Leistung: Artificial Analysis Intelligence Index ~57 (Top 4, vor Claude Opus 4.8), führend in Frontend Code Arena, stark auf Terminal-Bench (88,3%), BrowseComp (91,2%), GPQA-Diamond (93,5%). Insgesamt knapp hinter Fable 5/Sol, aber besser als die meisten anderen; #1 auf der Arena.ai Frontend Code Arena (1.679 Elo, vor Fable 5), Arena-Post auf X und Berichterstattung von Tom's Hardware.
- Fähigkeiten: Native Vision/Video, 1M Kontext für massive Repos/Codebasen, agentisches Coding, 3D-Reasoning, Video-Editing, Research-Dashboards.
- Zugang: Sofort über kimi.com, API (Modell kimi-k3, access guide); Open Weights bald. Moonshot hat neue Kimi K3-Abos vorübergehend nach einem Nachfrageschub pausiert. Einfache Integration über CometAPI.
- Mehrwert: Niedrigere Kosten pro Aufgabe (~$0,94 in einigen Evals), weniger Refusals, ideal für Coding-/Vision-Workflows.
Kimi K3 Tech Blog beschreibt Kimi K3 als „Open Frontier Intelligence, Kimi K3 markiert einen Wendepunkt in der Demokratisierung von KI. Während chinesische KI-Labore wie Moonshot trotz Rechenbeschränkungen die Grenzen verschieben, stellt dieses offene Modell die Dominanz geschlossener US-Frontiers infrage und befähigt Entwickler weltweit.“
Was ist Kimi K3? Ein offenes Modell der 3T-Klasse von Moonshot AI
Moonshot AI, ein in Peking ansässiges Startup, hat Kimi K3 am 16. Juli 2026 als sein Flaggschiff-Modell vorgestellt. Es wird ausdrücklich als das erste offene Modell in der rund 3-Billionen-Parameter-Klasse positioniert, mit insgesamt 2,8 Billionen Parametern in einer sparsamen Mixture-of-Experts-(MoE)-Architektur. Pro Token werden nur 16 von 896 Experten aktiviert, was massiven Maßstab mit Effizienz ausbalanciert.
Dies baut auf der Kimi K2-Serie (K2.5, K2.6 usw.) auf, die bereits für Coding und Multimodalität an Zugkraft gewonnen hat. K3 führt architektonische Innovationen ein: Kimi Delta Attention (KDA) und Attention Residuals (AttnRes) sowie Stable LatentMoE und quantisierungsbewusstes Training (MXFP4 Gewichte, MXFP8 Aktivierungen ab der SFT-Phase). Diese liefern ~2,5x bessere Skalierungseffizienz und bis zu 6,3x schnelleres Decoding im Vergleich zu den Vorgängern.
Key Specs ( Kimi K3 Technical Specifications):
- Parameter: Insgesamt 2,8T (sparse MoE).
- Kontextfenster: 1.048.576 Tokens (~1M).
- Modalitäten: Native Text- + Bild- + Videoverarbeitung; Textausgabe.
- Max. Ausgabe: Standard 131k Tokens, bis zur Kontextgrenze.
- Reasoning: Zum Start standardmäßig auf Max-Effort; niedrigere/höhere Modi folgen.
- Open Weights: Bis 27. Juli 2026 zugesagt (modifizierte MIT-ähnliche Lizenz, gemäß K2-Präzedenzfall).
K3 zielt auf Langfrist-Aufgaben ab — nicht nur schnelle Antworten, sondern das Abschließen komplexer Engineering-, Research- oder Agent-Workflows mit visuellem Feedback („Vision-in-the-Loop“). Demos umfassen den autonomen Aufbau eines GPU-Compilers (konkurrent zu Triton), Chipdesign auf einem 45-nm-Prozess und schnelle Astrophysik-Forschung.
Die Nachfrage hat die Kapazität bereits belastet
Die frühe Resonanz auf das Modell war so stark, dass sie die Kapazität unter Druck gesetzt hat. Moonshot postete auf X, dass die Nachfrage in den vorangegangenen 48 Stunden nahe an die aktuellen GPU-Grenzen gestoßen sei und dass neue Abonnements vorübergehend pausiert würden, während das Unternehmen Kapazitäten aufstockt. Business Insider berichtete über die gleiche Kapazitätspause und stellte fest, dass bestehende Abonnenten nicht betroffen waren.
Das ist für die Produktionsplanung relevant. Ein Modell kann exzellent sein und dennoch Verfügbarkeitsengpässen unterliegen, wenn die Nachfrage die Rechenressourcen übersteigt. Teams, die Kimi K3 evaluieren, sollten eine Abhängigkeit von einem einzelnen Anbieter vermeiden, Latenz und Fehlerraten überwachen und wo möglich Fallback-Routing über einen einheitlichen Anbieter wie CometAPI vorsehen.
Coding-Benchmarks: Wo Kimi K3 am stärksten wirkt
Kimi K3s Coding-Profil ist der Hauptgrund für die Aufmerksamkeit von Entwicklern. Es liegt auf Terminal-Bench 2.1 nahezu gleichauf mit GPT-5.6 Sol, übertrifft GPT-5.6 Sol und Claude Fable 5 bei Program Bench und führt GPT-5.6 Sol mit einem spürbaren Vorsprung bei FrontierSWE. Es übertrifft die verglichenen Modelle auch bei SWE Marathon in der OpenLM-Tabelle.
Das Arena-Frontend-Ergebnis liefert ein weiteres praktisches Signal. Arena meldete Kimi K3 mit 1.679 Punkten auf der Frontend Code Arena, vor Claude Fable 5. Diese Benchmark ist wichtig, da Frontend-Arbeit oft nach menschlicher Präferenz und nicht nur nach Unit-Tests beurteilt wird. Ein Coding-Assistent, der aus einem Prompt sauberes, visuell kohärentes UI erzeugen kann, ist für Produktteams, Agenturen, SaaS-Anbieter und interne Tools wertvoll.
Gesamt-Leaderboards
- Artificial Analysis AI Leaderboard: Debütierte auf #3. Intelligence-Index-Werte positionieren es wettbewerbsfähig (z. B. ~57,1 in einigen Evals).
- Private Long-Horizon Knowledge Work Eval: Elo 1547 (+732 gegenüber K2.6), nur hinter Fable 5.
Coding & agentische Benchmarks (selbst berichtet & unabhängig)
K3 glänzt hier und nutzt Maßstab und Architektur für anhaltende agentische Performance.
- Frontend Code Arena (Arena.ai): #1 mit 1.679 Punkten, schlägt Fable 5 und GPT-5.6 Sol. Überzeugt bei blinder Entwicklerpräferenz für Web-Dev.
- DeepSWE: 67,3–67,5 (stark, mit KimiCode-Harness).
- Program Bench: #1 mit 77,8.
- SWE Marathon: #1 mit 42,0 (einige Harnesses).
- Terminal-Bench 2.1: Wettbewerbsfähig, nahe GPT-5.6 Sol.
Vision & Multimodal
Native Ausbildung (nicht nachträglich angebaut) liefert solide Ergebnisse:
- MMMU-Pro: 81,6%
- MathVision: Wettbewerbsfähig/hohe 90er in einigen Berichten.
- OmniDocBench: 91,1% (führend).
Unterstützt Screenshots, Diagramme, Video für Closed-Loop-Aufgaben wie UI-Verfeinerung oder Game-Dev.
Vergleichstabelle: Kimi K3 vs. führende Modelle (Annäherungswerte/zusammengeführt aus Berichten; Max Effort, wo angegeben)
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Hinweise/Quelle |
|---|---|---|---|---|
| Frontend Code Arena | 1.679 (#1) | Niedriger | Niedriger | Arena.ai |
| DeepSWE | 67,3–67,5 | Wettbewerbsfähig | - | Moonshot/KimiCode |
| Program Bench | 77,8 (#1) | - | Nahe dran | Vals.ai |
| Intelligence Index (AA) | ~57,1 | ~59,9 | ~58,9 | Artificial Analysis |
| Long-Horizon Elo | 1547 | Höher | - | Intern, Moonshot |
| Kosten pro Aufgabe (Evals) | ~$0,94 | Höher | Höher | Unabhängig |
Data sourced from Technischer Blog von Moonshot, unabhängigen Leaderboards und Analysen. Ergebnisse variieren je nach Harness/Effort; stets den neuesten Stand prüfen.
K3 zeigt weniger Refusals bei sensiblen Themen und hohe Konsistenz in agentischen Flows. Unabhängige Tests (z. B. YouTube-Evals, Vals AI) bestätigen es als eines der stärksten offenen Modelle für Real-World-Coding.
Was kann Kimi K3? Fähigkeiten in Coding, Vision und darüber hinaus
Coding & agentisches Engineering
K3 hält lange Sessions mit minimaler Aufsicht durch: navigiert durch massive Repos, nutzt Tools, debuggt via Screenshots („Vision-in-the-Loop“).
Beispiele:
- Kernel-Optimierung & Compiler-Entwicklung: Baute MiniTriton (Triton-ähnlicher Compiler) von Grund auf, konkurriert mit optimierten Stacks. Optimierte GPU-Kernel konkurrenzfähig zu Fable 5.
- Game-Dev: Macht aus Konzepten/Bildern/Videos spielbare 3D-/Multiplayer-Erlebnisse mit iterativer Verfeinerung.
- Chipdesign: Autonomer 48-Stunden-Run zum Design eines Nano-Modell-Chips.
- Frontend: Führt Leaderboards für Web-Apps, Full-Stack-Aufgaben an.
Vision & Multimodal
Native Bild-/Videokompetenz ermöglicht:
- Video-Editing: Schnitt den eigenen Teaser aus 56 Clips (Auswahl, Schnitte, Sync, Revisionen) – Stunden Arbeit in Minuten.
- 3D-Reasoning, Motion Graphics, interaktive Dashboards.
- „Vision-in-the-Loop“ für Code-Iteration via Screenshots.
Die Kimi-API-Dokumente zeigen Bildeingabe über Base64-Data-URLs und Videoeingabe über hochgeladene Dateien, referenziert via ms://. Es wird auch darauf hingewiesen, dass öffentliche Bild-URLs im Vision-Input nicht unterstützt werden, daher sollten Entwickler Base64 oder Referenzen auf hochgeladene Dateien senden und den Nachrichteninhalt als Array von Objekten strukturieren. Das ist ein wichtiges Implementierungsdetail: keine gemischte Bild- und Textnachricht in einen einzigen Plain-String serialisieren.
Wissensarbeit & Research
Für Unternehmen ist dies wertvoller als ein normaler Chatbot. Das Modell ist für „agentische“ Arbeit ausgelegt, bei der es einen Plan hält, Tools aufruft, Zwischenergebnisse verarbeitet und ein finales Artefakt erzeugt. Beispiele sind Marktrechercheberichte, Data-Cleaning-Assistenten, Compliance-Zusammenfassungen, Pflege von Customer-Support-Wissensbasen und interne Engineering-Copiloten.
- Erzeugt Consulting-taugliche Berichte, interaktive Visualisierungen, Dashboards (z. B. 42-jährige ASIC-Industrieanalyse aus Tausenden Quellen).
- Wissenschaftliche Pipelines: Reproduzierte astrophysikalische Relationen, analysierte Gravitationswellen mit Sub-Agenten.
- Widgets/Dashboards in Kimi Work für persistente, datengestützte Sichten.
K3 schlägt eine Brücke von Literatur zu ausführbarem Code und produziert effizient publikationsreife Outputs.
Kimi K3 vs. andere Frontier-Modelle: Praktischer Vergleich
| Modell | Bester Einsatz | Stärken | Zu beachten | CometAPI-Empfehlung |
|---|---|---|---|---|
| Kimi K3 | Long-Context-Coding, Wissensarbeit, Agenten, visuelles Reasoning | 2,8T MoE-Maßstab, 1M Kontext, starke Coding- und agentische Benchmarks, Open-Weights-Fahrplan | Kapazitätsdruck in der Launch-Woche, Sensitivität gegenüber Denk-Historie, Vision-Support je nach Route | Als Flaggschiff für Coding und Long-Context testen |
| GPT-5.6 Sol | Hartes Reasoning, Coding, Research, breite Produktion | Sehr starkes Benchmark-Profil und ausgereiftes Tooling | Höherer Preis auf vielen Routen | Als Vergleichs- und Eskalationsmodell nutzen |
| Claude Fable 5 | Schreiben, Coding, agentische Workflows, Präferenzaufgaben | Starke UX und breite Frontier-Performance | Höhere Kosten und mögliche Policy-Fallbacks bei manchen Aufgaben | Für user-facing Agents und schreiblastige Apps vergleichen |
| Claude Opus 4.8 | Tiefes Reasoning und zuverlässige professionelle Arbeit | Stabiles High-End-Assistentenverhalten | Älter als die neuesten Flaggschiff-Releases | Als Fallback oder Benchmark-Baseline behalten |
| GLM-5.2 | Kosten-sensitive Open-Model-Evaluierung | Wettbewerbsfähige Open-Model-Alternative | Schwächer in mehreren K3-Vergleichen | In Kosten/Performance-Routingtests einbeziehen |
Zugriff auf Kimi K3: Schritt-für-Schritt-Anleitung
- Web/App: Besuche kimi.com oder lade die Kimi-App (iOS/Android). Wähle K3 (K3 Max oder Swarm Max).
- Kimi Code: Terminal-/IDE-fokussiert für Entwickler. Ideal für Coding-Agenten.
- API-Zugang:
- Base URL: https://api.moonshot.ai/v1
- Model: kimi-k3
- API-Key unter platform.moonshot.ai/console beziehen.
- OpenAI-kompatibles SDK-Beispiel (Python):
Python
from openai import OpenAI
client = OpenAI(api_key="YOUR_KEY", base_url="https://api.moonshot.ai/v1")
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Your prompt"}]
)
Unterstützt Tools, JSON-Mode, Context Caching. Pricing: $3 Input, $15 Output pro M Tokens (Cache $0,30).
- Aggregatoren: CometAPI (cometapi.com) für einheitlichen Zugang zu Kimi K3 + 500+ Modellen mit einem Key, geringeren Kosten (20–40% Ersparnis) und einfachem Switching. Perfekt für Produktion — Drop-in OpenAI-kompatibel, niedrige Latenz.
- Self-Hosting: Nach dem 27. Juli Release der Gewichte auf Hugging Face. Mit hohem Hardwarebedarf rechnen (Supernodes, 64+ Beschleuniger empfohlen). Community-Tools wie vLLM folgen.
CometAPI-Empfehlung: Kimi K3 über CometAPI integrieren, um mehrere Keys/Abrechnungen zu vermeiden. Parallel zu Claude/GPT für A/B testen, Kosten optimieren und zuverlässig skalieren. Das Dashboard verfolgt die Nutzung über Modelle hinweg — ideal zur Überwachung von K3-Experimenten. Anmeldung auf cometapi.com für Free Credits und einheitlichen Zugang.
Fazit
Kimi K3 ist eines der wichtigsten Modell-Releases des Jahres 2026 bislang. Es kombiniert riesigen Maßstab, eine ernsthafte Open-Weights-Strategie, ein 1M-Token-Kontextfenster, native visuelle Verarbeitung und Benchmark-Ergebnisse, die es nahe an die Spitze aktueller Coding- und agentischer KI-Systeme bringen. Es ersetzt nicht die Notwendigkeit für GPT, Claude, Gemini, DeepSeek, Qwen oder andere Modelle, aber es bietet Entwicklern eine glaubwürdige neue Option für die schwierigsten Long-Context-Workflows.
Starte heute auf kimi.com oder über CometAPI für mühelose Integration. Experimentiere mit seinen Stärken in Coding und Vision – die Ergebnisse sprechen für sich.
