TL;DR: DeepSeek V4 Pro ist DeepSeeks leistungsfähigstes V4-Modell für Reasoning, Coding, Langkontext-Analysen und Agenten-Workflows. Es ist ein Mixture-of-Experts-Modell mit 1,6 Billionen Gesamtparametern, 49 Milliarden aktiven Parametern, einem 1M-Token-Kontextfenster und einer maximalen Ausgabe von 384.000 Tokens, gemäß der V4-Veröffentlichungsankündigung von DeepSeek und der offiziellen Modelltabelle zur Preisgestaltung.
DeepSeeks eigene Basismodell-Ergebnisse setzen V4 Pro bei 90,1 auf MMLU, 73,5 auf MMLU-Pro, 76,8 auf HumanEval und 51,5 auf LongBench-V2. Unabhängige Tests sind nuancierter: Die Bewertung des U.S. Center for AI Standards and Innovation zeigte starke Ergebnisse in Mathematik und Naturwissenschaften, darunter 97 % auf OTIS-AIME-2025 und 90 % auf GPQA-Diamond, aber schwächere Leistungen bei zurückgehaltenen Tests zu Cyber, abstraktem Denken und Software Engineering.
Praktisches Fazit: Verwenden Sie DeepSeek V4 Pro, wenn anspruchsvolles Coding, Reasoning oder Langdokument-Aufgaben die etwa dreifachen, unzwischengespeicherten Tokenpreise gegenüber V4 Flash rechtfertigen. Starten Sie für volumenstarke Anwendungen mit V4 Flash und leiten Sie nur schwierige oder gescheiterte Aufgaben an V4 Pro weiter. Für Entwickler, die einfachen, kostengünstigen Multi-Model-Zugang suchen, bieten Plattformen wie CometAPI einen einheitlichen, OpenAI-kompatiblen Endpunkt für DeepSeek V4 Pro neben Hunderten anderer Modelle.
Zentrale Erkenntnisse
- Architektur & Größe: 1,6T Gesamt- / 49B aktive MoE-Parameter mit hybrider Compressed Sparse Attention (CSA) + Heavily Compressed Attention (HCA), wodurch FLOPs pro Token auf ~27 % und der KV-Cache auf ~10 % im Vergleich zu DeepSeek-V3.2 bei 1M-Kontext sinken.
- Kontext & Effizienz: Native 1M-Token-Kontext und bis zu 384K maximale Ausgabetokens, wodurch Langhorizont-Agenten und Analysen ganzer Codebasen praktisch werden.
- Benchmarks (V4-Pro-Max): 80,6 % SWE-bench Verified, 93,5 % LiveCodeBench, Codeforces-Rating 3206, 90,1 % GPQA Diamond, starke agentische Scores (z. B. MCPAtlas Public ~73,6). Offizielle DeepSeek-Preise sind $0,435/M uncached input tokens, $0,003625/M cached input tokens und $0,87/M output tokens.
- Das Modell ist textbasiert. Eine Copilot-Erweiterung kann Bilder über ein anderes Modell proxyen, macht V4 Pro jedoch nicht nativ multimodal.
- DeepSeek unterstützt OpenAI Chat Completions, seine Responses-API-Implementierung, eine Anthropic-kompatible Schnittstelle, JSON-Ausgabe, Tool-Aufrufe und Steuerung des Reasonings.
- CAISI maß bei V4 Pro 74 % auf SWE-bench Verified, 90 % auf GPQA Diamond und 97 % auf OTIS-AIME-2025, aber nur 44 % auf PortBench und 46 % auf ARC-AGI-2 semi-private.
Bestätigte Modellspezifikationen
| Spezifikation | DeepSeek V4 Pro |
|---|---|
| API-Modell-ID | deepseek-v4-pro |
| Aktuell dokumentierte Version | DeepSeek-V4-Pro-0813 |
| Architekturgröße | 1,6T Gesamtparameter; 49B aktiv |
| Kontextfenster | 1M Tokens |
| Maximale Ausgabe | 384K Tokens |
| Eingabemodalität | Text |
| Reasoning | Denk- und Nicht-Denk-Modi |
| Denkaufwand | hoch und für die offizielle Schnittstelle dokumentiert |
| Strukturierte Ausgabe | JSON-Ausgabe unterstützt |
| Agentenfunktionen | Tool-Aufrufe und Responses API unterstützt |
| API-Kompatibilität | OpenAI Chat Completions und Anthropic-kompatible API |
| Offene Gewichte | Yes |
| Standardkonto-Konkurrenz | 500 gleichzeitige V4-Pro-Anfragen |
Was ist DeepSeek V4 Pro?
DeepSeek V4 Pro (Modell-ID typischerweise deepseek-v4-pro) ist die leistungsstarke Stufe der DeepSeek-V4-Serie, entwickelt vom chinesischen AI-Labor DeepSeek. Es wurde erstmals als Vorschau am 24. April 2026 zusammen mit dem leichteren DeepSeek-V4-Flash veröffentlicht und ging Mitte August 2026 unter der Versionskennung DeepSeek-V4-Pro-0813 in die allgemeine Verfügbarkeit über.
Als Mixture-of-Experts-Modell aktiviert es pro Token nur einen Bruchteil seiner Gesamtparameter (49B von 1,6T). Diese Konstruktion, kombiniert mit architektonischen Innovationen in der Attention, liefert Spitzenintelligenz bei gleichzeitig effizienter Inferenz—insbesondere bei extremen Kontextlängen. Das Modell ist textbasiert (multimodale Fähigkeiten befinden sich in Entwicklung), mit MIT-Lizenz und als Open Weights auf Hugging Face verfügbar.
Kernpositionierung von DeepSeek: V4-Pro zielt auf erweiterte agentische Fähigkeiten, reiches Weltwissen (führend unter offenen Modellen, nur hinter bestimmten Gemini-Varianten) und erstklassiges Reasoning in Mathematik, MINT und Coding, das mit den besten Closed-Source-Systemen konkurriert.
Es unterstützt zwei Modi—Thinking (Chain-of-Thought / erweitertes Reasoning, in vielen Konfigurationen Standard) und Non-Thinking (schnellere Antworten)—sowie konfigurierbare Reasoning-Aufwandsstufen (einschließlich einer maximalen „V4-Pro-Max“-Einstellung). Die API-Kompatibilität umfasst sowohl OpenAI Chat Completions als auch das Anthropic-Messages-Format, plus Tool-Callings, strukturierte JSON-Ausgabe und Beta-Funktionen wie Fill-in-the-Middle (FIM) Completion (Non-Thinking-Modus) und Konversationspräfix-Fortsetzung.
DeepSeek V4 Pro Release-Status
Es gibt mehrere relevante Daten:
- 24. April 2026: DeepSeek kündigte die V4-Vorschau, Open Weights und API-Zugang für V4 Pro und V4 Flash an.
- 24. Juli 2026: DeepSeek entfernte die alten und API-Namen nach einer dreimonatigen Migrationsphase.
deepseek-chatdeepseek-reasoner - 13. August 2026: Der aktuelle Alias verweist auf die V4-Pro-0813-Modellversion, gemäß DeepSeeks Live-Modelltabelle.
deepseek-v4-pro
Wie funktioniert DeepSeek V4 Pro?
Im Kern ist V4 Pro ein Mixture-of-Experts-(MoE-)Modell mit 1,6 Billionen Gesamtparametern und 49 Milliarden aktivierten Parametern pro Vorwärtspass. Dieses Design liefert hohe Kapazität bei überschaubaren Inferenzkosten. Sowohl V4 Pro als auch V4 Flash unterstützen ein 1M-Token-Kontextfenster und bis zu 384.000 maximale Ausgabetokens. Die Modelle sind zum Start textbasiert (multimodale Fähigkeiten wurden in frühen Materialien als in Entwicklung erwähnt) und werden unter der permissiven MIT-Lizenz veröffentlicht, mit Open Weights auf Hugging Face.
Wichtige architektonische Innovationen umfassen:
- Hybrider Attention-Mechanismus: Kombiniert Compressed Sparse Attention (CSA) und Heavily Compressed Attention (HCA). Bei der 1M-Token-Einstellung benötigt DeepSeek-V4-Pro nur etwa 27 % der FLOPs pro Token und 10 % des KV-Cache-Speichers im Vergleich zu DeepSeek-V3.2. Dies macht millionenlange Kontexte zur Routine.
- Manifold-Constrained Hyper-Connections (mHC): Verbessert Residualverbindungen für bessere Trainingsstabilität und Signalpropagation.
- Muon-Optimizer: In der Vortrainingsphase verwendet, für schnellere Konvergenz und höhere Stabilität.
- Vortraining auf mehr als 32 Billionen hochwertigen Tokens, gefolgt von einer ausgefeilten Post-Training-Pipeline (domänenspezifisches SFT + RL, dann On-Policy-Distillation).
Diese Änderungen ermöglichen die routinemäßige Nutzung von 1M-Token-Kontexten für Langhorizont-Agenten, die Analyse kompletter Codebasen oder großer Dokumentensammlungen ohne die früheren Speicher- und Compute-Nachteile.
DeepSeek V4 Pro API-Preise
DeepSeek berechnet getrennt für Cache-Miss-Eingaben, Cache-Hit-Eingaben und generierte Ausgaben. Preise werden pro eine Million Tokens angegeben.
| Modell | Cache-Miss-Eingabe | Cache-Hit-Eingabe | Ausgabe | Kontext |
|---|---|---|---|---|
| DeepSeek V4 Pro | $0,435 | $0,003625 | $0,87 | 1M Tokens |
| DeepSeek V4 Flash | $0,14 | $0,0028 | $0,28 | 1M Tokens |
Dies sind die auf der offiziellen DeepSeek-API-Preisseite zum Zeitpunkt der Veröffentlichung angegebenen Sätze. DeepSeek weist dort darauf hin, dass es plant, die API-Preise insgesamt zu erhöhen, jedoch ohne einen endgültigen neuen Satz oder ein wirksames Datum anzugeben. Produktionsbudgets sollten Preise daher dynamisch auslesen und nicht in langfristige Prognosen hart codieren.
Realistische DeepSeek V4 Pro Kostenbeispiele
Die Grundformel lautet:
cost = uncached input × $0.435/M + cached input × $0.003625/M + output × $0.87/M
| Workload | Token-Annahmen | Ungefähre V4-Pro-Kosten |
|---|---|---|
| Kurze Coding-Anfrage | 10.000 Eingabe + 2.000 Ausgabe | $0,00609 |
| Analyse auf Repository-Ebene | 100.000 Eingabe + 20.000 Ausgabe | $0,0609 |
| Sehr lange Dokumentanalyse | 1M Eingabe + 100.000 Ausgabe | $0,522 |
| Zwischengespeicherte Analyse | 1M Cache-Hit-Eingabe + 100.000 Ausgabe | $0,090625 |
| 100.000 Produktionsaufrufe | 20.000 Eingabe + 4.000 Ausgabe pro Aufruf | $1.218 |
Zum Vergleich würde das letzte Szenario mit 100.000 Aufrufen ungefähr $392 auf V4 Flash kosten, sofern die gesamte Eingabe ein Cache-Miss ist. Das ist ein Unterschied von $826, was eine durchdachte Routing-Strategie wirtschaftlich bedeutsam macht, selbst wenn beide Modelle pro Aufruf günstig wirken.
Diese Beispiele sind Token-Kostenschätzungen, keine vollständigen Infrastruktur-Budgets. Sie schließen Wiederholungen, fehlgeschlagene Agenten-Zyklen, wiederholte Tool-Ergebnisse, Moderation, Vektorspeicher, Such-APIs, Observability sowie eventuelle Gebühren einer separaten Plattform aus.
Warum Cache-Hit-Preise wichtig sind
Der Cache-Hit-Eingabesatz von V4 Pro ist etwa 120-mal niedriger als der Cache-Miss-Eingabesatz. Die größten Einsparungen entstehen, wenn Anfragen wiederholt denselben Präfix verwenden—zum Beispiel:
- Ein stabiler Systemprompt und ein Richtlinienhandbuch
- Ein gemeinsam genutzter Repository-Snapshot
- Ein standardisiertes Tool-Schema
- Ein umfangreicher Produktkatalog
- Wiederholte Analyse desselben Vertrags oder Berichts
Caching macht generierte Ausgaben nicht günstiger. Eine lange Reasoning-Spur oder eine ausführliche Completion wird weiterhin zum Ausgabesatz berechnet. Entwickler sollten Eingabe-Cache-Status und Ausgabelänge getrennt überwachen, statt sich nur auf die durchschnittlichen Anfragekosten zu verlassen.
Zugang zu DeepSeek V4 Pro (einschließlich über CometAPI)
Zugriffsmethoden:
- Offizielle DeepSeek-API (
https://api.deepseek.com) — verwenden Sie das Modelldeepseek-v4-pro. - Open Weights auf Hugging Face für lokale oder private Bereitstellungen.
- Aggregatoren und Serverless-Plattformen (OpenRouter, Together, DeepInfra, etc.).
Empfehlung für CometAPI-Nutzer: CometAPI bietet einen bequemen Zugang zu DeepSeek V4 Pro (und V4 Flash) über einen einzigen OpenAI-kompatiblen Endpunkt (https://api.cometapi.com/v1). Sie profitieren von einheitlicher Abrechnung über 500+ Modelle, wettbewerbsfähigen Raten (oft mit plattformseitigen Einsparungen), Echtzeit-Nutzungsdashboards und null Codeänderungen über Basis-URL und Key hinaus beim Umstieg von OpenAI-SDKs. Das ist besonders nützlich für Indie-Entwickler und Teams, die V4 Pro gegen Claude, GPT, Gemini oder andere Modelle A/B-testen möchten, ohne mehrere Konten zu verwalten.
Wer sollte DeepSeek V4 Pro nutzen?
V4 Pro verdient einen ernsthaften Test für:
- Synthese großer Dokumente mit nachvollziehbaren Zitaten;
- Coding auf Repository-Skala und Code-Review;
- langlebige Agenten mit wiederholtem Kontext;
- Mathematik- und MINT-Unterstützung mit Verifikation;
- strukturierte Berichts- oder Dokumentgenerierung;
- Reasoning in hohem Volumen, bei dem direkte Tokenkosten ein Hauptfaktor sind;
- Teams mit Blick auf einen zukünftigen Open-Weight-Bereitstellungspfad.
V4 Flash kann die bessere Erstwahl für einfache Agentenaufgaben, Klassifikation, Extraktion, Routing oder latenzkritische Jobs sein. DeepSeek selbst sagt, dass Flash sich beim Reasoning an Pro annähert und es bei einfacheren Agentenbewertungen erreicht, während ein kleineres aktives Modell verwendet wird.
V4 Pro ist eine schwächere Voreinstellung, wenn native Bildverarbeitung zwingend ist, wenn eine Beschaffungsrichtlinie Abhängigkeiten im Vorschau-Status verbietet oder wenn die Organisation keine Evaluations- und Verifikationskontrollen aufbauen kann. Die offizielle GitHub-Copilot-Integrationsanleitung beschreibt V4 ausdrücklich als textbasiert; die Bildverarbeitung in dieser Erweiterung erfolgt durch ein separates Proxy-Modell.
DeepSeek V4 Pro vs V4 Flash
| Entscheidungsfaktor | V4 Pro | V4 Flash |
|---|---|---|
| Primäre Rolle | Hartes Reasoning, Coding, Agenten | Hochvolumen und latenzsensitives Arbeiten |
| Gesamt/aktive Parameter | 1,6T / 49B | 284B / 13B |
| Kontext | 1M | 1M |
| Maximale Ausgabe | 384K | 384K |
| Preis unzwischengespeicherte Eingabe | $0,435/M | $0,14/M |
| Ausgabepreis | $0,87/M | $0,28/M |
| Parallelität | 500 | 2.500 |
| Empfohlene Nutzung | Eskalationsstufe | Standard-Routing-Stufe |
Eine sinnvolle Architektur startet mit Flash für Extraktion, Zusammenfassung, Klassifikation, Basis-Chat und unkompliziertes Coding. Eskalieren Sie zu Pro, wenn Flash an einem Validator scheitert, geringe Zuversicht meldet, eine komplexe Änderung im Repository ansteht oder eine tiefere Planung benötigt wird.
Dieser Ansatz spiegelt ein breiteres ökonomisches Prinzip wider: Die Modellauswahl sollte dem gelieferten Wert folgen, nicht einfach der maximalen theoretischen Intelligenz.
Schlussfolgerung und Empfehlung
DeepSeek V4 Pro stellt einen bedeutenden Schritt für Open-Weight-KI dar: frontier-nahe Fähigkeiten in Coding und Reasoning, ein praktisches Million-Token-Kontextfenster, effizient gemacht durch architektonische Innovationen, und eine Preisgestaltung, die hochklassige Intelligenz zugänglich macht. Die Kombination aus Open Weights (MIT), starken agentischen Benchmarks und aggressiven offiziellen Preisen festigt DeepSeeks Position als wichtige Kraft in der KI-Landschaft 2026.
Für die meisten Entwickler und Teams ist der Start mit der offiziellen API oder einem zuverlässigen Aggregator der schnellste Weg. CometAPI sticht als praktische Empfehlung für den schlanken Zugang hervor—es bietet DeepSeek V4 Pro (und Flash) innerhalb einer breiteren Multi-Model-Plattform, die den betrieblichen Aufwand reduziert. Ob Sie Coding-Agenten bauen, lange Dokumente analysieren oder Inferenzkosten optimieren: V4 Pro verdient eine ernsthafte Evaluierung.
Quellen & Weiterführendes
- DeepSeek V4 Preview Release: https://api-docs.deepseek.com/news/news260424/
- DeepSeek Offizielle Preise: https://api-docs.deepseek.com/quick_start/pricing
- Hugging Face DeepSeek-V4-Pro: https://huggingface.co/deepseek-ai/DeepSeek-V4-Pro
- Technischer Bericht (arXiv/Hugging Face): DeepSeek-V4-Paper
- Artificial Analysis Coverage und Intelligence Index Reports
- Zeitgenössische Reviews und unabhängige Bewertungen (2026)
- CometAPI DeepSeek-Modelle und Dokumentation: https://www.cometapi.com/ und zugehörige Modellseiten
Diese Übersicht basiert auf öffentlich verfügbaren Informationen mit Stand August 2026. Überprüfen Sie vor dem Produktionseinsatz stets die aktuellsten offiziellen Quellen.
