Technische Spezifikationen
| Eintrag | DeepSeek-V4-Pro |
|---|---|
| Anbieter | DeepSeek |
| API‑Modellname | deepseek-v4-pro |
| Basis-URLs | https://api.deepseek.com und https://api.deepseek.com/anthropic |
| Eingabetyp | Text |
| Ausgabetyp | Text, Toolaufrufe, Reasoning-Ausgabe |
| Kontextlänge | 1,000,000 tokens |
| Maximale Ausgabe | 384,000 tokens |
| Reasoning-Modi | Non-thinking, thinking (Standard) |
| Standardvorgaben für Agenten/Coding | reasoning_effort kann auf high gesetzt werden; komplexe Agenten-Anfragen können max verwenden |
| Unterstützte Funktionen | JSON Output, Tool Calls, Chat Prefix Completion (Beta), FIM Completion (Beta im Non-thinking-Modus) |
| Lokale/Open-Weights-Veröffentlichung | 1.6T Gesamtparameter, 49B aktivierte Parameter, FP4 + FP8 gemischte Präzision |
| Lizenz (Model Card) | MIT |
| Referenz-Model Card | DeepSeek-V4-Pro preview on Hugging Face |
Was ist DeepSeek-V4-Pro?
DeepSeek-V4-Pro ist das stärkere Mitglied der V4-Preview-Familie von DeepSeek. Die offizielle Model Card beschreibt es als ein MoE-Modell mit 1,6T Parametern, 49B aktivierten Parametern und einem Kontextfenster von einer Million Token, ausgelegt für Wissensarbeit mit langem Zeithorizont, Codegenerierung und Agentenaufgaben. Die API-Dokumentation stellt es über die standardisierte DeepSeek-Chat-Completions-Schnittstelle bereit und unterstützt sowohl OpenAI- als auch Anthropic-SDK‑Stile.
Hauptfunktionen
- Kontex mit einer Million Token: DeepSeek dokumentiert eine Kontextlänge von 1M Token, was das Modell für sehr große Dokumentensammlungen, Repositorien und mehrstufige Agentensitzungen geeignet macht.
- Zwei Reasoning-Modi: Die API unterstützt Non-thinking- und Thinking-Modi; Thinking ist der Standard, und die Dokumentation weist darauf hin, dass komplexe Agentenanforderungen wie Claude Code oder OpenCode automatisch den Aufwand auf
maxsetzen können. - Tool-Call-fähig: Der Thinking-Modus von DeepSeek unterstützt Toolaufrufe, was für Agenten mit Bedarf an Suche, Dateioperationen oder externen Funktionen wichtig ist.
- Effizienz bei langem Kontext: Die Model Card besagt, dass V4 ein hybrides Aufmerksamkeitsdesign mit Compressed Sparse Attention und Heavily Compressed Attention nutzt, um Rechenaufwand und KV-Cache-Kosten für lange Kontexte im Vergleich zu V3.2 zu reduzieren. citeturn980363view2
- Fokus auf Coding und Reasoning: DeepSeek sagt, der V4-Pro-Max-Reasoning-Modus verbessere Coding-Benchmarks und schließe einen großen Teil der Lücke zu führenden Closed-Source-Modellen bei Reasoning- und Agentenaufgaben. citeturn980363view2
- SDK-Flexibilität: Zugriff entweder über standardkonforme OpenAI‑Chat-Completions oder über DeepSeeks Anthropic‑kompatiblen Endpunkt für toolorientierte Workflows.
Benchmark-Leistung
Die offizielle DeepSeek-Model Card berichtet die folgenden Evaluationsergebnisse für die Basismodellfamilie und für das V4-Pro-Max-Vergleichsset. In der Basismodell-Tabelle erzielt V4-Pro höhere Werte als V3.2-Base bei mehreren Wissens- und Long-Context-Benchmarks, einschließlich MMLU-Pro (73.5 vs. 65.5), FACTS Parametric (62.6 vs. 27.1) und LongBench-V2 (51.5 vs. 40.2).
| Benchmark | V3.2-Base | V4-Flash-Base | V4-Pro-Base |
|---|---|---|---|
| MMLU-Pro (EM) | 65.5 | 68.3 | 73.5 |
| FACTS Parametric (EM) | 27.1 | 33.9 | 62.6 |
| HumanEval (Pass@1) | 62.8 | 69.5 | 76.8 |
| LongBench-V2 (EM) | 40.2 | 44.7 | 51.5 |
Die gleiche Model Card zeigt außerdem, dass V4-Pro-Max bei ausgewählten Aufgaben mit Top-Frontier-Modellen konkurrenzfähig bleibt. Beispielsweise erreicht es 87.5 bei MMLU-Pro, 57.9 bei SimpleQA-Verified, 90.1 bei GPQA Diamond und 67.9 bei Terminal Bench 2.0 in der veröffentlichten Vergleichstabelle.
DeepSeek-V4-Pro vs DeepSeek-V4-Flash vs DeepSeek-V3.2
| Modell | Bester Einsatzbereich | Kontext | Hinweise |
|---|---|---|---|
| DeepSeek-V4-Pro | Schweres Reasoning, Coding, Agenten, große Dokumente | 1M | Größtes V4-Modell, 49B aktivierte Parameter, stärkste Gesamtkapazität der Serie. citeturn980363view2turn980363view0 |
| DeepSeek-V4-Flash | Schnellere, leichtere allgemeine Nutzung | 1M | Kleineres 284B/13B-Modell, unterstützt dennoch Thinking und Tool Calls. citeturn980363view2turn980363view0 |
| DeepSeek-V3.2 | Langkontext-Baseline der vorherigen Generation | 128K in früheren API-Dokumenten; V4 nutzt ein anderes 1M-Kontextdesign | Nützlich als Referenzpunkt für Effizienzgewinne; die V4-Pro-Model Card berichtet große Reduktionen bei Long-Context-FLOPs und KV-Cache gegenüber V3.2. citeturn321011view1turn980363view2 |
Beste Anwendungsfälle
- Code-Assistenten und Refactoring-Tools auf Repository-Ebene
- Analyse und Synthese von Langdokumenten
- Toolnutzende Agenten, die mehrstufiges Reasoning benötigen
- Technical-Support-Workflows, die von langem Gedächtnis und strukturierten Ausgaben profitieren
- Chinesische und mehrsprachige Wissensaufgaben, bei denen die Model Card eine starke Benchmark-Leistung zeigt
Zugriff auf und Verwendung der Deepseek v4 pro API
Schritt 1: Für API-Schlüssel registrieren
Melden Sie sich bei cometapi.com an. Falls Sie noch kein:e Nutzer:in sind, registrieren Sie sich bitte zuerst. Melden Sie sich in Ihrer CometAPI-Konsole an. Holen Sie sich den Zugriffs‑API‑Schlüssel der Schnittstelle. Klicken Sie im persönlichen Zentrum bei API Token auf “Add Token”, erhalten Sie den Token-Schlüssel: sk-xxxxx und senden Sie ihn ab.
Schritt 2: An Deepseek v4 proAPI Anfragen senden
Wählen Sie den Endpunkt “deepseek-v4-pro”, um die API-Anfrage zu senden, und legen Sie den Request-Body fest. Methode und Request-Body erhalten Sie aus der API-Dokumentation unserer Website. Unsere Website bietet auch Apifox-Tests für Ihre Bequemlichkeit. Ersetzen Sie <YOUR_API_KEY> durch Ihren tatsächlichen CometAPI-Schlüssel aus Ihrem Konto. Wo wird es aufgerufen: Anthropic Messages-Format und Chat-Format.
Fügen Sie Ihre Frage oder Anforderung in das content-Feld ein — darauf antwortet das Modell. Verarbeiten Sie die API-Antwort, um die generierte Antwort zu erhalten.
Schritt 3: Ergebnisse abrufen und verifizieren
Verarbeiten Sie die API-Antwort, um die generierte Antwort zu erhalten. Nach der Verarbeitung antwortet die API mit dem Aufgabenstatus und den Ausgabedaten. Aktivieren Sie Funktionen wie Streaming, Prompt-Caching oder Long-Context-Handling über Standardparameter.