Technische Spezifikationen
| Parameter | DeepSeek-V4-Pro |
|---|---|
| Anbieter | DeepSeek |
| API-Modellname | deepseek-v4-pro |
| Basis-URLs | https://api.deepseek.com und https://api.deepseek.com/anthropic |
| Eingabetyp | Text |
| Ausgabetyp | Text, Toolaufrufe, Reasoning-Ausgabe |
| Kontextlänge | 1,000,000 Token |
| Maximale Ausgabe | 384,000 Token |
| Reasoning-Modi | Non-thinking, Thinking (Standard) |
| Agenten-/Coding-Standardwerte | reasoning_effort kann auf high gesetzt werden; komplexe Agentenanfragen können max verwenden |
| Unterstützte Funktionen | JSON-Ausgabe, Toolaufrufe, Chat Prefix Completion (Beta), FIM Completion (Beta im Non-thinking-Modus) |
| Lokale/Open-Weights-Veröffentlichung | 1.6T Gesamtparameter, 49B aktivierte Parameter, FP4 + FP8 Mischpräzision |
| Lizenz (Modellkarte) | MIT |
| Referenz-Modellkarte | DeepSeek-V4-Pro Preview auf Hugging Face |
Was ist DeepSeek-V4-Pro?
DeepSeek-V4-Pro ist das stärkere Mitglied der DeepSeek-V4-Preview-Familie. Die offizielle Modellkarte beschreibt es als ein MoE-Modell mit 1,6T Parametern, 49B aktivierten Parametern und einem Kontextfenster von einer Million Token, ausgelegt für langfristige Wissensarbeit, Codegenerierung und Agentenaufgaben. Die API-Dokumentation stellt es über die Standardoberfläche für DeepSeek-Chat-Completions bereit und unterstützt sowohl OpenAI- als auch Anthropic-SDK-Stile.
Hauptfunktionen
- Kontext mit einer Million Token: DeepSeek dokumentiert eine Kontextlänge von 1M Token, was das Modell für sehr große Dokumentensätze, Repositories und mehrstufige Agentensitzungen geeignet macht.
- Zwei Reasoning-Modi: Die API unterstützt Non-thinking und Thinking; Thinking ist der Standard, und die Dokumentation weist darauf hin, dass komplexe Agentenanfragen wie Claude Code oder OpenCode automatisch den Aufwand
maxverwenden können. - Unterstützt Toolaufrufe: Der Thinking-Modus von DeepSeek unterstützt Toolaufrufe, was für Agenten wichtig ist, die Suche, Dateioperationen oder externe Funktionen benötigen.
- Effizienz bei langem Kontext: Die Modellkarte besagt, dass V4 ein hybrides Aufmerksamkeitsdesign mit Compressed Sparse Attention und Heavily Compressed Attention verwendet, um Rechenaufwand und KV-Cache-Kosten für langen Kontext im Vergleich zu V3.2 zu reduzieren. citeturn980363view2
- Fokus auf Coding und Reasoning: DeepSeek sagt, dass der V4-Pro-Max-Reasoning-Modus Coding-Benchmarks voranbringt und einen Großteil der Lücke zu führenden Closed-Source-Modellen bei Reasoning- und Agentenaufgaben schließt. citeturn980363view2
- SDK-Flexibilität: Zugriff über OpenAI-kompatible Chat-Completions oder über den Anthropic-kompatiblen DeepSeek-Endpunkt für toolorientierte Workflows.
Benchmark-Leistung
Die offizielle DeepSeek-Modellkarte berichtet die folgenden Evaluationsergebnisse für die Basismodellfamilie und für das V4-Pro-Max-Vergleichsset. In der Tabelle der Basismodelle erzielt V4-Pro höhere Werte als V3.2-Base bei mehreren Wissens- und Langkontext-Benchmarks, darunter MMLU-Pro (73.5 vs. 65.5), FACTS Parametric (62.6 vs. 27.1) und LongBench-V2 (51.5 vs. 40.2).
| Benchmark | V3.2-Base | V4-Flash-Base | V4-Pro-Base |
|---|---|---|---|
| MMLU-Pro (EM) | 65.5 | 68.3 | 73.5 |
| FACTS Parametric (EM) | 27.1 | 33.9 | 62.6 |
| HumanEval (Pass@1) | 62.8 | 69.5 | 76.8 |
| LongBench-V2 (EM) | 40.2 | 44.7 | 51.5 |
Die gleiche Modellkarte zeigt außerdem, dass V4-Pro-Max bei ausgewählten Aufgaben mit Top-Frontier-Modellen wettbewerbsfähig bleibt. So erzielt es beispielsweise 87.5 auf MMLU-Pro, 57.9 auf SimpleQA-Verified, 90.1 auf GPQA Diamond und 67.9 auf Terminal Bench 2.0 in der veröffentlichten Vergleichstabelle.
DeepSeek-V4-Pro vs DeepSeek-V4-Flash vs DeepSeek-V3.2
| Modell | Am besten geeignet | Kontext | Hinweise |
|---|---|---|---|
| DeepSeek-V4-Pro | Intensives Reasoning, Coding, Agenten, große Dokumente | 1M | Größtes V4-Modell, 49B aktivierte Parameter, höchste Gesamtkapazität der Serie. citeturn980363view2turn980363view0 |
| DeepSeek-V4-Flash | Schneller, leichter für allgemeine Nutzung | 1M | Kleineres 284B/13B-Modell, unterstützt dennoch Thinking und Toolaufrufe. citeturn980363view2turn980363view0 |
| DeepSeek-V3.2 | Langkontext-Basis der vorherigen Generation | 128K in früheren API-Dokumenten; V4 verwendet ein anderes 1M-Kontextdesign | Nützlich als Referenzpunkt für Effizienzgewinne; die V4-Pro-Modellkarte berichtet große Reduktionen bei Long-Context-FLOPs und KV-Cache gegenüber V3.2. citeturn321011view1turn980363view2 |
Beste Anwendungsfälle
- Coding-Assistenten und Refactoring-Tools im Repository-Maßstab
- Analyse und Synthese langer Dokumente
- Toolnutzende Agenten, die mehrstufiges Reasoning benötigen
- Technische Support-Workflows, die von langem Gedächtnis und strukturierten Ausgaben profitieren
- Chinesische und mehrsprachige Wissensaufgaben, bei denen die Modellkarte starke Benchmark-Ergebnisse zeigt
Zugriff auf und Verwendung der Deepseek v4 pro API
Schritt 1: Für API-Schlüssel registrieren
Melden Sie sich bei cometapi.com an. Wenn Sie noch kein Nutzer sind, registrieren Sie sich bitte zuerst. Melden Sie sich bei Ihrer CometAPI-Konsole an. Erhalten Sie die Zugriffsberechtigung (API-Schlüssel) für die Schnittstelle. Klicken Sie im persönlichen Bereich beim API-Token auf “Add Token”, erhalten Sie den Token-Schlüssel: sk-xxxxx und senden Sie ab.
Schritt 2: An Deepseek v4 pro API Anfragen senden
Wählen Sie den Endpunkt „deepseek-v4-pro“, um die API-Anfrage zu senden, und setzen Sie den Request-Body. Die Request-Methode und der Request-Body sind in unserer Website-API-Dokumentation angegeben. Unsere Website bietet auch einen Apifox-Test zu Ihrer Bequemlichkeit. Ersetzen Sie <YOUR_API_KEY> durch Ihren tatsächlichen CometAPI-Schlüssel aus Ihrem Konto. Wo aufrufen: Anthropic Messages-Format und Chat-Format.
Fügen Sie Ihre Frage oder Anfrage in das Content-Feld ein — darauf antwortet das Modell. Verarbeiten Sie die API-Antwort, um die generierte Antwort zu erhalten.
Schritt 3: Ergebnisse abrufen und verifizieren
Verarbeiten Sie die API-Antwort, um die generierte Antwort zu erhalten. Nach der Verarbeitung antwortet die API mit dem Aufgabenstatus und den Ausgabedaten. Aktivieren Sie Funktionen wie Streaming, Prompt-Caching oder Long-Context-Verarbeitung über Standardparameter.