Technische Spezifikationen von DeepSeek-V4-Flash
| Element | Details |
|---|---|
| Modell | DeepSeek-V4-Flash |
| Anbieter | DeepSeek |
| Familie | DeepSeek-V4 Preview Series |
| Architektur | Mixture-of-Experts (MoE) |
| Gesamtparameter | 284B |
| Aktivierte Parameter | 13B |
| Kontextlänge | 1,000,000 tokens |
| Präzision | FP4 + FP8 gemischt |
| Reasoning-Modi | Non-think, Think, Think Max |
| Veröffentlichungsstatus | Vorschau-Modell |
| Lizenz | MIT-Lizenz |
Was ist DeepSeek-V4-Flash?
DeepSeek-V4-Flash ist DeepSeeks effizienzfokussiertes Vorschau-Modell der V4-Serie. Es ist als Mixture-of-Experts-Sprachmodell aufgebaut, das trotz seiner Größe eine relativ kleine aktive Auslastung hat. Dadurch bleibt es reaktionsschnell und unterstützt dennoch ein sehr großes Kontextfenster von 1M Token.
Hauptfunktionen von DeepSeek-V4-Flash
- Millionen-Token-Kontext: Das Modell unterstützt ein Kontextfenster mit 1,000,000 Token und eignet sich damit für sehr lange Dokumente, große Codebasen und mehrstufige Agentensitzungen.
- Effizienzorientiertes MoE-Design: Es nutzt 284B Gesamtparameter, aber nur 13B aktivierte Parameter pro Anfrage – ein Setup, das auf schnellere und effizientere Inferenz abzielt.
- Drei Reasoning-Modi: Non-think, Think und Think Max ermöglichen es, bei schwierigeren Aufgaben Geschwindigkeit gegen tieferes Reasoning abzuwägen.
- Starke Langkontext-Architektur: DeepSeek gibt an, dass die V4-Serie Compressed Sparse Attention und Heavily Compressed Attention kombiniert, um die Effizienz bei langen Kontexten zu verbessern.
- Wettbewerbsfähige Programmier- und Agentenfähigkeiten: Die Modellkarte berichtet starke Ergebnisse in Coding- und agentenbasierten Benchmarks, darunter HumanEval, SWE Verified, Terminal Bench 2.0 und BrowseComp.
- Offene Gewichte und lokale Bereitstellung: Die Veröffentlichung beinhaltet Modellgewichte, eine Anleitung zur lokalen Inferenz sowie eine MIT-Lizenz, was Self-Hosting und Experimente praktikabel macht.
Benchmark-Leistung von DeepSeek-V4-Flash
Ausgewählte Ergebnisse aus der offiziellen Modellkarte zeigen, dass DeepSeek-V4-Flash bei mehreren Kernbenchmarks gegenüber DeepSeek-V3.2-Base verbessert wurde:
| Benchmark | DeepSeek-V3.2-Base | DeepSeek-V4-Flash-Base | DeepSeek-V4-Pro-Base |
|---|---|---|---|
| AGIEval (EM) | 80.1 | 82.6 | 83.1 |
| MMLU (EM) | 87.8 | 88.7 | 90.1 |
| MMLU-Pro (EM) | 65.5 | 68.3 | 73.5 |
| HumanEval (Pass@1) | 62.8 | 69.5 | 76.8 |
| LongBench-V2 (EM) | 40.2 | 44.7 | 51.5 |
In der Tabelle zu Reasoning und Agenten zeigt die Flash-Variante ebenfalls solide Ergebnisse bei Terminal- und Softwareaufgaben: Flash Max erreicht 56.9 auf Terminal Bench 2.0 und 79.0 auf SWE Verified, liegt jedoch bei den schwersten wissensintensiven und agentenbasierten Aufgaben weiterhin hinter dem größeren Pro-Modell.
DeepSeek-V4-Flash vs DeepSeek-V4-Pro vs DeepSeek-V3.2
| Modell | Am besten geeignet | Kompromiss |
|---|---|---|
| DeepSeek-V4-Flash | Schnelle Langkontext-Arbeit, Programmierassistenten und Agentenflüsse mit hohem Durchsatz | Leicht hinter Pro bei reinem Wissen und den komplexesten agentenbasierten Aufgaben |
| DeepSeek-V4-Pro | Aufgaben mit höchster Leistungsanforderung, tieferes Reasoning und schwierigere Agenten-Workflows | Schwerer und weniger auf Effizienz ausgerichtet als Flash |
| DeepSeek-V3.2 | Ältere Baseline für Vergleich und Migrationsplanung | Niedrigere Benchmark-Leistung als V4-Flash in den offiziellen Tabellen |
Typische Anwendungsfälle für DeepSeek-V4-Flash
- Analyse langer Dokumente für Verträge, Research-Pakete, Support-Wissensbasen und interne Wikis.
- Programmierassistenten, die große Repositories inspizieren, Anweisungen über viele Dateien hinweg befolgen und den Kontext aufrechterhalten müssen.
- Agenten-Workflows, in denen das Modell schlussfolgert, Tools aufruft und iteriert, ohne den roten Faden zu verlieren.
- Unternehmens-Chat-Systeme, die von einem sehr großen Kontextfenster und einer reibungsarmen Bereitstellung profitieren.
- Prototypische lokale Bereitstellungen für Teams, die das Verhalten von DeepSeek-V4 vor der Produktionshärtung evaluieren möchten.
How to access and use Deepseek v4 Flash API
Schritt 1: Für einen API-Schlüssel registrieren
Melden Sie sich bei cometapi.com an. Wenn Sie noch kein Nutzer sind, registrieren Sie sich zuerst. Melden Sie sich in Ihrer CometAPI-Konsole an. Rufen Sie den API-Schlüssel für den Zugriff auf die Schnittstelle ab. Klicken Sie im persönlichen Bereich beim API-Token auf „Add Token“, erhalten Sie den Token-Schlüssel: sk-xxxxx, und senden Sie ihn ab.
Schritt 2: An die deepseek v4 flash API Anfragen senden
Wählen Sie den Endpunkt „deepseek-v4-flash“, um die API-Anfrage zu senden, und legen Sie den Request-Body fest. Die Request-Methode und der Request-Body sind in der API-Dokumentation auf unserer Website beschrieben. Zu Ihrer Bequemlichkeit stellt unsere Website außerdem einen Apifox-Test bereit. Ersetzen Sie <YOUR_API_KEY> durch Ihren tatsächlichen CometAPI-Schlüssel aus Ihrem Account. Wo der Aufruf erfolgt: Format Anthropic Messages und Format Chat.
Fügen Sie Ihre Frage oder Anforderung in das Content-Feld ein — darauf reagiert das Modell. Verarbeiten Sie die API-Antwort, um die generierte Antwort zu erhalten.
Schritt 3: Ergebnisse abrufen und verifizieren
Verarbeiten Sie die API-Antwort, um die generierte Antwort zu erhalten. Nach der Verarbeitung antwortet die API mit dem Aufgabenstatus und den Ausgabedaten. Aktivieren Sie Funktionen wie Streaming, Prompt-Caching oder Langkontext-Verarbeitung über Standardparameter.