DeepSeek V4.1 Flash ersetzt die kurzlebige Beta-Phase durch eine Produktionsveröffentlichung, die auf asymmetrischer Rechenlogik, nativer Multimodalität, stärkeren Agenten-Benchmarks und deutlich niedrigeren API-Preisen basiert.
TL;DR
DeepSeek V4.1 Flash ist jetzt eine offizielle API und ein Open-Weight-Modell, kein auslaufender Beta-Endpunkt. DeepSeek bezeichnet es als ein Mixture-of-Experts-Modell mit 552B Parametern, das eine neue Causal-Encoder-Decoder-Architektur verwendet. Während der Eingabeverarbeitung werden nur 8B Parameter aktiviert, während der Ausgabeerzeugung 16B aktiviert werden. Dieses asymmetrische Design soll weniger Rechenaufwand für lange Prompts aufwenden, ohne die autoregressive Generierungsphase zu schwächen.
Der Produktions-API-Modellname lautet deepseek-flash. Es unterstützt ein Kontextfenster von 1M Tokens, bis zu 384K Ausgabe-Tokens, Thinking- und Non-Thinking-Modi, JSON-Ausgabe, Tool-Aufrufe, die Responses API, die Anthropic-kompatible API und native Vision-Eingabe. DeepSeeks offizielle Benchmark-Tabelle zeigt materielle Zugewinne gegenüber V4 Flash 0731 und V4 Pro 0813 bei Coding-, Agenten-, Cybersecurity- und Multimodal-Aufgaben.
Die Preisänderung ist ebenso wichtig. Zu Spitzenzeiten kostet V4.1 Flash $0.006 pro Million Cache-Hit-Eingabe-Tokens, $0.30 pro Million Cache-Miss-Eingabe-Tokens und $1.20 pro Million Ausgabe-Tokens. Außerhalb der Spitzenzeiten betragen die Preise die Hälfte.
Key Takeaways
- DeepSeek V4.1 Flash ist ein veröffentlichtes Modell mit offenen Gewichten; die temporäre Kennung
deepseek-v4.1-flash-expires-on-0910ist nicht länger die korrekte Produktionsreferenz. - Das 552B-MoE-Design aktiviert 8B Parameter für Eingaben und 16B für Ausgaben und schafft damit ein anderes Effizienzprofil als die Architektur von V4 Flash mit 284B Gesamt-/13B aktiven Parametern.
- Native Multimodalität ist Teil des Hauptmodells, statt eines separaten Vision-Exp-Zweigs.
- Der offizielle Vergleich zeigt V4.1 Flash bei den meisten ausgewählten Agenten- und Coding-Benchmarks vor V4 Pro 0813, auch wenn es nicht in jedem Knowledge- oder Terminal-Benchmark gegenüber allen Spitzenmodellen führt.
- Der globale KV-Cache sinkt auf 890 Bytes pro Token, etwa 3.9-mal kleiner als bei V4 Flash und ungefähr ein Viertel des bisherigen Footprints.
- Spitzen-API-Preise liegen bei $0.006 für Cache-Hit-Eingaben, $0.30 für Cache-Miss-Eingaben und $1.20 für Ausgaben pro Million Tokens; außerhalb der Spitzenzeiten halbieren sich die Preise.
What Is DeepSeek V4.1 Flash?
DeepSeek V4.1 Flash ist DeepSeeks effizienzfokussiertes Foundation Model vom September 2026 für Reasoning, Coding, Agenten und multimodales Verständnis. Die offizielle Ankündigung beschreibt es als ein MoE-Modell mit 552B Parametern, das die Fähigkeiten verbessert, während es den Rechen- und Speicherbedarf für die Eingabeverarbeitung reduziert.
Die entscheidende Änderung ist architektonisch. Frühere V4-Flash-Versionen nutzten während der Inferenz durchgängig dasselbe Budget an aktiven Parametern. V4.1 Flash trennt die Eingabe- und Ausgabepfade: 8B Parameter sind beim Kodieren des Prompts aktiv und 16B während der Antwortgenerierung. DeepSeek nennt dieses Design Causal-Encoder-Decoder.
| Date | Status | Model ID |
|---|---|---|
| Sep 8 | Limited beta | deepseek-v4.1-flash-expires-on-0910 |
| Sep 10 | Production release | deepseek-flash |
DeepSeek V4.1 Flash Specification:
| Specification | DeepSeek V4.1 Flash |
|---|---|
| Release status | Offizieller API-Release und Open-Weight-Modell |
| Architecture | Mixture-of-Experts mit Causal-Encoder-Decoder-Struktur |
| Total parameters | 552B |
| Activated parameters | 8B für Eingaben; 16B für Ausgaben |
| Context window | 1M Tokens |
| Maximum output | 384K Tokens |
| Input modalities | Text und Bilder |
| Output modality | Text |
| Production API model name | deepseek-flash |
| Thinking modes | Thinking und Non-Thinking |
| API features | JSON-Ausgabe, Tool-Aufrufe, Responses API, Anthropic API, Prefix Completion, FIM Completion |
| Open weights | Veröffentlicht auf Hugging Face |
How Does the DeepSeek V4.1 Flash Work: Causal-Encoder-Decoder
Traditionelle rein Decoder-basierte Sprachmodelle verwenden im Wesentlichen denselben großen Stack für Prompt-Verarbeitung und Token-Generierung. DeepSeek V4.1 Flash weist diesen Phasen unterschiedliche aktive Kapazität zu.
Während der Eingabephase verarbeitet das Modell den Prompt mit einem aktiven Footprint von 8B. Diese Phase kann den bereitgestellten Text- oder Bildkontext effizient untersuchen, da die vollständige Antwort noch nicht generiert wurde. Während der Ausgabephase aktiviert das Modell 16B Parameter und setzt die kausale Token-für-Token-Generierung fort. Das Design spart somit Rechenaufwand bei der Prompt-Kodierung, während mehr aktive Kapazität für Reasoning und Antwortgenerierung erhalten bleibt.
DeepSeek hat in der Ankündigung nicht jedes Implementierungsdetail veröffentlicht, daher ist die sicherste Beschreibung funktional: Die Architektur ist asymmetrisch, die Eingabe- und Ausgabephasen verwenden unterschiedliche Budgets an aktiven Parametern, und das resultierende System reduziert Inferenzspeicher und Kosten.
KV Cache Reduction
Das Speichersignal ist messbar. DeepSeek meldet 890 Bytes globalen KV-Cache pro Token für V4.1 Flash, verglichen mit 3,514 Bytes für V4 Flash, 48,068 Bytes für V3.2 und 389,120 Bytes für V1. Der V4.1-Wert ist ungefähr 3.9-mal kleiner als bei V4 Flash.
Für Langkontext-Agenten ist dies über einen einzelnen Benchmark hinaus relevant. Ein kleinerer KV-Cache reduziert die HBM-Last während einer aktiven Anfrage und senkt die Menge an Zustand, die in langsamere Speicher verschoben werden muss. DeepSeek sagt, V4.1 Flash benötige ungefähr ein Viertel des HBM- und ein Achtel des SSD-Bedarfs des Vorgängermodells für vergleichbare Cache-Workloads.
DeepSeek V4.1 Flash Features
Native Multimodal Input
V4.1 Flash akzeptiert Bilder als Teil der Hauptmodell-API. Dies ersetzt die frühere Aufteilung zwischen rein textbasiertem V4 Flash und dem experimentellen V4 Flash Vision-Endpunkt. Entwickler können jetzt Dokumentenverständnis, Diagrammanalysen, Screenshot-Interpretation und visuelle Agenten-Workflows gegen dasselbe Produktionsmodellfamilie aufbauen.
Long-Context Reasoning
Die offizielle API-Spezifikation behält ein Kontextfenster von 1M Tokens bei und erlaubt bis zu 384K Ausgabe-Tokens. Das macht das Modell geeignet für Repository-Scale-Coding, Multi-Dokument-Analysen, lang laufende Agentensitzungen und Workflows, die einen großen Tool-Verlauf erhalten müssen.
Production API Features
Das Modell unterstützt Thinking- und Non-Thinking-Modi, strukturierte JSON-Ausgabe, Tool-Aufrufe, die Responses API, eine Anthropic-kompatible Schnittstelle, Chat-Prefix Completion und FIM Completion im Non-Thinking-Modus. Diese Fähigkeiten machen V4.1 Flash zu einem direkten Produktionsersatz für viele Agenten- und Coding-Workloads von V4 Flash.
Open Weights
DeepSeek hat die V4.1-Flash-Gewichte und einen technischen Bericht veröffentlicht. Die Veröffentlichung verbessert die Reproduzierbarkeit, doch das Modell bleibt extrem groß: DeepSeeks Ankündigung bittet Organisationen mit Interesse an großen Deployments, mit ungefähr 2,000 GPUs plus einem Storage-Cluster zu planen.
DeepSeek V4.1 Flash Benchmark Performance
Die offiziellen Ergebnisse ändern die frühere Einschätzung, dass V4.1 keine Benchmark-Belege habe. DeepSeek liefert jetzt eine breite Tabelle, die Knowledge, Mathematik, Coding, Terminal-Agenten, Cybersecurity, Automatisierung und multimodale Agentenaufgaben abdeckt.

| Benchmark | DeepSeek V4.1 Flash | V4 Pro 0813 | V4 Flash 0731 |
|---|---|---|---|
| GPQA Diamond | 90.9 | 92.4 | 89.9 |
| Codeforces rating | 3471 | 3348 | 3289 |
| MathArena Apex | 65.6 | 65.3 | 58.6 |
| Terminal-Bench 2.1 | 90.6 | 87.9 | 82.7 |
| DeepSWE v1.1 | 74.2 | 62.7 | 54.4 |
| NL2Repo-Bench | 65.4 | 61.5 | 54.2 |
| CyberGym | 88.1 | 83.3 | 76.7 |
| Automation-Bench | 54.8 | 43.2 | 37.7 |
Über diese ausgewählte Acht-Benchmark-Ansicht hinweg schlägt V4.1 Flash V4 Pro 0813 in sieben Tests und V4 Flash 0731 in allen acht. Die größten Zugewinne erscheinen in Software Engineering und Agenten: DeepSWE steigt um 11.5 Punkte gegenüber V4 Pro und 19.8 gegenüber V4 Flash, während Automation-Bench um 11.6 bzw. 17.1 Punkte steigt.
Die Ergebnisse erfordern weiterhin eine sorgfältige Interpretation. V4.1 Flash liegt bei GPQA Diamond unter V4 Pro, und die vollständige offizielle Grafik zeigt, dass Claude Opus 5 und GPT-5.6 Sol bei Terminal-Bench 3.0 vorausliegen. Eine sinnvolle Schlussfolgerung ist, dass V4.1 Flash DeepSeeks Gleichgewicht aus Effizienz und Fähigkeit materiell verbessert; die Benchmark-Tabelle beweist keine universelle Führungsposition in jeder Aufgabe.
DeepSeek V4.1 Flash API Pricing
DeepSeek nutzt Peak- und Off-Peak-Abrechnung. Peak-Zeiten sind 01:00–04:00 und 06:00–10:00 UTC, Montag bis Freitag; alle anderen Zeiträume, einschließlich Wochenenden, verwenden den Off-Peak-Tarif. Die aktuelle Preisdokumentation besagt, dass Off-Peak-Preise halb so hoch sind wie Peak-Preise.
| Price per 1M tokens | V4.1 Flash off-peak | V4.1 Flash peak | V4 Pro 0813 off-peak | V4 Pro 0813 peak |
|---|---|---|---|---|
| Cache-hit input | $0.003 | $0.006 | $0.022 | $0.044 |
| Cache-miss input | $0.15 | $0.30 | $0.66 | $1.32 |
| Output | $0.60 | $1.20 | $1.98 | $3.96 |

Die Einsparungen sind erheblich. Für eine Workload mit 100 Millionen Cache-Miss-Eingabe-Tokens und 10 Millionen Ausgabe-Tokens kostet V4.1 Flash ungefähr $21 außerhalb der Spitzenzeiten oder $42 zu Spitzenzeiten. Die gleiche Token-Mischung kostet zu den veröffentlichten V4 Pro 0813-Tarifen etwa $85.80 außerhalb der Spitzenzeiten oder $171.60 zu Spitzenzeiten. V4.1 Flash ist in diesem Beispiel etwa 75.5% günstiger.
Prompt-Caching verstärkt den Vorteil für Agenten, die Systemanweisungen, Repository-Kontext oder Dokumente wiederholt wiederverwenden. Die V4.1-Cache-Hit-Rate ist in beiden Abrechnungsperioden 50-mal niedriger als die Cache-Miss-Rate.
DeepSeek V4.1 Flash vs V4 Flash vs V4 Pro
| Dimension | DeepSeek V4.1 Flash | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|---|
| Total parameters | 552B | 284B | 1.6T |
| Activated parameters | 8B input / 16B output | 13B | 49B |
| Architecture focus | Asymmetrische Eingabe-/Ausgabe-Effizienz | Leichtgewichtiges V4-MoE | Maximale V4-Kapazität |
| Native vision | Yes | Separate Vision-Exp-Variante | No |
| Context window | 1M | 1M | 1M |
| Maximum output | 384K | 384K | 384K |
| API status on DeepSeek | Aktuelles Produktionsmodell | Eingestellt; Legacy-Name routet zu V4.1 | Geplante Weiterleitung zu V4.1 Flash ab 14. Sep. 2026 |
| Best fit | Allgemeine Agenten, Coding, Vision, hoher Durchsatz | Nur Migrationskompatibilität | Bestehende Pro-Workloads während der Transition |
V4.1 Flash ist bei den Gesamtparametern größer als V4 Flash, kann aber günstiger betrieben werden, da die Eingabephase nur 8B Parameter aktiviert und einen deutlich kleineren KV-Cache verwendet. Im Vergleich zu V4 Pro aktiviert es deutlich weniger Parameter und übertrifft Pro bei den meisten der oben ausgewählten Agenten- und Coding-Benchmarks.
API Access and Migration
DeepSeeks Produktionsmodellname lautet deepseek-flash. Bestehende Anwendungen können die OpenAI-kompatible Basis-URL https://api.deepseek.com beibehalten oder die Anthropic-kompatible Basis-URL https://api.deepseek.com/anthropic.
- Aktualisieren Sie den Modellnamen auf
deepseek-flash. - Behalten Sie die bestehende DeepSeek-Basis-URL und Authentifizierungsmethode bei.
- Testen Sie Thinking-Modus, Tool-Aufrufe, Vision-Eingaben, Latenz und Token-Nutzung mit Produktionsprompts erneut.
- Überwachen Sie Legacy-Aliase:
deepseek-v4-flashunddeepseek-v4-flash-vision-exprouten jetzt zu V4.1 Flash, währenddeepseek-v4-proab dem 14. September 2026 bis zu einem zukünftigen V4.1-Pro-Release zu V4.1 Flash routen soll.
Für CometAPI-Nutzer ist die DeepSeek V4.1 API in CometAPI jetzt live neben der bestehenden DeepSeek V4 Flash API. Bevor Sie Produktionsverkehr umstellen, bestätigen Sie den finalen Modellnamen, die Preise und die Alias-Zuordnung im CometAPI-Dashboard, da Drittanbieter von DeepSeeks offizieller API-Namensgebung und -Abrechnung abweichen können.
Who Should Use DeepSeek V4.1 Flash?
V4.1 Flash passt gut zu Coding-Agenten, Repository-Analysen, Terminalautomatisierung, multimodalen Dokument-Workflows, Long-Context-Assistenten und hochvolumigen, Tool-nutzenden Systemen. Seine Benchmark-Gewinne konzentrieren sich auf dieselben Workloads, die am meisten von geringerem Cache-Speicher und niedrigeren Token-Preisen profitieren.
Teams, die bereits V4 Flash nutzen, sollten es als direkten Migrationskandidaten betrachten. Teams, die V4 Pro verwenden, sollten sorgfältig testen, aber DeepSeeks eigene Benchmark- und Preisdaten machen V4.1 Flash nun zur wirtschaftlicheren Standardeinstellung für viele Pro-Klasse-Workloads.
Self-Hosting ist eine andere Entscheidung. Offene Gewichte machen ein 552B-Modell nicht leichtgewichtig. Organisationen sollten die Kosten einer großen GPU- und Speicherbereitstellung mit einem gehosteten API-Einsatz vergleichen, bevor sie sich für lokale Inferenz entscheiden.
Limitations and Open Questions
- Die Benchmark-Ergebnisse stammen aus DeepSeeks offiziellem Evaluations-Setup; unabhängige Replikationen werden benötigt, um die Leistung in unterschiedlichen Harnesses und Tool-Umgebungen zu messen.
- Native Multimodal-Unterstützung ist bestätigt, aber Applikationsteams sollten unterstützte Bildformate, Token-Abrechnung und Vision-Verhalten gegen die Live-API validieren.
- Legacy-Modell-Aliase ändern jetzt das Modell hinter einem bestehenden Namen, was Ausgaben ohne Codeänderung der Anwendung verändern kann.
- V4.1 Flash reduziert die Infrastrukturanforderungen im Vergleich zu früheren DeepSeek-Modellen, aber sein Open-Weight-Deployment erfordert weiterhin umfangreiche Rechen- und Speicherkapazität.
- CometAPIs dedizierter V4.1-Endpunkt und finale Preise sollten vor Produktionsnutzung in der Live-Konsole bestätigt werden.
Final Verdict
DeepSeek V4.1 Flash ist ein großes Architektur- und Produktupdate. Das 552B-MoE-Modell kombiniert eine 8B-aktive Eingabephase, eine 16B-aktive Ausgabephase, native Vision, ein 1M-Token-Kontextfenster und einen stark komprimierten KV-Cache. Diese Designentscheidungen führen zu stärkeren offiziellen Coding- und Agenten-Benchmarks bei deutlich niedrigeren API-Preisen als V4 Pro 0813.
Die praktischste Veränderung ist die Konsolidierung. V4.1 Flash bringt Text, Vision, Reasoning, Tool-Nutzung und Long-Context-Betrieb unter einen Produktionsmodellnamen. Für die meisten neuen DeepSeek-Integrationen ist deepseek-flash jetzt der logische Ausgangspunkt; V4 Pro wird zu einem Migrationsvergleich statt zur automatischen Wahl für schwierige Aufgaben.
FAQ
Is DeepSeek V4.1 Flash officially released?
Yes. Es ist über DeepSeeks API unter dem Modelnamen deepseek-flash verfügbar, und DeepSeek hat Open Weights und einen technischen Bericht veröffentlicht.
Is the temporary V4.1 beta model ID still required?
No. deepseek-v4.1-flash-expires-on-0910 war eine kurzlebige Beta-Kennung. Produktionsanwendungen sollten deepseek-flash verwenden.
How many parameters does DeepSeek V4.1 Flash have?
Das Modell hat 552B Gesamtparameter. Es aktiviert 8B Parameter während der Eingabeverarbeitung und 16B während der Ausgabeerzeugung.
Does DeepSeek V4.1 Flash support images?
Yes. Vision-Eingabe ist nativ im Produktionsmodell, sodass ein separater V4 Flash Vision Exp-Endpunkt nicht mehr erforderlich ist.
Is V4.1 Flash better than V4 Pro?
Es führt V4 Pro 0813 bei den meisten von DeepSeek veröffentlichten Vergleichen in Coding, Agenten, Automatisierung und Cybersecurity an, aber V4 Pro liegt bei GPQA Diamond vorn. Teams sollten beide mit ihren eigenen Prompts vor der Migration evaluieren.
How much does the API cost?
Zu Spitzenzeiten liegen die Sätze pro Million Tokens bei $0.006 für Cache-Hit-Eingaben, $0.30 für Cache-Miss-Eingaben und $1.20 für Ausgaben. Off-Peak-Sätze betragen die Hälfte dieser Preise.
What happens to the old V4 model names?
Die Legacy-Namen deepseek-v4-flash und deepseek-v4-flash-vision-exp routen zu V4.1 Flash. DeepSeek sagt, deepseek-v4-pro werde ab dem 14. September 2026 bis zur Veröffentlichung von V4.1 Pro ebenfalls zu V4.1 Flash routen.
Can I use DeepSeek V4.1 Flash through CometAPI?
Yes. CometAPI bietet jetzt einen Live-DeepSeek V4.1 API-Endpunkt an. Bevor Sie Produktionsverkehr senden, bestätigen Sie den genauen Modellnamen, die Preise und die unterstützten Funktionen in der CometAPI-Konsole, da Drittanbieter andere Namenskonventionen oder Abrechnungssätze als DeepSeeks offizielle API verwenden können.
