TLDR DeepSeek-V4-Flash-0731 (veröffentlicht am 31. Juli 2026) ist die offizielle, produktionsreife Version von DeepSeeks effizientem Mixture-of-Experts-Modell (insgesamt 284B / 13B aktive Parameter, 1M-Token-Kontext). Durch gezieltes Post-Training liefert es dramatische Zugewinne bei Agenten-Coding, Tool-Nutzung und mehrstufiger Softwareentwicklung. Es unterstützt nativ die Responses API und OpenAI Codex. DeepSeek Harness ist das begleitende Agenten-Framework (Minimalmodus bereits in offiziellen Evaluierungen genutzt; vollständige Veröffentlichung steht bevor), das darauf ausgelegt ist, das Modell in einen zuverlässigen autonomen Agenten zu verwandeln.
Zusammen bieten sie eines der stärksten Kosten-Nutzen-Verhältnisse in der Kategorie Open-Weights und per API zugänglicher Agenten-KI, Stand August 2026.
Wichtigste Erkenntnisse
- Großer Sprung bei Agentenfähigkeiten ausschließlich durch Post-Training: Gleiche 284B/13B-Architektur wie im April-Preview, aber deutlich höhere Werte (z. B. Terminal Bench 2.1: 82.7 vs 61.8; DeepSWE: 54.4 vs 7.3).
- Übertrifft DeepSeek-V4-Pro (Preview) auf mehreren Agenten-Benchmarks trotz deutlich weniger aktivierter Parameter.
- Wettbewerbsfähig mit führenden proprietären Modellen (nahe an Claude Opus 4.8 bei mehreren Agentenaufgaben) zu einem Bruchteil der Kosten.
- Nativer 1M-Token-Kontext, spekulatives Decoding (DSpark), drei Reasoning-Aufwandsstufen (low/high/max), MIT-Lizenz, offene Gewichte.
- Offizielle Unterstützung für Responses API und Codex (CLI, Desktop, VS Code-Extension).
- DeepSeek Harness (Minimalmodus bereits in Evaluierungen genutzt) ist das offizielle Agenten-Framework in geschlossener Beta; öffentliche Veröffentlichung in Kürze erwartet. DeepSeek Harness liefert die Agenten-Laufzeitschicht; Modell + Harness = Produktions-Agent.
- Ideal für hochvolumige Coding-Agenten, Terminal-Automatisierung, Tool-Nutzung und Long-Context-Workflows.
- Greifen Sie kostengünstig und mit einheitlichen Tools über CometAPI (OpenAI-kompatibler Endpunkt, wettbewerbsfähige Preise, Multi-Model-Routing) auf DeepSeek-Modelle zu.
Was ist neu in DeepSeek V4 Flash 0731?
Offizieller Release-Status geändert
Die wichtigste Produktänderung: DeepSeek V4 Flash 0731 ist jetzt die offizielle Version von DeepSeek V4 Flash in der API, in einer Public Beta. DeepSeeks Änderungsprotokoll vom 31. Juli besagt, dass Entwickler weiterhin denselben Modellnamen deepseek-v4-flash aufrufen können, um auf die neueste Version zuzugreifen. Das ist für die Migration wichtig, da es einen neuen Model-Slug vermeidet und Teams das Update hinter bestehender Routing-Logik testen lässt.
DeepSeek sagt außerdem, dass das Update nur die V4 Flash API aktualisiert. Die V4 Pro API und die App/Web-Modelle wurden durch das Release am 31. Juli nicht verändert, und DeepSeek erklärte, dass der offizielle V4 Pro-Release bald folgen werde. Mit anderen Worten: Dies ist kein vollständiges Refresh der DeepSeek V4-Familie. Es ist ein gezieltes Flash-Update.
Architektur gleich geblieben, Post-Training geändert
Die Kernarchitektur bleibt unverändert: ein Mixture-of-Experts (MoE)-Modell mit 284 Milliarden Gesamtparametern und nur 13 Milliarden aktivierten Parametern pro Token, ein hybrides Attention-Design optimiert für langen Kontext sowie ein natives Kontextfenster von 1 Million Tokens. Ein Modul für spekulatives Decoding (DSpark) ist für schnellere Generierung angebunden. Das Modell ist text-only, unterstützt einstellbare Reasoning-Aufwandsstufen (low / high / max), Tool-Calling, strukturierte Ausgabe und wird unter der freizügigen MIT-Lizenz veröffentlicht.
Dieser Unterschied ist wichtig. Viele Modellupdates verbessern sich, weil das Modell größer ist. Dieses Update ist interessanter, weil DeepSeek einen großen Agenten-Sprung ohne Erhöhung des Parameter-Footprints beansprucht. V4 Flash bleibt ein MoE mit 284B gesamt und 13B aktiv und ist damit zur Inferenzzeit deutlich kleiner als V4 Pros Design mit 1.6T gesamt und 49B aktiv.
Deutliche Sprünge bei Agenten-Coding-Scores
DeepSeeks offizielle Tabelle zeigt deutliche Verbesserungen bei Terminal-, Repository-Aufbau-, Cyber-, Software-Engineering-, Tool-Nutzungs-, Automatisierungs- und Full-Stack-Coding-Aufgaben. Der größte absolute Sprung gegenüber dem älteren Flash-Preview liegt bei DeepSWE: 54.4 gegenüber 7.3, ein Plus von 47.1 Punkten. Cybergym verbessert sich um 38.0 Punkte, DSBench-Hard um 33.8 Punkte und DSBench-FullStack um 31.7 Punkte.
Deshalb wird V4 Flash 0731 weniger als normales „Fast Model“ und eher als Kandidat für das Standardmodell von Coding-Agenten diskutiert. Das Wertversprechen ist nicht nur günstiger Chat. Es ist günstige, langkontextfähige, tool-freundliche Agenten-Inferenz.
Responses API- und Codex-Unterstützung ist da
Das Änderungsprotokoll vom 31. Juli bei DeepSeek besagt, dass das offizielle V4 Flash die Responses API nativ unterstützt und speziell für Codex angepasst ist. DeepSeeks Leitfaden zur Responses API sagt, das Format wurde aufgrund der Nachfrage nach Codex hinzugefügt, verwendet die Basis-URL https://api.deepseek.com und unterstützt derzeit deepseek-v4-flash.
Das ist wichtig, weil Codex-ähnliche Entwicklungs-Workflows nicht einfach Chat-Sitzungen sind. Sie benötigen strukturierte Input- und Output-Items, Reasoning-Items, Tool-Calls, Dateiänderungs-Operationen, Streaming-Events, Usage-Abrechnung und die Integration mit Coding-Agent-Clients. DeepSeeks Unterstützung ist kein perfekter Klon jeder OpenAI-Responses-API-Funktion, aber ausreichend, um V4 Flash zu einem deutlich praktikableren Drop-in-Kandidaten für Coding-Agent-Experimente zu machen.
Performance-Benchmarks für die offizielle V4-Flash-Version
Benchmark-Hinweise, die Entwickler nicht ignorieren sollten
Offizielle Evaluationsergebnisse (von DeepSeek auf der Model Card berichtet) zeigen große Sprünge gegenüber dem Preview und, bemerkenswert, gegenüber dem viel größeren V4-Pro-Preview bei agentenzentrierten Aufgaben. Evaluierungen für Code-Agent-Benchmarks nutzten den Minimalmodus von DeepSeek Harness (wird noch veröffentlicht) bei maximalem Reasoning-Aufwand, temperature = 1.0, top_p = 0.95.
Das hat zwei Implikationen. Erstens ist das Ergebnis teils ein Modell-und-Harness-Ergebnis. Wenn Ihre Agenten-Laufzeit andere Tools, Shell-Rechte, Kontextmanagement, Retries, Patch-Regeln oder Fehlerbehandlung hat, erzielen Sie möglicherweise nicht dieselben Werte. Zweitens ist unabhängige Reproduktion begrenzt, bis DeepSeek genug vom Harness und dem Evaluierungssetup veröffentlicht, damit externe Teams vergleichbare Tests durchführen können.
Offizielle DeepSeek-Benchmarktabelle
| Benchmark | V4-Flash-0731 | V4-Flash Preview | V4-Pro Preview | GLM-5.2 | Opus-4.8 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 82.7 | 61.8 | 72.1 | 81.0 | 85.0 |
| NL2Repo | 54.2 | 39.4 | 38.5 | 48.9 | 69.7 |
| Cybergym | 76.7 | 38.7 | 52.7 | — | 83.1 |
| DeepSWE | 54.4 | 7.3 | 12.8 | 46.2 | 58.0 |
| Toolathlon-Verified | 70.3 | 49.7 | 55.9 | 59.9 | 76.2 |
| Agents’ Last Exam | 25.2 | 15.8 | 16.5 | 23.8 | 25.7 |
| AutomationBench Public | 25.1 | 10.8 | 12.8 | 12.9 | 27.2 |
| DSBench-FullStack † | 68.7 | 37.0 | 41.8 | 61.8 | 71.6 |
| DSBench-Hard † | 59.6 | 25.8 | 31.1 | 54.5 | 71.7 |
Über diese neun Benchmarks hinweg erreicht V4 Flash 0731 im Mittel 55.2. Das alte V4 Flash Preview liegt im Schnitt bei 29.6, und V4-Pro Preview bei 34.9. Das bedeutet, V4 Flash 0731 liegt auf dieser Tabelle etwa 25.6 Punkte über dem Flash-Preview und 20.3 Punkte über dem V4-Pro-Preview.
Signale von Drittanbietern
ARC Prize berichtet für V4 Flash 0731 bei maximalem Aufwand 89.0% auf ARC-AGI-1 Semi-Private und 61.4% auf ARC-AGI-2 Semi-Private, mit angegebenen Kosten von $0.02 bzw. $0.04 pro Aufgabe. Dies sind keine Coding-Agent-Benchmarks, stützen aber die breitere Sicht, dass das Modell bei Reasoning-Aufgaben wettbewerbsfähig ist, wenn es mit höherem Aufwand betrieben wird.
Besonders auffällig sind die Zuwächse bei DeepSWE (Software-Engineering-Agenten-Loop) und Cybergym. Unabhängige Messungen (z. B. Artificial Analysis) berichten etwas niedrigere, aber immer noch starke Terminal-Bench-Werte um 79%, was die Richtung der Verbesserung bestätigt und daran erinnert, dass Anbieter-Harness-Zahlen tendenziell optimistischer sind.
Zusätzlicher Kontext aus früheren V4-Evaluierungen und Drittanbieter-Aggregatoren zeigt starke Wissens- und Coding-Leistung im Max-Reasoning-Modus (GPQA Diamond ~88–91%, LiveCodeBench hoher 80er–90er-Bereich je nach Quelle). Das 0731-Post-Training hat speziell die Agenten-Zuverlässigkeit freigeschaltet, die dem Preview fehlte.
DeepSeek-V4-Flash unterstützt jetzt die Responses API und Codex
Eine strategisch wichtige Ergänzung ist die native Unterstützung für OpenAIs Responses API. DeepSeeks offizielle Dokumentation bestätigt, dass die Responses API derzeit deepseek-v4-flash unterstützt (Pro-Unterstützung wird Anfang August 2026 erwartet). Die Basis-URL bleibt https://api.deepseek.com.
Das ist ein großes Upgrade der Developer Experience. Vor der Responses-API- und Codex-Unterstützung konnte DeepSeek V4 Flash bereits als Textmodell aufgerufen werden, aber ein Coding-Agent musste mehr Integrationsdetails selbst überbrücken. Jetzt kann das Modell in Workflows genutzt werden, die Responses-ähnliche Semantik erwarten.
Was die Unterstützung der Responses API umfasst
DeepSeeks Responses API erzeugt eine Modellantwort im OpenAI-Responses-API-Format unter /responses. Die Responses API unterstützt model, input, instructions, stream, temperature, top_p, max_output_tokens, top_logprobs, Tools, Toolauswahl, Reasoning-Aufwand, Textformat und Usage-Reporting. Die API ist zustandslos, daher müssen Clients für mehrstufige Interaktionen den vollständigen Gesprächsverlauf mitsenden.
Die wichtigsten Kompatibilitätsdetails sind praktisch:
deepseek-v4-flashist derzeit das einzige unterstützte Modell für die Responses API.developer-Nachrichten werden alssystem-Nachrichten behandelt.- Function-Tools, Streaming sowie einstellbarer Reasoning-Aufwand und serverseitige Websuche werden unterstützt.
- Der benutzerdefinierte Tool-Typ wird nur für
apply_patchunterstützt, was für die Codex-Kompatibilität wichtig ist. - Bild- und Datei-Inputs werden nicht unterstützt; Bild-Input-Teile werden durch Platzhaltertext ersetzt.
previous_response_id,conversation,store, Hintergrundmodus, Metadaten und einige Kontextverwaltungsfunktionen werden nicht unterstützt.- Nicht unterstützte Parameter können stillschweigend ignoriert werden, daher sollten Produktions-Clients das erwartete Verhalten explizit testen.
Für Entwickler ist der Kernpunkt, dass die Unterstützung der Responses API nicht nur ein syntaktisches Detail ist. Sie ermöglicht es, DeepSeek V4 Flash in einer Protokollspur zu betreiben, die von modernen Coding-Agenten genutzt wird, insbesondere dort, wo Function-Calls, Streaming-Events, Reasoning-Items und Patch-Anwendungen konsistent dargestellt werden müssen.
Zustandsloses Design (Client verwaltet den Gesprächsverlauf). Beispiel (Python):
from openai import OpenAI
client = OpenAI(api_key="<DeepSeek API Key>", base_url="https://api.deepseek.com")
response = client.responses.create(
model="deepseek-v4-flash",
instructions="You are a helpful coding assistant.",
input="Refactor this Python function for better readability...",
reasoning={"effort": "max"}
)
print(response.output_text)
Alle Details und der Codex-Integrationsleitfaden: DeepSeek API-Dokumentation – Responses API und Integration mit Codex.
Was Codex-Unterstützung bedeutet
DeepSeeks Codex-Integrationsleitfaden besagt, dass Codex über die Responses API mit Modellen spricht, die DeepSeek nun nativ unterstützt. Das ermöglicht die direkte Integration mit Codex (OpenAIs Coding-Agenten-Ökosystem — CLI, ChatGPT-Desktop-App und VS-Code-Extension).
Entwickler können einen benutzerdefinierten Provider einmalig über ein Setup-Skript oder durch Bearbeiten von ~/.codex/config.toml und einer Modellkatalog-Datei konfigurieren. Nach der Konfiguration erkennen Codex-Clients DeepSeek-V4-Flash und können dessen Tool-Calling-, apply_patch-, Websuche- und Reasoning-Fähigkeiten nutzen.
DeepSeek V4 Flash vs. DeepSeek V4 Pro
| Aspekt | V4-Flash-0731 | V4-Pro (typisch / Preview) |
|---|---|---|
| Gesamt / aktiv | 284B / 13B | ~1.6T / 49B |
| Kontextfenster | 1M Tokens | 1M Tokens |
| Stärken | Agenten-Coding, Terminal, Kosten, Geschwindigkeit | Tiefstes Reasoning, Wissen, schwierigste Aufgaben |
| Vorteil bei Agenten | Gewinnt auf der veröffentlichten 0731-Agenten-Suite | Stärker bei reinem Wissen & komplexen Multi-File-Aufgaben |
| Typische API-Preise | ~$0.14 in / $0.28 out (Cache deutlich niedriger) | Deutlich höher (historisch 3–12×) |
| Am besten geeignet | Hochvolumige Agenten, Produktions-Coding-Loops, kostensensitive Apps | Spitzenforschung, maximale Fähigkeit bei Einzeltasks |
| Open Weights | Ja (MIT) | Ja (MIT) |
Welche sollten Entwickler zuerst verwenden?
Auf den spezifischen mit 0731 veröffentlichten Agenten-Benchmarks übertrifft das kleinere Flash-Modell das Pro-Preview durchgehend. Für reines Wissensretrieval oder die absolut schwierigsten Reasoning-Probleme behält Pro in vielen unabhängigen und früheren Evaluierungen noch einen Vorsprung. In der Praxis setzen viele Teams Flash jetzt als Standard für die Mehrheit agentischer Workloads ein und routen nur die anspruchsvollsten Aufgaben zu Pro (oder anderen Spitzenmodellen).
Diese Routing-Strategie ist der Punkt, an dem CometAPI helfen kann. Anstatt ein Modell für alle Workloads hart zu codieren, nutzen Sie CometAPI, um Modellauswahl, Logging, Kostenverfolgung und Fallback-Richtlinien zu zentralisieren. Zum Beispiel:
- Verwenden Sie V4 Flash für Repository-Zusammenfassungen, Refactor-Planung, Code-Review-Entwürfe, generierte Tests, strukturierte Extraktion, Long-Context-QA und wiederholte Agenten-Loops.
- Skalieren Sie zu V4 Pro oder einem anderen Premium-Modell, wenn die Aufgabe hohes Geschäftsrisiko, unklare Anforderungen, fragile Produktionscodes oder wiederholt gescheiterte Versuche umfasst.
- Verfolgen Sie die Endmetrik, die zählt: akzeptierte Fixes pro Dollar, erfolgreiche Aufgaben pro Stunde oder eingesparte Minuten bei manueller Prüfung.
Was ist DeepSeek Harness?
DeepSeek Harness ist das offizielle Agenten-Framework bzw. die Laufzeitschicht, die DeepSeek entwickelt, um seine Modelle in zuverlässige autonome Agenten zu verwandeln. Das Unternehmen formuliert die Gleichung einfach: Modell + Harness = Agent.
Offizielle Evaluierungen von V4-Flash-0731 nutzten bereits den „Minimalmodus“ von DeepSeek Harness. Das vollständige Produkt wird noch ausgerollt (Rekrutierung und frühe Tests waren Ende Juli/Anfang August 2026 aktiv). Das Team wird von Cui Tianyi geleitet (Hintergrund in quantitativen Handelssystemen), und Stellenausschreibungen betonen die tiefe Integration mit DeepSeek-V4-Funktionen wie Prefix Caching, Long-Context-Management, KV-Cache-Optimierung, Tool-Use-Chaining, Fehlerbehebung und automatischem Retry.
Harness ist kein generischer Wrapper à la LangChain. Es wird gemeinsam mit dem Modell entworfen, sodass Kontextmanagement, Tool-Orchestrierung, Evidenzsammlung und Reparaturschleifen V4-spezifische Effizienzen (sparse Attention, Caching, Reasoning-Modi) ausnutzen. Community-Projekte und Drittanbieter-Harnesses existieren ebenfalls, aber das offizielle Harness zielt auf die engstmögliche Kopplung von Modell und Laufzeit.
Bei vollständiger Veröffentlichung wird erwartet:
- Strukturierte Agenten-Loops für Coding und Automatisierung.
- Safety-Gates und Freigabe-Workflows.
- Effiziente Kontextbehandlung für langandauernde Aufgaben.
- Observability und Artefakterstellung.
Bis zur vollständigen Veröffentlichung können Entwickler bereits starke Ergebnisse erzielen, indem sie V4-Flash-0731 mit bestehenden Agenten-Frameworks kombinieren oder den Pfad Responses API + Codex nutzen.
Preise, Verfügbarkeit und praktische Bereitstellung
- Offizielle API-Preise (ungefähr): $0.14 / 1M Input-Tokens (Cache-Miss), ~$0.0028–0.03 bei Cache-Hit, $0.28 / 1M Output-Tokens. Hohe Concurrency-Limits.
- Offene Gewichte unter MIT auf Hugging Face; quantisierte GGUF-Versionen sind weit verbreitet für lokale/Self-Hosted-Nutzung verfügbar (erfordert beträchtlichen VRAM — Full-Precision ist groß).
- Spekulatives Decoding (DSpark) und hybride Attention halten Long-Context-Inferenz relativ effizient.
- Unterstützte Inferenz-Engines: vLLM, SGLang und andere mit dokumentierten Rezepten.
Für viele Teams ist der einfachste Produktionspfad ein OpenAI-kompatibles Gateway. CometAPI bietet einen einheitlichen Zugang zu DeepSeek-Modellen (einschließlich der V4-Serie) zusammen mit Hunderten anderer Modelle über einen einzigen Endpunkt (https://api.cometapi.com/v1). Vorteile sind vereinfachtes Multi-Model-Routing, wettbewerbsfähige oder rabattierte Preise gegenüber direkten Anbietern, Nutzungsanalytik und die Möglichkeit, zwischen Flash, Pro und anderen Modellen zu wechseln, ohne den Anwendungscode zu ändern. Das ist besonders nützlich für Agentensysteme, die nach Schwierigkeit/Kosten fallbacken oder routen.
Zum Zeitpunkt dieses Artikels listete CometAPI für DeepSeek V4 Flash in seiner Vergleichstabelle einen Einstiegspreis von $0.12 pro 1M Tokens für Input, einen Output-Preis von $0.24 pro 1M Tokens, 100.0% Uptime über 24 Stunden und eine beobachtete Antwort von 2941 ms. DeepSeek weist außerdem darauf hin, dass die allgemeinen API-Preise in naher Zukunft steigen könnten. Da sich Anbieterpreise ändern können, lautet die sichere Formulierung für Veröffentlichungen: Prüfen Sie den Live-Katalog von CometAPI und die offiziellen Preise von DeepSeek, bevor Sie Produktionsbudgets festlegen.
Praktische Empfehlungen für Entwickler und Teams
- Beginnen Sie mit Flash-0731 für agentisches Coding — Das Kosten/Leistungs-Verhältnis ist derzeit herausragend für Terminal-, Repository- und Multi-Tool-Workflows. Nutzen Sie für die schwierigsten Aufgaben max Reasoning-Aufwand + Harness-ähnliche Loops.
- Für lokale Inferenz von Hugging Face laden und den offiziellen vLLM/SGLang-Rezepten folgen, die DSpark aktivieren.
- Integrieren Sie über die Responses API, wenn Sie bereits Codex einsetzen oder moderne Tool-Calling-Semantik wünschen.
- Self-Hosting oder Nutzung quantisierter Gewichte für maximale Kostentransparenz und Datensouveränität.
- Intelligentes Routing — Flash für Volumen, Pro (oder andere große Modelle) für den Long Tail extrem harter Probleme.
- Ziehen Sie CometAPI in Betracht für vereinfachten Multi-Model-Zugriff, besonders wenn Ihr Stack bereits DeepSeek mit anderen Anbietern mischt.
Fazit
DeepSeek-V4-Flash-0731 markiert einen Wendepunkt für effiziente Agenten-KI. Durch frontiernahe Agentenleistung aus einem relativ kompakten MoE (13B aktiv) mittels fokussiertem Post-Training — und zusammen mit einem zweckgebauten Harness sowie moderner API-Kompatibilität (Responses + Codex) — setzt DeepSeek neue Maßstäbe für kosteneffektive Coding- und Automatisierungsagenten.
Ob Sie die offenen Gewichte selbst hosten, die offizielle API aufrufen oder über ein einheitliches Gateway wie CometAPI routen: V4-Flash-0731 + das sich entwickelnde Harness-Ökosystem bietet eine leistungsstarke, kosteneffektive Basis für die nächste Generation von KI-Agenten.
FAQs
Was ist DeepSeek V4 Flash 0731?
DeepSeek V4 Flash 0731 ist der offizielle Public-Beta-Release von DeepSeek V4 Flash auf der DeepSeek API, angekündigt im Änderungsprotokoll vom 31. Juli 2026. Es ersetzt die Preview-Version, behält aber denselben API-Modellnamen deepseek-v4-flash bei.
Was ist neu in DeepSeek V4 Flash 0731?
Die wichtigsten Änderungen sind stärkere Agenten-Benchmark-Performance, native Unterstützung der Responses API, Codex-Anpassung und ein neu post-trainiertes offizielles V4-Flash-Build. DeepSeek sagt, dass Architektur und Größe des Modells gegenüber dem Preview gleich geblieben sind.
Unterstützt DeepSeek V4 Flash 0731 Codex?
Ja. DeepSeeks Codex-Leitfaden sagt, dass derzeit nur deepseek-v4-flash die Codex-Integration unterstützt. Es funktioniert über die Responses API und kann für die Codex-CLI, die ChatGPT-Desktop-App und die Codex-IDE-Extension für VS Code konfiguriert werden.
Was ist DeepSeek Harness?
DeepSeek Harness ist DeepSeeks Agenten-Framework, um Sprachmodelle in autonome Coding- oder Workflow-Agenten zu verwandeln. Öffentliche Berichte beschreiben ein Harness als Schicht, die Tools, Kontext, Dateien, Befehlsausführung und mehrstufige Workflows verwaltet. DeepSeek nutzte im Benchmark-Setup von V4 Flash 0731 den Minimalmodus von Harness.
Wie kann ich über CometAPI auf DeepSeek V4 Flash zugreifen?
Verwenden Sie CometAPIs OpenAI-kompatiblen Endpunkt mit der Modell-ID deepseek-v4-flash. Die CometAPI-Modellseite bietet cURL-, Python- und JavaScript-Beispiele für /v1/chat/completions sowie Modellspezifikationen, Preise und Uptime-Informationen.
Ist DeepSeek V4 Flash besser als DeepSeek V4 Pro?
Für die Benchmark-Tabelle vom 31. Juli schlägt V4 Flash 0731 das V4-Pro-Preview über die aufgeführten Agenten-Benchmarks hinweg. Das bedeutet nicht, dass Flash immer besser als Pro ist. V4 Pro ist größer und bleibt bei vielen wissenslastigen und schwierigen Reasoning-Aufgaben in der Model Card stärker. Nutzen Sie Flash als Standard für kostensensitive Agenten-Workflows und Pro als Eskalationspfad.
