DeepSeek V4.1 Flash zastępuje krótkotrwałą betę wersją produkcyjną opartą na asymetrycznych obliczeniach, natywnej multimodalności, mocniejszych benchmarkach dla agentów i wyraźnie niższych cenach API.
TL;DR
DeepSeek V4.1 Flash to teraz oficjalny model API o otwartych wagach, a nie wygasający endpoint beta. DeepSeek podaje, że jest to model Mixture-of-Experts o 552B parametrach, wykorzystujący nową architekturę Causal-Encoder-Decoder. Podczas przetwarzania wejścia aktywowanych jest tylko 8B parametrów, a podczas generowania wyjścia 16B. Ten asymetryczny projekt ma ograniczać nakłady obliczeniowe na długie prompty bez osłabiania etapu autoregresywnego generowania.
Produkcyjna nazwa modelu API to deepseek-flash. Obsługuje okno kontekstu 1M tokenów, do 384K tokenów wyjściowych, tryb myślenia i tryb bez myślenia, wyjście JSON, wywołania narzędzi, Responses API, interfejs kompatybilny z Anthropic oraz natywne wejście wizji. Oficjalna tabela benchmarków DeepSeek pokazuje istotne zyski względem V4 Flash 0731 i V4 Pro 0813 w zadaniach kodowania, agentowych, cyberbezpieczeństwa i multimodalnych.
Zmiana cen jest równie istotna. W godzinach szczytu V4.1 Flash kosztuje $0.006 za milion tokenów wejściowych cache-hit, $0.30 za milion tokenów wejściowych cache-miss oraz $1.20 za milion tokenów wyjściowych. Stawki poza szczytem są o połowę niższe.
Kluczowe wnioski
- DeepSeek V4.1 Flash to wydany model z otwartymi wagami; tymczasowy identyfikator
deepseek-v4.1-flash-expires-on-0910nie jest już właściwym odniesieniem produkcyjnym. - Jego projekt MoE 552B aktywuje 8B parametrów dla wejścia i 16B dla wyjścia, co daje inny profil efektywności niż architektura V4 Flash o 284B łącznych/13B aktywnych.
- Natywna multimodalność jest częścią głównego modelu zamiast oddzielnej gałęzi Vision Exp.
- Oficjalne porównanie pokazuje, że V4.1 Flash wyprzedza V4 Pro 0813 w większości wybranych benchmarków agentowych i kodowania, choć nie prowadzi we wszystkich benchmarkach wiedzy czy terminalowych wobec każdego czołowego konkurenta.
- Globalna pamięć podręczna KV spada do 890 bajtów na token, około 3,9 razy mniej niż V4 Flash i mniej więcej do jednej czwartej poprzedniego rozmiaru.
- Ceny API w szczycie to $0.006 za wejście cache-hit, $0.30 za wejście cache-miss i $1.20 za wyjście na milion tokenów; poza szczytem ceny są o 50% niższe.
Czym jest DeepSeek V4.1 Flash?
DeepSeek V4.1 Flash to wrześniowy 2026 podstawowy model DeepSeek skoncentrowany na efektywności w zakresie rozumowania, kodowania, agentów i multimodalnego rozumienia. Oficjalne ogłoszenie opisuje go jako model MoE o 552B parametrach, który zwiększa możliwości, jednocześnie zmniejszając ilość obliczeń i pamięci potrzebnych do przetwarzania wejścia.
Kluczowa zmiana ma charakter architektoniczny. Wcześniejszy V4 Flash używał jednego budżetu aktywnych parametrów w całym wnioskowaniu. V4.1 Flash rozdziela etapy wejścia i wyjścia: podczas kodowania promptu aktywnych jest 8B parametrów, a podczas generowania odpowiedzi 16B. DeepSeek nazywa ten projekt Causal-Encoder-Decoder.
| Date | Status | Model ID |
|---|---|---|
| Sep 8 | Limited beta | deepseek-v4.1-flash-expires-on-0910 |
| Sep 10 | Production release | deepseek-flash |
Specyfikacja DeepSeek V4.1 Flash:
| Specification | DeepSeek V4.1 Flash |
|---|---|
| Release status | Oficjalne wydanie API i model o otwartych wagach |
| Architecture | Mixture-of-Experts z architekturą Causal-Encoder-Decoder |
| Total parameters | 552B |
| Activated parameters | 8B dla wejścia; 16B dla wyjścia |
| Context window | 1M tokenów |
| Maximum output | 384K tokenów |
| Input modalities | Tekst i obrazy |
| Output modality | Tekst |
| Production API model name | deepseek-flash |
| Thinking modes | Tryb myślenia i tryb bez myślenia |
| API features | Wyjście JSON, wywołania narzędzi, Responses API, Anthropic API, uzupełnianie prefiksu, FIM completion |
| Open weights | Wydane na Hugging Face |
Jak działa DeepSeek V4.1 Flash: Causal-Encoder-Decoder
Tradycyjne modele językowe typu tylko decoder używają zasadniczo tego samego dużego stosu do przetwarzania promptu i generowania tokenów. DeepSeek V4.1 Flash przypisuje różną aktywną pojemność do tych etapów.
Na etapie wejścia model przetwarza prompt z aktywną stopą 8B. Ten etap może efektywnie analizować dostarczony kontekst tekstowy lub obrazowy, ponieważ pełna odpowiedź nie została jeszcze wygenerowana. Na etapie wyjścia model aktywuje 16B parametrów i kontynuuje przyczynowe generowanie token po tokenie. Projekt oszczędza zatem obliczenia na kodowaniu promptu, zachowując większą aktywną pojemność dla rozumowania i generowania odpowiedzi.
DeepSeek nie opublikował wszystkich szczegółów implementacyjnych w ogłoszeniu, więc najbezpieczniejszy opis jest funkcjonalny: architektura jest asymetryczna, etapy wejścia i wyjścia używają różnych budżetów aktywnych parametrów, a powstały system zmniejsza pamięć i koszt wnioskowania.
Redukcja pamięci podręcznej KV
Efekt pamięci jest mierzalny. DeepSeek raportuje 890 bajtów globalnej pamięci podręcznej KV na token dla V4.1 Flash, w porównaniu z 3,514 bajtami dla V4 Flash, 48,068 bajtami dla V3.2 i 389,120 bajtami dla V1. Wartość dla V4.1 jest około 3,9 razy mniejsza niż V4 Flash.
Dla agentów z długim kontekstem ma to znaczenie wykraczające poza pojedynczy benchmark. Mniejsza pamięć podręczna KV redukuje obciążenie pamięci o wysokiej przepustowości (HBM) podczas aktywnego żądania i zmniejsza ilość stanu, który musi zostać przeniesiony do wolniejszego magazynu. DeepSeek podaje, że V4.1 Flash potrzebuje mniej więcej jednej czwartej HBM i jednej ósmej pojemności SSD wymaganych przez poprzedni model dla porównywalnych obciążeń pamięci podręcznej.
Funkcje DeepSeek V4.1 Flash
Natywne wejście multimodalne
V4.1 Flash akceptuje obrazy w ramach głównego API modelu. Zastępuje to wcześniejszy podział między tekstowym V4 Flash a eksperymentalnym endpointem V4 Flash Vision. Programiści mogą teraz budować przepływy pracy związane z rozumieniem dokumentów, analizą wykresów, interpretacją zrzutów ekranu i agentami wizualnymi na tym samym rodzinie modelu produkcyjnego.
Wnioskowanie na długim kontekście
Oficjna specyfikacja API zachowuje okno kontekstu 1M tokenów i pozwala na do 384K tokenów wyjściowych. Czyni to model odpowiednim do kodowania na skalę repozytoriów, analizy wielodokumentowej, długotrwałych sesji agentów i przepływów pracy wymagających zachowania dużej historii narzędzi.
Funkcje produkcyjnego API
Model obsługuje tryb myślenia i tryb bez myślenia, strukturyzowane wyjście JSON, wywołania narzędzi, Responses API, interfejs kompatybilny z Anthropic, uzupełnianie prefiksu czatu oraz uzupełnianie FIM w trybie bez myślenia. Te możliwości czynią V4.1 Flash bezpośrednim zamiennikiem produkcyjnym dla wielu obciążeń agentowych i kodowania w V4 Flash.
Otwarte wagi
DeepSeek opublikował wagi V4.1 Flash oraz raport techniczny. Wydanie poprawia replikowalność, ale model pozostaje niezwykle duży: ogłoszenie DeepSeek prosi organizacje zainteresowane dużymi wdrożeniami o planowanie około 2,000 GPU plus klaster pamięci masowej.
Wyniki benchmarków DeepSeek V4.1 Flash
Oficjalne wyniki zmieniają wcześniejszą ocenę, że V4.1 nie miał dowodów benchmarkowych. DeepSeek udostępnia teraz obszerną tabelę obejmującą wiedzę, matematykę, kodowanie, agentów terminalowych, cyberbezpieczeństwo, automatyzację i zadania agentów multimodalnych.

| Benchmark | DeepSeek V4.1 Flash | V4 Pro 0813 | V4 Flash 0731 |
|---|---|---|---|
| GPQA Diamond | 90.9 | 92.4 | 89.9 |
| Codeforces rating | 3471 | 3348 | 3289 |
| MathArena Apex | 65.6 | 65.3 | 58.6 |
| Terminal-Bench 2.1 | 90.6 | 87.9 | 82.7 |
| DeepSWE v1.1 | 74.2 | 62.7 | 54.4 |
| NL2Repo-Bench | 65.4 | 61.5 | 54.2 |
| CyberGym | 88.1 | 83.3 | 76.7 |
| Automation-Bench | 54.8 | 43.2 | 37.7 |
W tym wybranym zestawie ośmiu benchmarków V4.1 Flash pokonuje V4 Pro 0813 w siedmiu testach i przewyższa V4 Flash 0731 we wszystkich ośmiu. Największe zyski pojawiają się w inżynierii oprogramowania i agentach: DeepSWE rośnie o 11.5 punktu względem V4 Pro i o 19.8 względem V4 Flash, podczas gdy Automation-Bench poprawia się o 11.6 i 17.1 punktu odpowiednio.
Wyniki nadal wymagają ostrożnej interpretacji. V4.1 Flash uzyskuje niższy wynik niż V4 Pro w GPQA Diamond, a pełna oficjalna tabela pokazuje, że Claude Opus 5 i GPT-5.6 Sol pozostają na prowadzeniu w Terminal-Bench 3.0. Użyteczny wniosek jest taki, że V4.1 Flash materialnie poprawia równowagę między efektywnością a możliwościami; tabela benchmarków nie dowodzi uniwersalnego przywództwa we wszystkich zadaniach.
Cennik API DeepSeek V4.1 Flash
DeepSeek stosuje rozliczanie w szczycie i poza szczytem. Godziny szczytu to 01:00–04:00 i 06:00–10:00 UTC, od poniedziałku do piątku; wszystkie pozostałe okresy, w tym weekendy, używają stawki poza szczytem. Obecna dokumentacja cenowa stwierdza, że ceny poza szczytem są o połowę niższe.
| Price per 1M tokens | V4.1 Flash off-peak | V4.1 Flash peak | V4 Pro 0813 off-peak | V4 Pro 0813 peak |
|---|---|---|---|---|
| Cache-hit input | $0.003 | $0.006 | $0.022 | $0.044 |
| Cache-miss input | $0.15 | $0.30 | $0.66 | $1.32 |
| Output | $0.60 | $1.20 | $1.98 | $3.96 |

Oszczędności są znaczące. Dla obciążenia używającego 100 milionów tokenów wejściowych cache-miss i 10 milionów tokenów wyjściowych V4.1 Flash kosztuje około $21 poza szczytem lub $42 w szczycie. Ten sam mix tokenów przy opublikowanych stawkach V4 Pro 0813 kosztuje około $85.80 poza szczytem lub $171.60 w szczycie. V4.1 Flash jest w tym przykładzie tańszy o około 75.5%.
Cache prompty wzmacnia przewagę dla agentów, którzy wielokrotnie ponownie używają instrukcji systemowych, kontekstu repozytorium lub dokumentów. Stawka za cache-hit w V4.1 jest 50 razy niższa niż za cache-miss w obu okresach rozliczeniowych.
DeepSeek V4.1 Flash vs V4 Flash vs V4 Pro
| Dimension | DeepSeek V4.1 Flash | DeepSeek V4 Flash | DeepSeek V4 Pro |
|---|---|---|---|
| Total parameters | 552B | 284B | 1.6T |
| Activated parameters | 8B input / 16B output | 13B | 49B |
| Architecture focus | Asymetryczna efektywność wejście/wyjście | Lekki V4 MoE | Maksymalna pojemność V4 |
| Native vision | Yes | Osobny wariant Vision Exp | No |
| Context window | 1M | 1M | 1M |
| Maximum output | 384K | 384K | 384K |
| API status on DeepSeek | Aktualny model produkcyjny | Wycofany; nazwa legacy kieruje do V4.1 Flash | Planowane przekierowanie do V4.1 Flash od 14 września 2026 |
| Best fit | Agenci ogólni, kodowanie, wizja, wysoka przepustowość | Zgodność migracji wyłącznie | Istniejące obciążenia Pro podczas przejścia |
V4.1 Flash ma większą liczbę parametrów niż V4 Flash, ale może być tańszy w serwowaniu, ponieważ jego etap wejścia aktywuje tylko 8B parametrów i używa znacznie mniejszej pamięci podręcznej KV. W porównaniu z V4 Pro, aktywuje znacznie mniej parametrów, a mimo to przewyższa Pro w większości wybranych powyżej benchmarków agentowych i kodowania.
Dostęp do API i migracja
Produkcyjna nazwa modelu DeepSeek to deepseek-flash. Istniejące aplikacje mogą zachować zgodny z OpenAI bazowy URL https://api.deepseek.com lub zgodny z Anthropic bazowy URL https://api.deepseek.com/anthropic.
- Zaktualizuj nazwę modelu do
deepseek-flash. - Zachowaj istniejący bazowy URL DeepSeek i metodę uwierzytelniania.
- Przetestuj tryb myślenia, wywołania narzędzi, wejście wizji, opóźnienia i użycie tokenów z produkcyjnymi promptami.
- Monitoruj aliasy legacy:
deepseek-v4-flashideepseek-v4-flash-vision-expkierują teraz do V4.1 Flash, podczas gdydeepseek-v4-proma być przekierowany do V4.1 Flash od 14 września do czasu przyszłego wydania V4.1 Pro.
Dla użytkowników CometAPI, DeepSeek V4.1 API w CometAPI jest teraz dostępny obok istniejącego DeepSeek V4 Flash API. Przed przełączeniem ruchu produkcyjnego potwierdź ostateczną nazwę modelu, ceny i mapowanie aliasów w panelu CometAPI, ponieważ dostawcy zewnętrzni mogą różnić się od oficjalnych nazw API i stawek rozliczeniowych DeepSeek.
Kto powinien używać DeepSeek V4.1 Flash?
V4.1 Flash doskonale nadaje się do agentów kodujących, analizy repozytoriów, automatyzacji terminalowej, multimodalnych przepływów pracy z dokumentami, asystentów długiego kontekstu oraz systemów o wysokiej objętości używających narzędzi. Jego zyski benchmarkowe koncentrują się wokół tych samych obciążeń, które najbardziej korzystają z niższej pamięci podręcznej oraz niższych cen tokenów.
Zespoły już używające V4 Flash powinny traktować go jako bezpośredniego kandydata do migracji. Zespoły używające V4 Pro powinny testować ostrożnie, ale własne benchmarki i dane cenowe DeepSeek sprawiają, że V4.1 Flash staje się bardziej ekonomicznym domyślnym wyborem dla wielu obciążeń klasy Pro.
Samohostowanie to inna decyzja. Otwarte wagi nie czynią modelu 552B lekkim. Organizacje powinny porównać koszt dużego wdrożenia GPU i pamięci masowej z użyciem hostowanego API, zanim zdecydują się na lokalne wnioskowanie.
Ograniczenia i otwarte pytania
- Wyniki benchmarków pochodzą z oficjalnego środowiska ewaluacyjnego DeepSeek; niezależne replikacje będą potrzebne, aby zmierzyć wydajność w różnych harnessach i środowiskach narzędziowych.
- Natywne wsparcie multimodalne jest potwierdzone, ale zespoły aplikacyjne powinny zweryfikować obsługiwane formaty obrazów, rozliczanie tokenów i zachowanie wizji względem żywego API.
- Aliasy modeli legacy teraz zmieniają model stojący za istniejącą nazwą, co może zmienić wyniki bez modyfikacji kodu aplikacji.
- V4.1 Flash redukuje wymagania infrastrukturalne względem wcześniejszych modeli DeepSeek, ale jego wdrożenie z otwartymi wagami nadal wymaga znacznych zasobów obliczeniowych i pamięci masowej.
- Dedykowany endpoint V4.1 w CometAPI i ostateczne ceny należy potwierdzić w żywym konsolu przed użyciem produkcyjnym.
Werdykt końcowy
DeepSeek V4.1 Flash to duża aktualizacja architektury i produktu. Model MoE 552B łączy aktywny etap wejścia 8B, aktywny etap wyjścia 16B, natywną wizję, okno kontekstu 1M tokenów oraz silnie skompresowaną pamięć podręczną KV. Te decyzje projektowe przekładają się na mocniejsze oficjalne benchmarki kodowania i agentów przy znacznie niższych cenach API niż V4 Pro 0813.
Najbardziej praktyczna zmiana to konsolidacja. V4.1 Flash przenosi tekst, wizję, rozumowanie, użycie narzędzi i działanie na długim kontekście do jednej produkcyjnej nazwy modelu. Dla większości nowych integracji z DeepSeek deepseek-flash jest teraz logicznym punktem wyjścia; V4 Pro staje się porównaniem migracji, a nie automatycznym wyborem do najtrudniejszych zadań.
FAQ
Czy DeepSeek V4.1 Flash jest oficjalnie wydany?
Tak. Jest dostępny przez API DeepSeek pod nazwą modelu deepseek-flash, a DeepSeek opublikował otwarte wagi i raport techniczny.
Czy tymczasowy identyfikator modelu beta V4.1 nadal jest wymagany?
Nie. deepseek-v4.1-flash-expires-on-0910 był krótkotrwałym identyfikatorem beta. Aplikacje produkcyjne powinny używać deepseek-flash.
Ile parametrów ma DeepSeek V4.1 Flash?
Model ma 552B parametrów łącznie. Aktywuje 8B parametrów podczas przetwarzania wejścia i 16B podczas generowania wyjścia.
Czy DeepSeek V4.1 Flash obsługuje obrazy?
Tak. Wejście wizji jest natywne w modelu produkcyjnym, więc osobny endpoint V4 Flash Vision Exp nie jest już wymagany.
Czy V4.1 Flash jest lepszy niż V4 Pro?
Prowadzi nad V4 Pro 0813 w większości publikowanych przez DeepSeek porównań kodowania, agentów, automatyzacji i cyberbezpieczeństwa, ale V4 Pro pozostaje na prowadzeniu w GPQA Diamond. Zespoły powinny ocenić oba modele względem własnych promptów przed migracją.
Ile kosztuje API?
W godzinach szczytu stawki za milion tokenów to $0.006 dla wejścia cache-hit, $0.30 dla wejścia cache-miss oraz $1.20 dla wyjścia. Stawki poza szczytem są o połowę niższe.
Co dzieje się ze starymi nazwami modeli V4?
Nazwy legacy deepseek-v4-flash i deepseek-v4-flash-vision-exp kierują do V4.1 Flash. DeepSeek podaje, że deepseek-v4-pro będzie również kierować do V4.1 Flash od 14 września 2026 do czasu wydania V4.1 Pro.
Czy mogę używać DeepSeek V4.1 Flash przez CometAPI?
Tak. CometAPI oferuje teraz działający punkt końcowy API DeepSeek V4.1. Przed skierowaniem ruchu produkcyjnego potwierdź dokładną nazwę modelu, ceny i obsługiwane funkcje w konsoli CometAPI, ponieważ dostawcy zewnętrzni mogą stosować inne konwencje nazewnicze lub stawki rozliczeniowe niż oficjalne API DeepSeek.
