TL;DR
Qwen3.8-Omni-Flash to natywny omnimodalny model Alibaba Qwen do rozumienia tekstu, obrazu, audio i wideo, z tekstem jako modalnością wyjściową. Ogłoszony 18 września 2026 r., łączy kontekst 1M tokenów, natywne rozumowanie audio-wideo, regulowane rozumowanie, wywoływanie funkcji, wyszukiwanie w sieci, rozumienie dźwięku przestrzennego i korzystanie z narzędzi.
Najważniejsza zmiana to nie tylko lepsze rozumienie wideo. Qwen opisuje model jako pierwszy omnimodalny model zorientowany na zdolności agentowe: potrafi zrozumieć, co widzi i słyszy, zaplanować kolejne kroki, wywoływać narzędzia i realizować dłuższe zadania, takie jak montaż vlogów, tłumaczenie wideo, tworzenie streszczeń filmów, analiza spotkań i badania multimedialne.
Przy starcie Qwen zgłosił średnią poprawę o ponad 25% w 29 ewaluacjach względem Qwen3.5-Omni-Plus. Są to wyniki zgłoszone przez dostawcę przy starcie, a nie niezależne ewaluacje.
Najważniejsze wnioski
- Natywne omnimodalne wejście: Qwen3.8-Omni-Flash przyjmuje tekst, obraz, audio i wideo, a obecnie zwraca tekst.
- Agentowe przepływy pracy z mediami: Łączy rozumienie mediów z planowaniem, wywoływaniem funkcji i wyszukiwaniem w sieci.
- Długi kontekst i głębia audio: Hostowany model udostępnia 1M tokenów kontekstu i obsługuje wielojęzyczne, stereofoniczne i ambisonikę pierwszego rzędu.
- Wyniki benchmarków zgłoszone przez dostawcę: Największe poprawy dotyczą agentów multimodalnych, rozumienia długiego audio, diarizacji mówców i osadzania audio.
- Dostępność hostowana: Model jest dostępny przez hostowane interfejsy API; Qwen-MM-Plugins jest osobno open source dla przepływów pracy agentów multimodalnych.
Deweloperzy mogą uzyskać dostęp do Qwen3.8-Omni-Flash API w CometAPI w ujednoliconym przepływie API.
Czym jest Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash to nowej generacji natywny model omnimodalny Qwen. Zamiast traktować audio lub wideo jedynie jako artefakty wstępnego przetwarzania, rozumuje w jednym przepływie na podstawie tekstu, klatek wideo, mowy, dźwięków otoczenia i relacji czasowych. Obsługiwane wejścia to tekst, obrazy, audio i wideo; aktualne wyjście to tekst.
To rozróżnienie co do wyjścia ma znaczenie. Oficjalna dokumentacja Alibaba Cloud pozycjonuje Qwen3.8-Omni-Flash do multimodalnego rozumienia i wykonywania zadań przez agenta, podczas gdy przypadki wymagające generowania mowy lepiej odpowiadają wariantom Qwen Omni, które jawnie wspierają generowany dźwięk.
Sposób przedstawienia premiery przesuwa akcent z „postrzegaj media” na „zrozum, zaplanuj, wykonaj i dostarcz”. To czyni model istotnym dla montażu wideo, badań multimedialnych, analizy spotkań, przetwarzania materiałów instruktażowych oraz innych przepływów, w których model ma coś zrobić z mediami, a nie tylko je streścić.
Specyfikacje Qwen3.8-Omni-Flash
Poniższa tabela specyfikacji bazuje na oficjalnych stronach modelu Alibaba Cloud i QwenCloud; limity i ceny mogą różnić się w zależności od regionu i należy je ponownie sprawdzić przed publikacją lub wdrożeniem.
| Specyfikacja | Qwen3.8-Omni-Flash — oficjalna strona modelu |
|---|---|
| Deweloper | Alibaba Qwen |
| Data wydania | September 18, 2026 |
| Typ modelu | Natywny model omnimodalny |
| Wejście / wyjście | Tekst, obraz, audio, wideo / tekst |
| Okno kontekstu | 1,000,000 tokens |
| Maksymalne wejście | 991,808 tokens normal; 983,616 tokens in thinking mode |
| Maksymalne wyjście | 131,072 tokens |
| Maksymalny limit rozumowania | Up to 262K tokens on QwenCloud |
| Rozumowanie | Domyślnie włączone; konfigurowalny nakład rozumowania |
| Narzędzia i pamięć podręczna | Wywoływanie funkcji, wyszukiwanie w sieci, niejawna pamięć podręczna i pamięć podręczna sesji |
| Audio | 113 języków i dialektów; stereo oraz czterokanałowa FOA |
| Style API | Chat Completions i Responses |
| Cena w QwenCloud | $0.15 input, $0.47 output, and $0.016 implicit-cache input per 1M tokens |
| Otwarte wagi | Not announced for this model at launch |
Jak działa Qwen3.8-Omni-Flash?
QwenCloud podaje, że Qwen3.8-Omni-Flash zbudowano na architekturze Qwen3.8-Flash-Next. Daje to kontekst architektoniczny, ale liczby parametrów opublikowane dla Flash-Next nie powinny być automatycznie przedstawiane jako dokładna specyfikacja parametrów modelu Omni, chyba że Qwen potwierdzi to mapowanie.
Gated DeltaNet + Qwen Sparse Attention
Podstawa Flash-Next łączy Gated DeltaNet z Qwen Sparse Attention. Upraszczając: komponent rekurrentny kompresuje informacje historyczne do zwartego stanu, a rzadka atencja pobiera wybrany odległy kontekst zamiast stosować gęstą pełną uwagę do każdej pary tokenów. Ma to szczególne znaczenie dla długich strumieni audio i wideo, gdzie długość sekwencji może dominować koszt obliczeniowy.
Percepcja agentowa zamiast statycznej
Większa zmiana zachodzi na poziomie systemu. Qwen twierdzi, że model potrafi aktywnie eksplorować długie nagrania wideo i koncentrować się na istotnych momentach, zamiast wydawać równą moc obliczeniową na każdy segment. Koncepcyjnie agent identyfikuje miejsca, gdzie prawdopodobnie są dowody, analizuje je głębiej, rozumuje nad nimi, a następnie decyduje, które narzędzie lub operację wykonać dalej.
Jakie są główne funkcje Qwen3.8-Omni-Flash?
Natywne rozumowanie audio-wideo
Qwen3.8-Omni-Flash rozumuje wspólnie na podstawie strumieni wizualnego i audio wideo. Ma to znaczenie, gdy odpowiedź zależy od obu modalności: identyfikacji osoby mówiącej, ustalenia, czy dźwięk pojawił się przed czy po akcji, interpretacji muzyki lub dźwięku otoczenia czy powiązania instrukcji mówionych z tym, co widać na ekranie.
Rozumienie wielomówcowe i dźwięku przestrzennego
API obsługuje wielokanałowe audio, w tym stereo i czterokanałową ambisonikę pierwszego rzędu. Zachowanie informacji kierunkowej pomaga przy analizie spotkań, agentach ucieleśnionych, nagraniach wydarzeń, środowiskach z wieloma mówcami i osadzaniu audio.
Regulowany nakład rozumowania
Rozumowanie jest domyślnie włączone. Deweloperzy mogą regulować nakład rozumowania, równoważąc opóźnienie i zużycie tokenów z głębszym rozumowaniem dla złożonych zadań multimedialnych.
Wywoływanie funkcji i wyszukiwanie w sieci
Wywoływanie funkcji i wyszukiwanie w sieci są kluczowe dla pozycjonowania agentowego. Po zrozumieniu wideo, obrazu lub pliku audio model może przekazać ustrukturyzowane argumenty do zewnętrznego narzędzia, pobrać dodatkowe informacje lub kontynuować przepływ pracy poza modelem.
Qwen-MM-Plugins
Qwen udostępnił również Qwen-MM-Plugins, zestaw narzędzi na licencji Apache-2.0 do natywnych multimodalnych szkieletów agentów. Obejmuje przepływy pracy takie jak produkcja wideo, konwersja wideo na notatki, uczenie się powtarzalnych umiejętności z filmów instruktażowych oraz pamięć audiowizualna.
Jak Qwen3.8-Omni-Flash wypada w benchmarkach?
Czy Qwen3.8-Omni-Flash nadal dobrze radzi sobie z tekstem i kodowaniem?
Wyniki Qwen przy starcie wskazują, że model Omni pozostaje blisko spokrewnionego modelu tekstowego Flash na kilku ewaluacjach programistycznych i rozumowania. Qwen raportuje 92.6 na LiveCodeBench v6, 63.3 na SWE-bench Pro i 91.0 na GPQA Diamond. To wyniki zgłoszone przez dostawcę w konfiguracji startowej Qwen i należy je zweryfikować względem zadań programistycznych i szkieletu agenta używanego w produkcji.
Qwen podaje ponad 25% średniej poprawy w 29 ewaluacjach w porównaniu z Qwen3.5-Omni-Plus. Poniższe tabele podsumowują oficjalne wyniki benchmarków z premiery. To wyniki pierwszej strony i w momencie publikacji nie zostały jeszcze niezależnie odtworzone.
Warunki oceny: Wiersze statyczne mierzą pojedynczy przebieg modelu w konfiguracji startowej Qwen. Wiersze oznaczone „+ agent” obejmują otaczający szkielet agenta, wyszukiwanie/wydobywanie lub iteracyjną inspekcję mediów. Należy odwołać się do oficjalnych materiałów startowych w sprawie szablonów promptów, ustawień próbkowania, wstępnego przetwarzania mediów i wersji szkieletów; tam, gdzie te szczegóły nie są ujawnione, wynik należy traktować jako zgłoszony przez dostawcę, a nie niezależnie odtwarzalny.
Większe znaczenie ma przesunięcie z rozumienia multimodalnego na wykonywanie multimodalne. Wcześniejsze potoki często transkrybowały audio, próbowały klatki wideo, wysyłały te artefakty do LLM, produkowały odpowiedź, a następnie polegały na odrębnej logice aplikacji do właściwego zadania. Qwen3.8-Omni-Flash został zaprojektowany tak, by więcej z tej pętli skompresować w jeden system agenta.
Agent produkcji medialnej może przejrzeć materiały i audio, zanim zaplanuje montaż. Agent spotkań może połączyć tożsamość mówcy z treścią mówioną i materiałami wizualnymi prezentacji. Agent badawczy może zlokalizować istotne momenty w godzinach materiałów audiowizualnych, a następnie wyszukać kontekst zewnętrzny. W tym ujęciu audio i wideo stają się roboczym kontekstem dla agenta, a nie pasywnymi załącznikami.
Agenci audio‑wideo
| Benchmark — oficjalne źródło z premiery | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71.0 | 34.5 | 58.9 |
| UniClawBench | 69.6 | 67.1 | 69.0 |
| AgenticVBench | 36.8 | 14.5 | 45.0 |
| OmniGAIA | 74.0 | — | 78.6 |
| StreamingBench | 80.8 | 57.1 | 79.9 |
Największy skok generacyjny dotyczy WildClawBench-MM, gdzie Qwen podaje wzrost z 34.5 do 71.0. AgenticVBench także wyraźnie rośnie, podczas gdy Gemini 3.8 Flash pozostaje przed Qwen na tym benchmarku. Wzorzec nie jest więc uniwersalnym wynikiem „jeden model wygrywa wszystko”.
Zrozumienie i rozumowanie audio‑wideo
| Benchmark | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| OmniVideoBench | 63.4 | 53.8 | 65.2 |
| OmniVideoBench + Qwen Code agent | 67.8 | — | 65.2 |
| Video-MME-v2 | 65.0 | — | 71.0 |
| Video-MME-v2 + agent | 71.3 | — | 71.0 |
| LVOmniBench | 63.3 | — | 70.7 |
| LVOmniBench + agent | 73.6 | — | 70.7 |
| JointAVBench | 75.9 | — | 70.4 |
Wiersze statyczne są mieszane. Gemini prowadzi w kilku konwencjonalnych testach rozumowania wideo, ale wynik Qwen często rośnie wewnątrz pętli agenta. To rozróżnienie ma znaczenie tylko wtedy, gdy aplikacja produkcyjna korzysta z porównywalnego wyszukiwania, narzędzi lub iteracyjnej inspekcji.
Audio i rozumienie wielomówcowe
| Benchmark | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| LongAudioSpan | 82.7 | 74.4 | 79.3 |
| AliMeeting DER ↓ | 3.4 | 88.1 | 72.6 |
| AliMeeting cpWER ↓ | 17.2 | 89.6 | 53.1 |
| FLEURS-ASR WER ↓ | 9.3 | 7.2 | 7.9 |
| VoiceBench | 91.6 | 92.9 | 92.3 |
Wiersze dotyczące spotkań wyróżniają się najbardziej, podczas gdy FLEURS-ASR i VoiceBench nie poprawiają wyniku względem poprzednika. Dane z premiery wskazują więc raczej na bogatsze rozumienie audio wielomówcowego, przestrzennego i z długim kontekstem, niż na jednolity postęp w rozpoznawaniu mowy.
Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash
Tabela łączy oficjalne informacje produktowe Qwen z oficjalną specyfikacją Gemini 3.8 Flash od Google. Porównania benchmarków pozostają wynikiem uruchomień Qwen i nie powinny być traktowane jako neutralne rankingi stron trzecich.
| Wymiar | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| Architektura | Podstawa Qwen3.8-Flash-Next; dokładne mapowanie parametrów Omni nieujawnione | Poprzednia generacja Qwen Omni | Własnościowa architektura Gemini od Google |
| Okno kontekstu | 1M tokens | Mniejsze limity wdrożeniowe | 1,048,576 input tokens |
| Rozumowanie | Regulowany nakład rozumowania; domyślnie włączone rozumowanie | Brak równoważnego trybu rozumowania domyślnie włączonego w wskazanym wdrożeniu | Niskie, średnie i wysokie poziomy rozumowania |
| Wejście multimodalne | Tekst, obraz, audio, wideo | Tekst, obraz, audio, wideo | Tekst, obraz, wideo, audio i PDF |
| Wyjście | Tekst | Tekst oraz obsługiwane przepływy pracy z generacją mowy | Tekst |
| Programowanie | Wysokie wyniki w programowaniu wg dostawcy; nie jest to główna cecha wyróżniająca | Nie stanowi głównego pozycjonowania | Zaprojektowany pod długoterminowe zadania inżynierii oprogramowania i agentów |
| Dostępność API | Chat Completions i Responses; hostowane API | Hostowane API Qwen | Gemini API; ogólnie dostępne |
| Narzędzia | Wywoływanie funkcji i wyszukiwanie w sieci | Wywoływanie funkcji i wyszukiwanie w sieci | Wywoływanie funkcji, grounding wyszukiwania, wykonywanie kodu i inne wbudowane narzędzia |
| Opublikowane ceny API | QwenCloud: $0.15 input / $0.47 output per 1M tokens | Zależne od regionu i punktu końcowego | Google introductory price: $0.75 input / $3.75 output per 1M tokens through December 31, 2026 |
| Najlepsze zastosowanie | Agenci medialni i analityka | Rozmowy Omni i generowanie mowy | Szerokie przepływy pracy multimodalne, programistyczne i z autonomicznymi agentami |
Qwen3.5-Omni-Plus pozostaje istotny, gdy wymagane jest generowanie mowy. Qwen3.8-Omni-Flash jest wyraźniej zoptymalizowany pod efektywne rozumienie audio-wideo oraz wykonywanie zadań zorientowanych na narzędzia.
W porównaniu z Gemini 3.8 Flash, ocena Qwen jest mieszana: Qwen3.8-Omni-Flash jest konkurencyjny w audio, przetwarzaniu wielomówcowemu, osadzaniu i kilku przepływach agentowych, podczas gdy Gemini prowadzi w niektórych statycznych testach rozumowania wideo. Rozsądne porównanie jest więc specyficzne dla danego obciążenia.
Deweloperzy oceniający ujednolicony dostęp mogą porównać Gemini 3.8 Flash API w CometAPI, Qwen3.8-Flash API w CometAPI oraz Qwen3.8-Flash-Next API w CometAPI poza tabelą, aby linki do źródeł technicznych i linki dostępu do produktu pozostały rozdzielone.
Ograniczenia Qwen3.8-Omni-Flash
- Wyjście wyłącznie tekstowe: Rozumie audio i wideo, ale nie generuje mowy jako modalności odpowiedzi.
- Wdrożenie hostowane: Otwarte wagi nie zostały ogłoszone dla Qwen3.8-Omni-Flash przy starcie.
- Nowe benchmarki: Nagłówkowe porównania pochodzą głównie z pierwszej strony i wymagają niezależnej replikacji.
- Wpływ szkieletu agenta: Niektóre wyniki obejmują wyszukiwanie, środowiska narzędziowe lub iteracyjną inspekcję i nie powinny być mylone z wynikami samego surowego modelu.
- Koszt zależny od przepływu pracy: Długie nagrania wideo nadal mogą być kosztowne, jeśli aplikacja wielokrotnie przetwarza duże segmenty zamiast używać wyszukiwania, pamięci podręcznej lub celowanej inspekcji.
Dla kogo jest Qwen3.8-Omni-Flash?
Qwen3.8-Omni-Flash jest najciekawszy, gdy audio lub wideo stanowią istotę zadania, a nie załącznik wymagający jedynie streszczenia. Odpowiednie przypadki użycia obejmują inteligencję spotkań, wyszukiwanie w długich materiałach, potoki tłumaczenia wideo, przepływy „tutorial‑do‑notatek”, agentów produkcji mediów i archiwa audiowizualne.
Do konwencjonalnej rozmowy tekstowej prostszy może pozostać dedykowany model Flash tekstowy. Do zastosowań z generowaniem mowy lepiej pasuje model Omni z jawną obsługą wyjścia audio. Do przepływów łączących widzenie, słyszenie, rozumowanie i działanie, Qwen3.8-Omni-Flash jest bardziej wyróżniającą się opcją w rodzinie Qwen.
Wnioski
Qwen3.8-Omni-Flash najlepiej rozumieć jako agentowy model audio-wideo, a nie po prostu kolejny multimodalny wydań Flash. Jego kontekst 1M, natywne rozumowanie audio-wideo, możliwości wielomówcowe i dźwięku przestrzennego, regulowane rozumowanie, wywoływanie funkcji, wyszukiwanie oraz ekosystem Qwen-MM-Plugins służą temu samemu przejściu: pozwolić systemowi AI przejść od rozumienia multimediów do wykonania pracy z multimediami.
Dane z premiery wskazują na istotną poprawę generacyjną względem Qwen3.5-Omni-Plus, szczególnie w przepływach agentowych i złożonych scenariuszach audio. W porównaniu z Gemini 3.8 Flash liczby Qwen są bardziej zrównoważone. Kluczowe pytanie nie brzmi więc, który model wygrywa jedną tabelę, lecz która kombinacja modelu i szkieletu najlepiej realizuje docelowy przepływ pracy — dokładnie i ekonomicznie.
