GLM-5.3 FlashX and MiniMax H3 Max are now live on CometAPI →
ai-model/CometAPI 리서치

Qwen3.8-Omni-Flash는 무엇이며 어떻게 이용하나요?

Qwen3.8-Omni-Flash가 무엇인지, 오디오·비디오 에이전트, 아키텍처, 벤치마크, 가격 책정, 제한 사항, 그리고 API 액세스를 포함해 알아보세요.

CometAPI
Mia MarenAI 모델 및 API 리서치 팀
업데이트됨 Sep 21, 2026 10 분 읽기
Qwen3.8-Omni-Flash는 무엇이며 어떻게 이용하나요?
이 패턴 사용

첫 API 호출하기.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR

Qwen3.8-Omni-Flash는 텍스트, 이미지, 오디오, 비디오 이해를 위한 Alibaba Qwen의 네이티브 옴니모달 모델로, 출력 모달리티는 텍스트입니다. 2026년 9月 18일에 발표되었으며, 100만 토큰 컨텍스트 윈도우, 네이티브 오디오-비디오 추론, 조정 가능한 사고, 함수 호출, 웹 검색, 공간 오디오 이해, 도구 사용을 결합합니다.

가장 중요한 변화는 단순히 더 나은 비디오 이해가 아닙니다. Qwen은 이 모델을 에이전틱 기능을 중심으로 구축한 첫 옴니모달 모델로 설명합니다: 보고 듣는 것을 이해하고, 다음에 할 일을 계획하며, 도구를 호출하고, 브이로그 편집, 비디오 번역, 영화 요약 제작, 회의 분석, 멀티미디어 리서치 같은 장기 작업을 수행할 수 있습니다.

출시 시점에 Qwen은 Qwen3.5-Omni-Plus 대비 29개 평가에서 평균 25% 이상 향상을 보고했습니다. 이는 독립 평가가 아닌 벤더 보고의 출시 결과입니다.

Key Takeaways

  • 네이티브 옴니모달 입력: Qwen3.8-Omni-Flash는 텍스트, 이미지, 오디오, 비디오를 입력으로 받으며, 현재는 텍스트로 응답합니다.
  • 에이전틱 미디어 워크플로우: 미디어 이해를 계획, 함수 호출, 웹 검색과 결합할 수 있습니다.
  • 긴 컨텍스트와 오디오 심도: 호스팅된 모델은 100만 토큰 컨텍스트 윈도우를 제공하며, 다국어, 스테레오, 1차 앰비소닉 오디오를 지원합니다.
  • 벤더 보고 벤치마크 향상: 가장 큰 개선은 멀티모달 에이전트, 장기 오디오 이해, 화자 분할, 오디오 그라운딩에서 나타납니다.
  • 호스팅 제공: 모델은 호스팅형 API를 통해 이용 가능하며, 멀티모달 에이전트 워크플로우용 Qwen-MM-Plugins는 별도로 오픈 소스로 제공됩니다.

개발자는 통합 API 워크플로우를 통해 CometAPI의 Qwen3.8-Omni-Flash API에 접근할 수 있습니다.

What Is Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash는 Qwen의 차세대 네이티브 옴니모달 모델입니다. 오디오나 비디오를 단순 전처리 산출물로 다루는 대신, 하나의 워크플로우 안에서 텍스트, 시각 프레임, 음성, 환경음, 시간적 관계를 함께 추론합니다. 지원 입력은 텍스트, 이미지, 오디오, 비디오이며, 현재 출력은 텍스트입니다.

이 출력 구분은 중요합니다. 공식 Alibaba Cloud 문서는 Qwen3.8-Omni-Flash를 멀티모달 이해와 에이전트 실행에 포지셔닝하며, 음성 출력 사용 사례는 명시적으로 오디오 생성을 지원하는 Qwen Omni 변형과 더 잘 맞습니다.

출시 관점은 “미디어를 지각한다”에서 “이해하고, 계획하고, 실행하고, 전달한다”로 이동했습니다. 이는 단순 요약이 아니라 미디어로 무언가를 수행해야 하는 비디오 편집, 멀티미디어 리서치, 회의 분석, 학습용 비디오 처리 등 워크플로우에서 모델을 관련 있게 만듭니다.

Qwen3.8-Omni-Flash 사양

아래 사양 표는 공식 Alibaba Cloud 및 QwenCloud 모델 페이지를 기반으로 하며, 제한과 가격은 지역에 따라 달라질 수 있으므로 공개 또는 배포 전 재확인해야 합니다.

사양Qwen3.8-Omni-Flash — 공식 모델 페이지
개발사Alibaba Qwen
출시일2026년 9월 18일
모델 유형네이티브 옴니모달 모델
입력 / 출력텍스트, 이미지, 오디오, 비디오 / 텍스트
컨텍스트 윈도우1,000,000 토큰
최대 입력일반 991,808 토큰; 사고 모드에서 983,616 토큰
최대 출력131,072 토큰
최대 추론 허용치QwenCloud에서 최대 262K 토큰
사고기본 활성화; 추론 노력 구성 가능
도구 및 캐싱함수 호출, 웹 검색, 암묵적 캐시, 세션 캐시
오디오113개 언어 및 방언; 스테레오 및 4채널 FOA
API 스타일Chat Completions and Responses
QwenCloud 가격$0.15 input, $0.47 output, and $0.016 implicit-cache input per 1M tokens
가중치 공개출시 시점에 본 모델에 대해 미공개

How Does Qwen3.8-Omni-Flash Work?

QwenCloud에 따르면 Qwen3.8-Omni-Flash는 Qwen3.8-Flash-Next 아키텍처를 기반으로 구축되었습니다. 이는 아키텍처적 맥락을 제공하지만, Flash-Next에 공개된 파라미터 수를 Qwen이 해당 매핑을 확인하지 않는 한 Omni 모델의 정확한 파라미터 사양으로 자동 제시해서는 안 됩니다.

Gated DeltaNet + Qwen Sparse Attention

Flash-Next 기반은 Gated DeltaNet과 Qwen Sparse Attention을 결합합니다. 단순화하면, 순환 구성 요소는 과거 정보를 압축된 상태로 압축하고, 스파스 어텐션은 모든 토큰 쌍에 밀집 전체 어텐션을 적용하는 대신 선택된 장기 컨텍스트를 검색합니다. 이는 시퀀스 길이가 계산 비용을 지배할 수 있는 긴 오디오와 비디오 스트림에서 특히 중요합니다.

정적 지각 대신 에이전틱 지각

더 큰 변화는 시스템 차원입니다. Qwen은 모델이 긴 비디오를 능동적으로 탐색하고 모든 구간에 동일한 연산을 쓰는 대신 관련 순간에 집중할 수 있다고 말합니다. 개념적으로, 에이전트는 증거가 있을 법한 위치를 식별하고 그 순간을 더 깊게 점검하며, 이를 바탕으로 다음에 어떤 도구나 작업이 이루어져야 할지 결정합니다.

Qwen3.8-Omni-Flash의 주요 기능은 무엇인가요?

네이티브 오디오-비디오 추론

Qwen3.8-Omni-Flash는 비디오의 시각 및 오디오 스트림을 공동으로 추론합니다. 이는 답이 두 모달리티 모두에 의존할 때 중요합니다: 누가 말했는지 식별, 소리가 행동 이전인지 이후인지 판단, 음악이나 주변음을 해석, 화면에 나타나는 내용과 구어 지시를 연결하는 등의 경우입니다.

다중 화자 및 공간 오디오 이해

API는 2채널 스테레오와 4채널 1차 앰비소닉스(FOA)를 포함한 멀티채널 오디오를 지원합니다. 방향 정보를 보존하는 것은 회의 분석, 실체화 에이전트, 기록된 이벤트, 다중 화자 환경, 오디오 그라운딩에 도움을 줄 수 있습니다.

조정 가능한 추론 노력

사고는 기본으로 활성화되어 있습니다. 개발자는 추론 노력을 구성하여 지연과 토큰 소모를 복잡한 멀티미디어 작업에서 더 깊은 추론과 균형 맞출 수 있습니다.

함수 호출과 웹 검색

함수 호출과 웹 검색은 에이전틱 포지셔닝의 핵심입니다. 비디오, 이미지, 오디오 파일을 이해한 후, 모델은 구조화된 인자를 외부 도구에 전달하고, 추가 정보를 검색하거나, 모델 외부에서 워크플로우를 계속할 수 있습니다.

Qwen-MM-Plugins

Qwen은 멀티모달 네이티브 에이전트 하네스용 Apache-2.0 툴킷인 Qwen-MM-Plugins도 공개했습니다. 워크플로우에는 영상 제작, 비디오-노트 변환, 시연 비디오로부터 재사용 가능한 스킬 학습, 시청각 메모리가 포함됩니다.

벤치마크에서 Qwen3.8-Omni-Flash는 얼마나 좋은가요?

Qwen3.8-Omni-Flash는 텍스트와 코딩에서도 여전히 좋은가요?

Qwen의 출시 결과에 따르면 Omni 모델은 여러 코딩 및 추론 평가에서 관련 Flash 텍스트 모델에 근접합니다. Qwen은 LiveCodeBench v6에서 92.6, SWE-bench Pro에서 63.3, GPQA Diamond에서 91.0을 보고했습니다. 이는 Qwen의 출시 설정 하의 벤더 보고 결과이며, 실제 프로덕션에서 사용하는 코딩 작업과 에이전트 하네스에 대해 검증되어야 합니다.

Qwen은 Qwen3.5-Omni-Plus 대비 29개 평가에서 평균 25% 이상 향상을 보고합니다. 아래 표는 공식 출시 벤치마크 결과를 요약합니다. 이는 퍼스트 파티 결과이며, 공개 시점에는 아직 독립적으로 재현되지 않았습니다.

평가 조건: 정적 행은 Qwen의 출시 설정 하에서 단일 모델 실행을 측정합니다. “+ agent”로 표시된 행은 주변 에이전트 하네스, 검색 또는 반복적 미디어 점검을 포함합니다. 공식 출시 자료에서 프롬프트 템플릿, 샘플링 설정, 미디어 전처리 및 하네스 버전을 확인해야 하며; 해당 세부가 공개되지 않은 경우 결과는 독립 재현 가능한 결과가 아닌 벤더 보고로 취급되어야 합니다.

더 큰 의미는 멀티모달 이해에서 멀티모달 실행으로의 전환입니다. 기존 파이프라인은 오디오를 전사하고, 비디오 프레임을 샘플링하여 LLM에 전달하고, 답을 생성한 뒤 실제 작업은 별도의 애플리케이션 로직에 의존하는 경우가 많았습니다. Qwen3.8-Omni-Flash는 그 루프의 더 많은 부분을 하나의 에이전트 시스템으로 압축하도록 설계되었습니다.

미디어 제작 에이전트는 편집을 계획하기 전에 영상과 오디오를 점검할 수 있습니다. 회의 에이전트는 화자 정체성과 발화 내용, 프레젠테이션 비주얼을 결합할 수 있습니다. 리서치 에이전트는 수시간의 시청각 자료에서 관련 순간을 찾아낸 뒤 외부 맥락을 검색할 수 있습니다. 이러한 관점에서 오디오와 비디오는 수동 첨부물이 아니라 에이전트의 작업 컨텍스트가 됩니다.

오디오-비디오 에이전트

Benchmark — 공식 출시 자료Qwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
WildClawBench-MM71.034.558.9
UniClawBench69.667.169.0
AgenticVBench36.814.545.0
OmniGAIA74.078.6
StreamingBench80.857.179.9

가장 큰 세대 도약은 WildClawBench-MM으로, Qwen은 34.5에서 71.0으로 상승했다고 보고합니다. AgenticVBench도 크게 개선되었으며, 해당 벤치마크에서는 Gemini 3.8 Flash가 여전히 앞섭니다. 패턴은 따라서 보편적 “단일 모델이 모든 것을 이김” 결과가 아닙니다.

오디오-비디오 이해 및 추론

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
OmniVideoBench63.453.865.2
OmniVideoBench + Qwen Code agent67.865.2
Video-MME-v265.071.0
Video-MME-v2 + agent71.371.0
LVOmniBench63.370.7
LVOmniBench + agent73.670.7
JointAVBench75.970.4

정적 행은 혼재되어 있습니다. Gemini는 몇몇 일반적 비디오 추론 테스트를 선도하지만, Qwen의 결과는 종종 에이전트 루프 안에서 상승합니다. 이 구분은 프로덕션 애플리케이션이 비교 가능한 검색, 도구 또는 반복 점검을 사용하는 경우에만 의미가 있습니다.

오디오 및 다중 화자 이해

BenchmarkQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
LongAudioSpan82.774.479.3
AliMeeting DER ↓3.488.172.6
AliMeeting cpWER ↓17.289.653.1
FLEURS-ASR WER ↓9.37.27.9
VoiceBench91.692.992.3

회의 관련 행이 두드러지며, FLEURS-ASR과 VoiceBench는 전작 대비 개선되지 않습니다. 출시 결과는 따라서 균일한 음성 인식 승리라기보다 더욱 풍부한 다중 화자, 공간, 장기 컨텍스트 오디오 이해를 가리킵니다.

Qwen3.8-Omni-Flash vs Qwen3.5-Omni-Plus vs Gemini 3.8 Flash

이 표는 Qwen의 공식 제품 정보와 Google의 공식 Gemini 3.8 Flash 사양을 결합합니다. 벤치마크 비교는 여전히 Qwen이 실행한 것이며, 중립적 제3자 순위로 취급되어서는 안 됩니다.

DimensionQwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
ArchitectureQwen3.8-Flash-Next 기반; Omni의 정확한 파라미터 매핑은 공개되지 않음이전 Qwen Omni 세대Google 독자 Gemini 아키텍처
Context window1M tokens더 작은 배포 한도1,048,576 input tokens
Reasoning조정 가능한 추론 노력; 사고 기본 활성화인용된 배포에서는 기본 활성화 추론 모드에 상응하는 기능 없음낮음, 중간, 높음 사고 수준
Multimodal inputText, image, audio, videoText, image, audio, videoText, image, video, audio and PDF
OutputTextText and supported speech workflowsText
Coding강한 벤더 보고 코딩 점수; 주요 차별화 요소는 아님주요 포지셔닝 아님장기 소프트웨어 엔지니어링 및 에이전트를 위해 설계됨
API availabilityChat Completions and Responses; hosted APIHosted Qwen APIsGemini API; generally available
ToolsFunction calling and web searchFunction calling and web searchFunction calling, search grounding, code execution and other built-in tools
Published API pricingQwenCloud: $0.15 input / $0.47 output per 1M tokens지역 및 엔드포인트에 따라 다름Google introductory price: $0.75 input / $3.75 output per 1M tokens through December 31, 2026
Best fit미디어 에이전트 및 분석Omni 대화 및 음성 출력광범위한 멀티모달, 코딩 및 자율 에이전트 워크플로우

Qwen3.5-Omni-Plus는 음성 생성이 필요한 경우 여전히 유효합니다. Qwen3.8-Omni-Flash는 효율적 오디오-비디오 이해와 도구 중심 실행에 보다 명확히 최적화되어 있습니다.

Gemini 3.8 Flash와 비교하면 Qwen의 평가는 혼재되어 있습니다: Qwen3.8-Omni-Flash는 오디오, 다중 화자 처리, 그라운딩 및 여러 에이전트 워크플로우에서 경쟁력이 있는 반면, Gemini는 일부 정적 비디오 추론 테스트를 선도합니다. 합리적 비교는 워크로드별이어야 합니다.

통합 접근을 평가하는 개발자는 표 밖에서 CometAPI의 Gemini 3.8 Flash API, CometAPI의 Qwen3.8-Flash API, CometAPI의 Qwen3.8-Flash-Next API를 비교하여 기술 출처 링크와 제품 접근 링크를 구분할 수 있습니다.

Limitations of Qwen3.8-Omni-Flash

  • 텍스트 전용 출력: 오디오와 비디오를 이해하지만 응답 모달리티로 음성을 생성하지 않습니다.
  • 호스팅 배포: 출시 시점에 Qwen3.8-Omni-Flash의 가중치 공개는 발표되지 않았습니다.
  • 최신 벤치마크: 헤드라인 비교는 주로 퍼스트 파티 결과이며 독립적 재현이 필요합니다.
  • 에이전트 하네스 영향: 일부 점수는 검색, 도구 환경 또는 반복적 검사 등을 포함하며, 순수 모델만의 결과와 혼동되어서는 안 됩니다.
  • 워크플로우 의존 비용: 검색, 캐싱 또는 표적 검사 대신 애플리케이션이 대규모 구간을 반복 재처리하면 긴 비디오는 여전히 비용이 많이 들 수 있습니다.

Who Should Use Qwen3.8-Omni-Flash?

Qwen3.8-Omni-Flash는 오디오나 비디오가 단순 첨부물이 아니라 작업의 일부인 경우에 가장 흥미롭습니다. 적합한 사용 사례로는 회의 인텔리전스, 장문 미디어 검색, 비디오 번역 파이프라인, 튜토리얼-노트 워크플로우, 미디어 제작 에이전트, 시청각 아카이브가 포함됩니다.

일반적인 텍스트 챗에는 전용 Flash 텍스트 모델이 더 단순할 수 있습니다. 음성 출력 애플리케이션에는 명시적으로 오디오 생성을 지원하는 Omni 모델이 더 적합할 수 있습니다. 보고, 듣기, 추론, 실행을 결합하는 워크플로우에는 Qwen3.8-Omni-Flash가 Qwen 라인업에서 더 돋보이는 옵션입니다.

Conclusion

Qwen3.8-Omni-Flash는 단순한 또 하나의 멀티모달 Flash 릴리스가 아니라 에이전틱 오디오-비디오 모델로 이해하는 것이 가장 적절합니다. 100만 컨텍스트, 네이티브 오디오-비디오 추론, 다중 화자 및 공간 오디오 기능, 조정 가능한 사고, 함수 호출, 검색, Qwen-MM-Plugins 생태계는 모두 동일한 전환을 지향합니다: 멀티미디어를 이해하는 데서 멀티미디어로 실제 작업을 수행하는 것으로.

출시 데이터는 특히 에이전틱 워크플로우와 복잡한 오디오 시나리오에서 Qwen3.5-Omni-Plus 대비 상당한 세대 개선을 가리킵니다. Gemini 3.8 Flash 대비 Qwen의 자체 수치는 더 균형적입니다. 따라서 중요한 질문은 어느 모델이 한 표에서 승리하느냐가 아니라, 어떤 모델-하네스 조합이 목표 워크플로우를 정확하고 경제적으로 완수하느냐입니다.

학습 계속하기

이 글을 다음 결정과 연결하세요.

모든 주제 보기
게시일 Sep 21, 2026
최종 업데이트 Sep 21, 2026
3 회 조회
명확성, 출처 표기 및 최신 API 용어에 대해 검토되었습니다.

AI 개발 비용을 20% 절감할 준비가 되셨나요?

몇 분 안에 무료로 시작하세요. 무료 체험 크레딧 제공. 신용카드 불필요.

더 보기