Qwen3.8-Flash-Next 기술 사양
| 사양 | Qwen3.8-Flash-Next |
|---|---|
| 개발사 | Qwen Team, Alibaba Group |
| 모델 유형 | 비전 인코더를 포함한 멀티모달 인과 언어 모델; 초-희소 MoE |
| 메인 모델 파라미터 | 125B |
| 활성 파라미터 | 토큰당 6B |
| N-그램 임베딩 파라미터 | 추가 51B |
| MTP 파라미터 | 4B |
| 레이어 | 48 |
| 하이브리드 어텐션 패턴 | 12 x [Gated DeltaNet 레이어 3 + Qwen Sparse Attention 레이어 1] |
| MoE 전문가 | 총 512; 토큰당 라우팅 10 + 공유 1 |
| 게이티드 잔차 | 4개 분기; 보틀넥 랭크 320 |
| 네이티브 컨텍스트 윈도우 | 262,144 토큰 |
| 확장 컨텍스트 | YaRN과 함께 최대 1,000,000 토큰 |
| 모달리티 | 텍스트, 이미지, 비디오 입력; 텍스트 출력 |
| 사고 제어 | 지원되는 API에서 Thinking/Non-thinking 및 추론 노력 제어 |
| 배포 | Transformers, vLLM, SGLang, TokenSpeed 및 기타 지원되는 프레임워크 |
| 가중치 공개 | 예 |
| CometAPI 모델 ID | qwen3.8-flash-next |
Qwen3.8-Flash-Next란 무엇인가?
Qwen3.8-Flash-Next는 Alibaba의 Qwen 팀이 공개할 예정인 오픈 가중치 멀티모달 MoE 모델이다. 더 중요한 것은, 단순히 또 하나의 점진적 Qwen3.8 체크포인트가 아니라 향후 Qwen4 모델 패밀리를 구동할 예정인 아키텍처의 초기 프리뷰로 포지셔닝되어 있다는 점이다.
Qwen은 더 광범위한 Qwen4 패밀리가 도입되기 전에 이번 릴리스를 통해 차세대 아키텍처 방향을 오픈 소스 생태계에 공개하고자 한다. 이를 통해 추론 엔진 개발자, 양자화 프로젝트, 모델 서빙 프레임워크, 애플리케이션 개발자들이 아키텍처 변경에 미리 대비할 수 있다.
현재 공개된 아키텍처는 두 가지 중요한 구성 요소를 도입한다: GDN 기반 하이브리드 아키텍처와 Qwen Sparse Attention(QSA). GDN은 Qwen3-Next에서 이미 탐구된 하이브리드 어텐션 방향을 잇는, 게이트가 적용된 DeltaNet 스타일의 선형 어텐션 접근을 의미한다. QSA는 새로운 스파스 어텐션 메커니즘으로 제시되지만, 전체 기술 사양은 아직 공개적으로 문서화되지 않았다.
Qwen3.8-Flash-Next의 주요 특징
- Qwen4 아키텍처 프리뷰: Qwen3.8-Flash-Next는 다가올 Qwen4 패밀리를 구동할 아키텍처 방향의 초기 구현으로 명시적으로 포지셔닝되어 있다.
- 멀티모달 MoE 설계: 본 모델은 멀티모달 전문가 혼합(MoE) 모델로 설명되며, Qwen의 효율적인 스파스 모델 전략을 차세대 아키텍처로 확장한다.
- GDN 하이브리드 아키텍처: 본 모델은 Qwen3-Next에서 도입된 하이브리드 어텐션 연구 방향을 이어받아, 정밀한 검색이 중요한 영역에서는 기존 어텐션과, 그 외에는 효율적인 선형 어텐션 메커니즘을 결합한다. Qwen3-Next는 이 접근이 장문맥 추론 효율을 크게 개선할 수 있음을 보여주었다.
- Qwen Sparse Attention: QSA는 Flash-Next에서 공개적으로 강조된 두 가지 아키텍처 변경 중 하나다. 그 상세 구현과 정량적 이점은 아직 Qwen에 의해 문서화되지 않았다.
- 오픈 가중치 생태계 지향: 이번 릴리스는 오픈 소스 커뮤니티가 Qwen4 도래 전에 아키텍처 변경에 미리 접근할 수 있도록 해, 추론 런타임과 다운스트림 도구가 적응할 수 있게 하는 데 목적이 있다.
- Qwen3.8-Flash-Next의 코딩 및 에이전트 성능
| 벤치마크 | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
Qwen3.8-Flash-Next vs Qwen3.8-Max vs Qwen3.8-27B
| 모델 | 포지셔닝 | 아키텍처 / 규모 | 멀티모달 | 현재 상태 |
|---|---|---|---|---|
| Qwen3.8-Flash-Next | Qwen4 아키텍처 프리뷰 / 효율 지향 오픈 모델 | 멀티모달 MoE; 전체 사양 대기 중 | 예 | 출시 예정 |
| Qwen3.8-Max | 플래그십 호스티드 Qwen3.8 모델 | 대규모 MoE | 예 | 사용 가능 |
| Qwen3.8-27B | 오픈 가중치 Qwen3.8 모델 | 27B 밀집(dense) 모델 | 모델별 기능 | 사용 가능 |
Qwen3.8-Max는 이미 Alibaba의 클라우드 생태계를 통해 제공되며, 고급 추론, 시각 이해, 코딩, 에이전트 워크로드에 맞게 포지셔닝되어 있다. 현재 Qwen 문서에는 Qwen3.8-Max의 컨텍스트 윈도우가 1M 토큰으로 기재되어 있으며, CometAPI는 이미 qwen3.8-max를 제공한다.
따라서 Flash-Next는 다르게 봐야 한다: 현 단계에서의 주요 의의는 벤치마크 중심이 아니라 아키텍처에 있다. 이는 Qwen4의 기술적 방향을 미리 제시하고, 런타임 및 배포 최적화를 위한 더 이른 타깃을 오픈 소스 생태계에 제공한다.