Qwen3.8-Flash-Next는 Qwen3.8 계열의 단순히 더 작거나 더 빠른 변형이 아니다. Qwen은 이를 오픈 웨이트 멀티모달 MoE 모델이자 Qwen4에 사용될 아키텍처의 초기 프리뷰라고 설명한다. 이 설계는 어텐션, 잔차(residual) 연결, 임베딩 용량, 최적화를 동시에 바꾸어, 토큰당 연산량을 급격히 줄이면서도 역량을 끌어올리는 것을 목표로 한다.
TL;DR
Qwen3.8-Flash-Next는 125B-파라미터 메인 모델과 추가 51B N-gram 임베딩 테이블을 결합하면서 토큰당 활성화되는 파라미터는 6B에 불과하다. 기본적으로 262,144 토큰을 처리하며 YaRN을 통해 1,000,000 토큰까지 확장할 수 있다. 아키텍처는 3:1 비율의 Gated DeltaNet과 Qwen Sparse Attention, 4-분기 Gated Residual 연결, N-gram 임베딩, 초-스파스 MoE 전문가 풀, Multi-Token Prediction, Muon 기반 학습으로 구성된다.
가장 중요한 포인트는 원시 파라미터 수가 아니라 효율성이다. Qwen은 이 모델의 학습 비용이 Qwen3.7-Plus의 약 9분의 1이라고 밝히며, 출시 시점의 평가에서는 기존 Qwen 기준선을 여러 코딩, 오피스-에이전트, 멀티모달 과제에서 앞질렀다고 보고했다. 이는 벤더가 공개한 결과이므로 독립적인 검증이라기보다 출시 증거로 읽는 것이 적절하다.
개발자를 위해 오픈 웨이트는 Qwen 채널을 통해 제공되며, 매니지드 프로덕션 버전은 QwenCloud에서 Qwen3.8-Flash로 불린다. CometAPI는 Qwen3.8-Flash-Next를 모델 ID qwen3.8-flash-next로 나열하여, 개발자가 다른 프런티어 모델들과 함께 단일 경로로 사용할 수 있도록 한다.
핵심 요점
- 125B 메인 모델 파라미터 + 51B N-gram 임베딩, 토큰당 활성 파라미터 6B.
- 3 GDN : 1 QSA 하이브리드 어텐션 패턴은 효율적인 메모리와 정밀한 장거리 검색을 결합하도록 설계되었다.
- 262,144-토큰 기본 컨텍스트, YaRN을 통해 최대 1M 토큰.
- QSA에 대해 1M 컨텍스트에서 프리필 7.6배, 디코드 4.9배 커널 속도 향상을 보고.
- 잔차 스트림을 네 개의 게이트 분기로 확장하여 레이어 간 정보 흐름과 학습 안정성을 개선.
- 공식 출시 표에 따르면 SWE-bench Pro, CoWorkBench, JobBench, Toolathlon, AndroidWorld, RealWorldQA에서 강한 결과를 보였으나 모든 벤치마크를 석권한 것은 아님.
- 이번 릴리스는 아키텍처 프리뷰의 성격을 가지므로, 단지 현재의 벤치마크 순위뿐 아니라 Qwen4를 향한 설계 시그널의 의미도 크다.
Qwen3.8-Flash-Next란 무엇인가?
Qwen3.8-Flash-Next는 비전 인코더와 초-스파스 Mixture-of-Experts 언어 백본을 갖춘 인과적 멀티모달 언어 모델이다. 공식 모델 카드에 따르면 512명의 전문가, 토큰당 10명의 라우팅된 전문가와 1명의 공유 전문가가 활성화되는 [48개 레이어 아키텍처]이며, 세 개의 Gated DeltaNet 레이어 뒤에 하나의 Qwen Sparse Attention 레이어가 반복되는 히든 레이아웃을 갖는다.
이번 릴리스는 Qwen3-Next와 유사한 역할을 한다. 즉, 다음 전체 패밀리에 스케일되기 전에 아키텍처 변화를 노출한다. Qwen은 이 모델을 Qwen4를 떠받칠 아키텍처의 실험적 프리뷰라고 명시한다. 이는 서빙 효율, 긴 컨텍스트, 오픈 모델 아키텍처 연구의 방향에 관심이 있는 엔지니어에게 특히 흥미롭다.
Qwen3.8-Flash-Next의 4가지 핵심 구성요소
이 모델은 어텐션, 잔차 흐름, 임베딩 용량, 최적화 등 네 가지 핵심 요소를 함께 변경한다. 이는 긴 컨텍스트나 대규모에서 한 컴포넌트의 효율 향상이 다른 컴포넌트의 병목으로 상쇄되지 않도록 하기 위한 공동 설계다.
하이브리드 어텐션: GDN + Qwen Sparse Attention
대부분의 레이어는 글로벌 어텐션을 수행하지 않는다. 대신 네 개의 레이어 중 세 개는 Gated DeltaNet을 사용해 과거 정보를 고정 크기 상태로 압축한다. 네 번째 레이어는 정확한 검색을 위해 글로벌 어텐션을 사용하지만, 이 글로벌 어텐션은 Qwen Sparse Attention(QSA)로 재설계되었다.
QSA는 각 토큰을 독립적으로 검색하는 것을 피한다. 경량 인덱서가 시퀀스를 마이크로 블록으로 먼저 그룹화하고, 어떤 블록이 중요한지 추정한 다음 선택된 영역에만 어텐션을 수행한다. Qwen의 설명에 따르면, 이는 관련 컨텍스트를 찾는 인덱싱 오버헤드와 어텐션 연산을 모두 줄인다. 특히 하이브리드 네트워크와 잘 맞는데, 스파스 인덱스가 인접 어텐션 레이어 간 유사도에 의존하지 않고 각 어텐션 레이어 내부에서 독립적으로 구축되기 때문이다.
효율 수치도 상당하다. 1M-토큰 컨텍스트에서 Qwen은 QSA 어텐션 커널의 프리필 최대 7.6배, 디코드 최대 4.9배 속도 향상을 보고한다. 프리픽스 캐시 적중률 90%의 고캐시 재사용 서빙 실험에서는, 전체 모델이 1M 컨텍스트에서 Qwen3.7-Plus 대비 프리필 처리량 8.6배에 도달했다.
Gated Residual: 하나 대신 네 경로
전통적인 Transformer는 단일 잔차 스트림을 반복적으로 읽고 쓴다. Qwen3.8-Flash-Next는 대신 Gated Residual을 사용해 잔차 스트림을 네 개의 병렬 분기로 확장한다. 요소별 읽기 게이트는 각 분기에서 얼마나 많은 정보를 가져올지 결정하고, 분기 수준 쓰기 게이트는 무엇을 다시 쓸지 결정한다.
이는 모든 피처가 동일한 연속 혼합 채널을 거치도록 강제하지 않고도 깊이를 따라 유용한 피처를 보존하기 위한 것이다. Qwen은 게이트가 활성화 이상치를 억제하고 잔차 상태를 FP8로 저장해 메모리 트래픽을 낮출 수 있다고도 보고한다. 핵심 아이디어는 단순히 잔차 용량을 늘리는 것이 아니라 레이어 전반에 걸친 정보의 통제된 라우팅이다.
N-gram 임베딩: 연산 증가 없이 용량 확장
모델은 125B 메인 백본에 더해 51B N-gram 임베딩 파라미터를 추가한다. 일반 임베딩이 단일 토큰에서 인덱싱하는 것과 달리, N-gram 임베딩은 바이그램·트라이그램 등 로컬 토큰 패턴을 사용한다. 이는 빈번한 로컬 패턴에 대한 대규모 조회형 메모리를 모델에 제공한다.
특이한 점은 용량이 어디에 위치하느냐이다. 임베딩이 필요해지기 전에 조회 주소를 알 수 있으므로, 테이블을 호스트 메모리에 유지하고 GPU 연산이 계속되는 동안 비동기 프리페치할 수 있다. 이는 추가 51B 파라미터가 51B의 추가 밀집 행렬 곱연산 파라미터처럼 동작하지 않음을 의미한다. 아키텍처는 사실상 연산 집약적 모델 파라미터와 저연산 조회 메모리라는 두 자원을 별개로 스케일한다.
Muon과 학습 최적화
Qwen은 2차원 선형 사상에 대한 Muon 옵티마이저를 어텐션, GDN, MoE 전문가의 주요 가중치에 사용하고, 임베딩, 라우터, 저랭크 Gated Residual 파라미터에는 AdamW를 계속 사용한다. QKV와 SwiGLU 투영 같은 합성 행렬은 직교화 전에 독립 선형 변환으로 분리된다.
팀은 또한 새로운 아키텍처에 맞춰 스케일링 법칙을 재적합했고, 기존의 Batch Size Warmup이 불필요하다고 보고한다. 배치를 점진적으로 늘리는 방식은 최종 결과를 개선하지 못했을 뿐 아니라 옵티마이저 스텝을 18.8% 더 필요로 했다. 최종 레시피는 따라서 처음부터 목표 배치 크기에서 시작한다.
초-스파스 MoE와 Multi-Token Prediction
공식 모델 카드에는 512명의 전문가 중 토큰당 10명의 라우팅된 전문가와 1명의 공유 전문가가 활성된다고 나와 있다. 큰 전문가 풀은 모든 토큰에 대해 전체 모델을 활성화하지 않고도 저장된 용량을 증가시킨다. 1-레이어 Multi-Token Prediction(MTP) 모듈은 여러 스텝으로 학습되어 추측 디코딩(스페큘레이티브 디코딩) 수용률을 높이는 동시에 메인 백본을 지원한다.
Qwen3.8-Flash-Next 벤치마크 성능
Qwen은 폭넓은 언어, 코딩, 에이전트, 비전-언어 평가를 공개한다. 이 수치는 많은 비교 모델을 Qwen의 하니스로 재실행했다는 점에서 유용하지만, 여전히 벤더가 보고한 출시 평가이며 독립적인 벤치마크 재현은 아니다. 또한 여러 행이 벤치마크 전용 하니스나 평가자를 사용하므로, 가장 안전한 해석은 방향성이다. 즉, Qwen3.8-Flash-Next가 강한 영역과 경쟁자가 앞서는 영역을 보여준다.
코딩 및 에이전트 성능
| 벤치마크 | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|---|---|
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 | 54.4 | -- |
| SWE-bench Pro | 62.5 | 61.7 | 55.8 | 56.0 | 53.4 |
| SWE-bench Multilingual | 81.0 | 73.8 | 75.8 | -- | 77.5 |
| NL2Repo-Bench | 48.1 | 42.3 | 41.1 | 54.2 | 47.6 |
| CoWorkBench | 73.9 | 70.7 | 65.1 | 45.1 | 68.2 |
| JobBench | 55.7 | 33.4 | 27.6 | 41.3 | 36.6 |
| Toolathlon Verified | 73.5 | 67.1 | 50.6 | 70.3 | -- |
| IFBench | 81.3 | 79.5 | 79.1 | 79.2 | 62.5 |
| GPQA Diamond | 91.7 | 89.2 | 90.3 | 90.8 | 91.3 |
| HLE | 35.9 | 30.8 | 34.7 | 33.8 | 40.0 |
| LiveCodeBench v6 | 91.9 | 90.3 | 89.6 | 90.6 | 88.8 |
코딩 성과는 강하지만 뉘앙스가 있다. Qwen3.8-Flash-Next는 SWE-bench Pro, SWE-bench Multilingual, CoWorkBench, JobBench, Toolathlon Verified, LiveCodeBench v6에서 나열된 비교 세트를 선도한다. 그러나 DeepSeek V4 Flash는 NL2Repo-Bench에서 앞서며, Claude Opus 4.6은 HLE에서 선도한다. 따라서 전면적 벤치마크 석권보다 효율성이 더 수긍할 만한 헤드라인이다.
이전 Qwen 기준선 대비 가장 주목할 만한 개선은 장기 지평 작업에서 나타난다. CoWorkBench는 Qwen3.7-Plus의 65.1에서 73.9로, JobBench는 27.6에서 55.7로 상승했다. CoWorkBench가 Qwen의 사내 벤치마크이므로 이러한 향상은 독립적인 재현이 필요하지만, 비용 효율적 에이전트와 오피스 워크플로에 초점을 맞춘 아키텍처의 방향성과 부합한다.
멀티모달 성능
| 벤치마크 | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus | Claude Opus 4.6 |
|---|---|---|---|---|
| ClawEval-MM (Pass@3 / Avg) | 64.4 / 60.4 | 57.4 / 56.9 | 57.4 / 60.1 | 52.5 / 54.7 |
| RecreationBench | 49.9 | 47.1 | 30.2 | -- |
| AndroidWorld | 84.5 | 81.9 | 81.0 | 62.0 |
| OSWorld 2.0 (Binary / Partial) | 19.4 / 52.3 | 19.4 / 48.0 | 2.8 / 21.5 | -- |
| Vision2Web | 64.0 | 62.9 | 42.1 | -- |
| ERQA | 72.3 | 65.5 | 69.8 | 40.8 |
| LVBench | 76.6 | 72.4 | 76.2 | 63.0 |
| RealWorldQA | 88.5 | 85.9 | 86.9 | 73.9 |
| MathVision (CI 없음 / CI 포함) | 90.6 / 95.7 | 90.0 / 94.6 | 90.3 / 88.7 | 65.5 / -- |
| CharXiv RQ (CI 없음 / CI 포함) | 84.6 / 90.6 | 83.7 / 90.2 | 85.8 / 85.9 | 66.0 / -- |
멀티모달 결과는 이것이 단순히 코딩 중심의 Flash 모델이 아님을 뒷받침한다. Qwen3.8-Flash-Next는 Qwen의 표에서 AndroidWorld 84.5, Vision2Web 64.0, LVBench 76.6, RealWorldQA 88.5를 기록했다. 모델 카드에는 시간 규모의 비디오 워크로드에 대해 더 높은 프레임레이트 샘플링을 권장하는 이미지 및 비디오 입력 예시도 제공된다. video workloads.
Qwen3.8-Flash-Next vs 기타 모델
유용한 비교를 위해서는 세 가지 질문을 분리해야 한다. 토큰당 어느 정도의 연산이 활성화되는가, 모델의 모달리티와 컨텍스트 범위는 어느 정도인가, 대표 워크플로에서 얼마나 잘 수행하는가. 단순한 총 파라미터 수만으로는 답할 수 없다.
Qwen3.8-Flash-Next vs Qwen3.8-27B vs Qwen3.7-Plus
| 항목 | Qwen3.8-Flash-Next | Qwen3.8-27B | Qwen3.7-Plus |
|---|---|---|---|
| 모델 파라미터 | 125B + 51B N-gram 임베딩 | 27B | 397B |
| 활성 파라미터 | 6B | 27B | 17B |
| 기본 컨텍스트 | 262K | Qwen 비교 설정에서 262K | 이전 세대 장문맥 모델 |
| DeepSWE 1.1 | 58.7 | 42.2 | 16.5 |
| CoWorkBench | 73.9 | 70.7 | 65.1 |
| JobBench | 55.7 | 33.4 | 27.6 |
| AndroidWorld | 84.5 | 81.9 | 81.0 |
핵심 결과는 활성 파라미터당 역량(capability)이다. Qwen3.8-Flash-Next는 토큰당 6B 파라미터만 활성화하는 반면 Qwen3.8-27B는 27B, Qwen3.7-Plus는 17B를 활성화하지만, 나열된 DeepSWE, CoWorkBench, JobBench, AndroidWorld 점수에서 앞선다. 트레이드오프는 메모리 풋프린트다. 스파시티는 활성 연산을 줄일 뿐, 결국 저장해야 하는 모델 용량 자체를 줄이는 것은 아니다.
Qwen3.8-Flash-Next vs DeepSeek V4 Flash vs Claude Opus 4.6
| 항목 | Qwen3.8-Flash-Next | DeepSeek V4 Flash | Claude Opus 4.6 |
|---|---|---|---|
| 가중치 | 오픈 웨이트 | 오픈 웨이트 | 클로즈드 |
| 보고된 파라미터 구성 | 125B 메인 + 51B N-gram; 6B 활성 | 284B 총합; 13B 활성 | 공개되지 않음 |
| 주요 효율화 요점 | QSA + GDN + 6B 활성 MoE + 조회 메모리 | 고처리량 스파스 MoE | 매니지드 프런티어 추론 및 에이전트 스택 |
| 네이티브 멀티모달리티 | 텍스트, 이미지, 비디오 -> 텍스트 | 텍스트 중심 Flash 계열; CometAPI에 별도 비전 경로 제공 | 호스티드 API를 통한 텍스트 + 비전/파일 |
| SWE-bench Pro* | 62.5 | 56.0 | 53.4 |
| CoWorkBench* | 73.9 | 45.1 | 68.2 |
| NL2Repo-Bench* | 48.1 | 54.2 | 47.6 |
| HLE* | 35.9 | 33.8 | 40.0 |
DeepSeek V4 Flash는 Qwen의 비교에서 NL2Repo-Bench에서 여전히 강세이며, 이는 저장소 수준 코드 생성에 중요하다. Claude Opus 4.6은 동일 표에서 HLE에서 더 강하며, 오픈 배포 대상이 아니라 클로즈드 매니지드 모델을 대표한다. Qwen3.8-Flash-Next는 오픈 웨이트, 네이티브 멀티모달리티, 장문맥 엔지니어링, 매우 작은 활성 파라미터 예산의 조합으로 가장 차별화된다.
Qwen3.8-Flash-Next vs Qwen3.8-Max
| 항목 | Qwen3.8-Flash-Next | Qwen3.8-Max |
|---|---|---|
| 역할 | 효율 우선 오픈 아키텍처 프리뷰 | Qwen3.8 플래그십 |
| 메인/총 스케일 | 125B 메인 + 51B N-gram; 6B 활성 | 총 2.4T; CometAPI 모델 페이지 기준 활성 약 95B |
| 아키텍처 강조 | QSA, GDN, Gated Residual, N-gram 임베딩, Muon | 훨씬 큰 스케일에서 최대 프런티어 역량 |
| 최적 적합 | 대량 에이전트, 코딩 어시스턴트, 멀티모달 자동화, 자가 호스팅 | 가장 어려운 추론, 대규모 엔터프라이즈 에이전트, 역량 우선 워크로드 |
| 컨텍스트 | 기본 262K; YaRN으로 최대 1M | 현재 Qwen3.8 플래그십 경로에서 1M급 호스티드 컨텍스트 |
Qwen3.8-Max 사양은 현재 CometAPI 모델 목록을 기준으로 한다.
차이는 단순하다. Qwen3.8-Max는 역량 우선 플래그십이고, Qwen3.8-Flash-Next는 아키텍처·효율 실험이다. 둘 중 선택할 때는 병목이 절대적 모델 역량인지, 아니면 많은 장문맥·툴 사용 태스크를 대규모로 실행하는 비용인지 자문해야 한다.
Qwen3.8-Flash-Next 가격과 이용 가능성
Qwen3.8-Flash-Next의 오픈 웨이트는 Hugging Face와 ModelScope를 통해 공개되었다. 매니지드 서빙을 위해, Qwen은 프로덕션 버전이 QwenCloud에서 Qwen3.8-Flash로 불리며, 1M 컨텍스트가 기본 활성화되고 공식 내장 도구가 제공된다고 밝힌다.
Qwen은 매니지드 프로덕션 가격을 입력 100만 토큰당 $0.16, 출력 100만 토큰당 $0.47로 명시한다. 이 가격은 오픈 웨이트 자가 호스팅이 아니라 QwenCloud 프로덕션 모델 Qwen3.8-Flash에 해당한다.
| 경로 | 입력 | 출력 |
|---|---|---|
| QwenCloud 프로덕션 모델 (Qwen3.8-Flash) | $0.16 / 1M tokens | $0.47 / 1M tokens |
| 오픈 웨이트 자가 호스팅 | 인프라 의존 | 인프라 의존 |
| CometAPI 경로 | 실시간 모델 페이지 확인 | 실시간 모델 페이지 확인 |
QwenCloud 가격은 Qwen 공식 출시 글을 기준으로 하며, CometAPI 과금은 실시간 모델 페이지에서 확인해야 한다.
CometAPI 사용자에게는, 전용 Qwen3.8-Flash-Next 모델이 qwen3.8-flash-next 라우트로 식별된다. 라우팅, 업스트림 가용성, 과금은 오픈 웨이트 릴리스와 독립적으로 변경될 수 있으므로, 프로덕션 통합에서는 가격 가정을 하드코딩하지 말고 CometAPI 카탈로그를 실시간으로 확인해야 한다.
CometAPI 권장 사항
Qwen3.8-Flash-Next는 곧 CometAPI를 통해 제공될 것으로 예상된다. CometAPI는 500개 이상의 모델을 통합하는 OpenAI-호환 단일 엔드포인트(‘https://api.cometapi.com/v1’)를 제공하며, Qwen 시리즈 모델을 포함한다. 이 접근은 벤더 종속을 줄이고, 플랫폼 또는 관련 Qwen 엔드포인트를 통해 Qwen3.8-Flash(플랫폼에서 제공 가능해지는 즉시) 실험을 단순화하며, 서로 다른 작업에 모델을 혼용하는 프로덕션 배포(예: 비용 효율적 코딩 에이전트로 Qwen + 특정 추론에 다른 모델)를 간소화한다. 문서와 빠른 시작 가이드는 apidoc.cometapi.com과 CometAPI 메인 사이트에서 확인할 수 있다.
자가 호스팅, QwenCloud 사용, CometAPI 같은 통합 플랫폼 경유 중 무엇을 선택하든, Qwen3.8-Flash-Next는 고성능 장문맥 멀티모달 에이전트의 장벽을 낮춘다.
Qwen3.8-Flash-Next로 무엇을 할 수 있나?
1. 대량 코딩 에이전트
토큰당 6B 활성 파라미터 예산과 Qwen 평가에서의 SWE-bench Pro 62.5 점수는 Qwen3.8-Flash-Next를 다수의 병렬 세션을 운영하는 코딩 시스템에 특히 흥미롭게 만든다. 예로는 코드 리뷰, 이슈 분류, 저장소 탐색, 테스트 생성, 반복적 패칭 등 단일 실행의 지능만큼 처리량이 중요한 작업이 있다.
2. 장기 오피스·지식 작업
CoWorkBench와 JobBench는 모델 포지셔닝의 핵심이다. 이 아키텍처는 컨텍스트를 반복적으로 읽고, 도구를 호출하고, 상태를 업데이트하며, 지속적으로 작업하는 에이전트 루프를 위해 설계되었다. 이는 문서 워크플로, 스프레드시트 분석, 보고서 작성, 연구 요약, 비즈니스 프로세스 자동화에 자연스럽게 매핑된다.
3. 멀티모달 컴퓨터·모바일 에이전트
이미지·비디오 입력, AndroidWorld 성과, OSWorld 평가, Vision2Web 결과는 모델이 GUI 에이전트에 적합함을 보여준다. 스크린샷을 해석하고, 모바일 인터페이스를 조작하고, 애플리케이션 레이아웃을 재현하거나, 시각 상태와 도구 호출을 결합하는 시스템의 추론 레이어로 사용할 수 있다.
4. 장시간 비디오 및 시각적 추론
공식 모델 카드는 명시적으로 비디오 입력 예시와 시간 규모 비디오 전처리에 대한 가이드를 포함한다. 이는 비디오 질의응답, 장시간 비디오 검색, 시각적 이벤트 추출, 비디오 이해를 다운스트림 도구와 결합하는 워크플로에 유용하다.
5. 백만-토큰 연구 및 저장소 워크플로
오픈 모델은 기본 262,144 토큰이며 YaRN으로 1,000,000까지 확장 가능하다. 이는 중요하다. 1M은 확장이지 오픈 모델의 기본 컨텍스트가 아니다. 대규모 저장소나 연구 코퍼스에서 QSA는 장문맥의 검색 비용을 밀집 글로벌 어텐션보다 실용적으로 만들도록 설계되었다.
개발자는 Qwen3.8-Flash-Next를 어떻게 실행할 수 있나?
개발자는 Hugging Face에서 오픈 웨이트를 다운로드하고 Transformers, vLLM, SGLang, TokenSpeed로 모델을 실행할 수 있다. Qwen은 텍스트와 멀티모달 입력 모두에 대해 OpenAI-호환 Chat Completions 예시를 제공한다.
예를 들어, 공식 모델 카드는 vLLM으로 Qwen/Qwen3.8-Flash-Next를 서빙하고 /v1/chat/completions를 통해 호출하는 방법을 시연한다. 이미지와 비디오 입력도 OpenAI-호환 인터페이스를 통해 시연된다.
Qwen3.8-Flash-Next는 기본적으로 thinking 모드로 동작한다. 개발자는 enable_thinking, preserve_thinking, reasoning_effort를 통해 thinking 동작을 제어할 수 있으며, 문서화된 reasoning-effort 수준은 xhigh, medium, low이다.
Qwen3.8-Flash-Next의 한계는 무엇인가?
가장 큰 실무적 한계는 하드웨어 비용이다. 비록 활성화되는 언어 모델 파라미터는 6B에 불과하지만, 체크포인트에는 125B 언어 파라미터, 51B n-gram 임베딩 컴포넌트, 4B MTP 파라미터가 포함된다. 현재 리포지토리는 약 360 GB이므로 로컬 배포는 여전히 인프라 집약적이다.
두 번째 한계는 262K가 기본 컨텍스트 길이지 1M이 아니라는 점이다. 모델은 1M 토큰으로 확장될 수 있지만, CometAPI나 모델 페이지에 단순히 “1M 기본 컨텍스트”라고 표기해서는 안 된다. 정확한 표현은 기본 262K, 1M까지 확장 가능이다.
마지막으로 벤치마크 성능은 고르지 않다. Qwen3.8-Flash-Next는 코딩과 에이전틱 작업에서 매우 경쟁력이 있지만 모든 벤치마크에서 선도하지는 않는다. 예를 들어 HLE에서는 Claude Opus 4.6이 40.0으로 Flash-Next의 35.9를 앞서며, NL2Repo-Bench에서는 DeepSeek-V4-Flash-0731이 나열된 모델들 중 선도한다.
Qwen3.8-Flash-Next: Qwen4에 보내는 시그널
이번 릴리스의 더 넓은 의미는 Qwen4를 떠받칠 것으로 예상되는 아키텍처의 초기 프리뷰라는 점이다. Qwen3.8-Flash-Next는 Qwen Sparse Attention, Gated DeltaNet, 4-분기 Gated Residual 연결, N-gram 임베딩, 초-스파스 MoE 전문가 풀, Multi-Token Prediction을 결합한다. 이러한 선택은 활성 연산을 같은 비율로 늘리지 않으면서 더 높은 용량, 더 긴 컨텍스트, 더 강한 멀티모달·에이전트 성능을 추구하는 Qwen의 방향을 보여준다.
최종 평가
Qwen3.8-Flash-Next는 효율성 문제의 형태를 바꾸었기에 중요하다. 모든 파라미터를 동일시하는 대신, 비교적 작은 활성 MoE 경로에 매우 큰 조회형 메모리와 장문맥을 위한 스파스 검색 메커니즘을 결합한다. 이는 Qwen이 파라미터 증가를 토큰당 행렬 연산 증가와 같은 비율로 늘리지 않고도 용량을 높이기 위한 여러 독립적 레버를 갖게 한다.
개발자에게 이는 대량 코딩 어시스턴트, 장문맥 에이전트, 멀티모달 자동화, 자가 호스팅 실험에 매력적인 선택지다. 더 넓은 Qwen 로드맵에서 보면, 이번 릴리스는 더욱 의미가 크다. Qwen이 이 릴리스를 통해 Qwen4로 향하는 아키텍처 방향을 공개적으로 드러내고 있기 때문이다.
