요약 Alibaba의 Qwen 팀은 2026년 8월 3일 Qwen3.8-Max를 공식 출시했다 — 총 2.4조 매개변수(활성 950억)를 갖춘 희소 Mixture-of-Experts(MoE) 모델로, 100만 토큰 컨텍스트 윈도우와 기본 멀티모달(텍스트 + 이미지 + 비디오) 지원을 제공한다.
이는 오픈 가중치가 예정된 첫 Max급 Qwen 모델로(다음 주 공개 예정), 공격적인 가격(입력 토큰 100만 개당 $2, 출력 토큰 100만 개당 $6)과 함께 장기 지향(agentic) 작업, 자율 소프트웨어 엔지니어링(문서화된 16일간의 자체 진화 코딩 프로젝트 포함), 연구 재현, 멀티모달 벤치마크에서 강력한 성과를 보여준다. Kimi K3 같은 모델과 근접하게 경쟁하며, DeepSeek V4 Flash 같은 경량 옵션보다 높은 역량을 보이면서도 출력 중심 워크로드에서 서구권 최전선 모델 대비 훨씬 더 비용 효율적이다. 개발자는 오늘부터 QwenCloud / Alibaba Cloud Model Studio 및 CometAPI 같은 통합 플랫폼을 통해 접근할 수 있다.
핵심 요약
- 스케일과 효율성: 총 2.4T / 활성 95B MoE 아키텍처를 Qwen 3.5 기반 위에 구축해 실용적 추론 비용으로 프런티어 수준 성능을 제공
- 장기 지향 강점: 수일간의 자율 코딩(약 16일 동안 265커밋, 127 PR, 인적 개입 0), 연구 논문 재현+개선, 1년간의 모의 전자상거래 운영
- 벤치마크 하이라이트: PaperBench 93.0(상위권), Terminal Bench 2.1 86.6, 강력한 멀티모달 및 문서 점수; 순수 코딩 에이전트 리더보드에서는 Claude Fable 5나 GPT-5.6 Sol 대비 모든 항목에서 절대적 우위는 아님
- 가격 경쟁력: 전체 100만 토큰 컨텍스트 구간에서 1M당 $2 / $6 고정(캐시드 입력은 약 $0.25)으로, 출력 비용에서 Kimi K3 및 다수 서구 모델을 하회
- 가용성: QwenCloud 및 Alibaba Cloud Model Studio에서 라이브 (OpenAI·Anthropic 호환 API); 오픈 가중치 예정; 이미 CometAPI에서
qwen3.8-max로 등재되어 500+ 모델과 함께 통합 접근 가능. 오픈 가중치 임박; 로컬/엣지 실용 배포를 위한 소형 Qwen3.8-27B 변형도 계획됨 - 실무적 우위: 단일 턴 답변보다 엔드 투 엔드 산출물 생산에 탁월 — 코딩 에이전트, 연구 파이프라인, 오피스 워크플로, 지속형 에이전트 루프에 이상적
Qwen3.8-Max란?
Qwen3.8-Max는 Alibaba의 최신이자 가장 강력한 Qwen 플래그십 모델로, 2026년 8월 3일(상하이 세계 인공지능 대회에서의 7월 중순 프리뷰에 이어) 공식 출시되었다. 이 모델은 최소한의 감독으로 복잡한 다일(end-to-end) 과제를 완수하고 출시 수준의 산출물을 만들어내는 방향으로의 의도적 전환을 상징한다.
아키텍처적으로는 희소 Mixture-of-Experts(MoE) 모델로 확장되어 총 매개변수는 2.4조, 토큰당 활성화되는 매개변수는 약 950억 수준이다. Qwen 3.5 기반 설계로, 거대한 용량과 추론 효율을 균형 있게 달성한다. 모델은 100만 토큰 컨텍스트 윈도우(문서화된 최대 입력 약 99.1만 토큰, 최대 출력 약 13.1만 토큰), 기본 멀티모달 입력(텍스트, 이미지, 비디오)과 텍스트 출력을 지원한다. 추론 노력 제어(reasoning-effort controls, xhigh / medium / low)를 포함하고, OpenAI Chat Completions와 Anthropic 호환 프로토콜을 모두 지원해 Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw 같은 인기 에이전트 프레임워크와 드롭인 호환된다.
이전 Max급 모델과 달리, Alibaba는 Qwen3.8-Max(및 소형 Qwen3.8-27B 변형)의 가중치를 출시 후 다음 주에 Hugging Face와 ModelScope를 통해 공개하겠다고 약속했다 — Max급 Qwen 모델로서는 처음으로 공개된다.
모델은 코딩 에이전트, 실무형 업무(“cowork”), 연구, 장기 계획, 멀티모달 에이전트 루프를 지향해 포지셔닝되어 있다. 공식 데모는 자체 진화 행동을 강조한다: 모델이 이슈를 생성하고 스스로 할당하며, 코드를 작성·테스트하고, 피드백을 기반으로 반복하며, 장기간에 걸쳐 자체 도구를 개선한다.
출처: Official Qwen blog 및 Alibaba Cloud announcements (2026년 8월); Artificial Analysis 모델 카드; GA 출시를 요약한 독립 리뷰.
Qwen3.8-Max의 새로운 점
전작 Qwen3.7-Max와 비교해 3.8 세대는 에이전트형 코딩, 장기 신뢰성, 멀티모달 추론, 문서/오피스 성능에서 큰 폭의 향상을 제공한다. 핵심 혁신은 다음과 같다.
진정한 장기 자율성:
모델은 수백 턴 또는 수일에 걸쳐 폐루프 적응 학습을 유지할 수 있다. 문서화된 사례로는 16일간의 자율 소프트웨어 엔지니어링 프로젝트가 있으며, 자체 진화형 CLI 도구(oh-my-cli)를 산출했고, 265커밋, 127 풀 리퀘스트, 151 이슈를 전적으로 인적 개입 없이 달성했다. 또한 연구 논문의 방법론을 재현·개선(현실 GPU 학습 루프와 측정 가능한 벤치마크 향상 포함)하고, 1년간의 모의 전자상거래 운영에서 기준점을 크게 상회했다.
연속 피드백 루프로서의 멀티모달:
비전은 단순한 입력 모달리티에 그치지 않는다. 모델은 계획, 실행 모니터링, 자기 교정을 위해 시각적 이해를 활용한다 — 스크린샷-투-코드 재현, 대화형 게임/애니메이션 생성, 2D-투-3D 시각화 같은 작업을 가능하게 한다.
출시 직후의 초기 데이터에서 Text Arena(보고 순위 5위), Vision Arena(보고 순위 2위)에서 상위권을 기록했다.


엔드 투 엔드 산출물 중심:
단편적 답변이 아니라 수백 개 직무 전반의 프로덕션 품질 산출물 생산에 방점을 둔다.
Thinking과 Fast Inference 모드
두 가지 모드가 있다: Thinking 모드와 Fast Inference 모드. Thinking 모드는 더 심층적인 추론과 복잡한 계획에 적합하다. Fast 모드는 과제가 단순할 때 낮은 대기시간의 응답에 적합하다. Alibaba Cloud의 OpenCode 문서에는 Qwen3.8 라우트에서 thinking이 활성화되어 있으며, 프리뷰 라우트에 xhigh, medium, low와 같은 추론 제어가 나열되어 있다.
이 분리는 제품 설계에 유용하다. 모든 요청에 가장 무거운 추론 모드를 사용할 필요는 없다. 예를 들어 지원 봇은 단순 티켓을 저렴하게 분류하고, 빠른 모델로 요약한 뒤, 사용자가 복잡한 정책 결정, 근본 원인 분석, 계약 검토, 코드 마이그레이션 계획을 요구할 때에만 Qwen3.8-Max Thinking 모드로 에스컬레이션할 수 있다.
이 능력은 내부 장기 실험과 코딩 에이전트, 일반 에이전트, 멀티모달 추론, 문서 이해, 지각/그라운딩 과제를 아우르는 종합 벤치마크를 통해 검증되었다.
벤치마킹: 데이터 정량화 성능
Alibaba는 GA 시점에 광범위한 내부 벤치마크를 공개했다. 독립 검증(Artificial Analysis Intelligence Index, LMArena 등)은 출시 직후 며칠 동안 진행 중이었으며, 초기 Artificial Analysis 데이터는 Qwen3.8-Max의 Intelligence Index를 53(추적 세트 186개 중 약 16위)으로 제시했고, 높은 장황성(verbosity)과 상대적으로 낮은 속도를 지적했다.
선별된 공식/보고 점수(Qwen3.8-Max vs 선택한 피어):
| 벤치마크 | Qwen3.8-Max | Claude Fable 5 / Opus 4.8 | GPT-5.6 Sol (max) | Qwen3.7-Max |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 86.6 | 84.6 | 88.8 | 74.5 |
| PaperBench | 93.0 | 88.8 / 80.3 | 90.5 | 64.8 |
| SWE-bench Pro | 67.7 | 80.0 / 69.2 | 64.6 | 60.6 |
| FrontierSWE | 73.5 | 88.8 | — | 40.7 |
| DeepSWE 1.1 | 56.6 | 70.0 | 73.0 | 21.6 |
| IFBench | 82.8 | ~63.5 | — | 79.1 |
| GPQA Diamond | 92.6 | 92.6 | 94.1 | 92.4 |
| OmniDocBench 1.5 | 92.1 | — | — | — |
| OSWorld-Verified | 86.1 | — | — | — |
Qwen3.8-Max는 멀티모달 추론, 문서/오피스 과제, 일부 에이전트형 코딩/연구 지표에서 자주 선두 또는 최상위권을 차지하는 반면, 일부 순수 소프트웨어 엔지니어링 에이전트 스위트에서는 가장 강력한 클로즈드 모델에 뒤처진다. 특히 FrontierSWE와 DeepSWE에서의 세대 간 도약이 두드러진다. 벤더 수치는 방향성 지표로 보되, 독립 실행과 워크로드별 평가가 필수적이다.
Qwen3.8-Max의 API 가격
Qwen3.8-Max에 대한 공식 Alibaba Cloud Model Studio / QwenCloud 가격(2026년 8월 초 GA 요율):
- 입력: 1M 토큰당 $2.00
- 출력: 1M 토큰당 $6.00(Thinking/Reasoning 토큰 포함)
- 캐시드 입력: 1M 토큰당 약 $0.25(반복되는 장문 컨텍스트에서 큰 절감)
가격은 전체 100만 토큰 컨텍스트 구간에서 고정된다 — 장문 컨텍스트 할증을 적용하는 경쟁사 대비 두드러진 장점. 지역/플랜에 따라 배치 및 기타 할인 적용 가능.
비교 맥락(동시기 대략적 리스트 가격):
- Kimi K3: 약 $3 / $15
- 상위 Claude / GPT 프런티어 모델: 종종 $5+ / $15–25+
- DeepSeek V4 Flash 변형: 훨씬 낮음(많은 사용 사례에서 합산 $0.50 이하)
이미 다수 제공업체를 사용하는 팀의 경우, CometAPI 같은 집계 게이트웨이는 공식 요율 대비 약 20% 할인, 단일 OpenAI 호환 엔드포인트, 통합 청구, 손쉬운 모델 전환/페일오버를 제공한다. 이는 Qwen3.8-Max를 실험하면서 동시에 DeepSeek V4 Flash, Kimi 모델 등과 비교하는 작업을 운영적으로 더 단순하고 종종 더 저렴하게 만든다. 최신 실효 요율은 CometAPI 가격 페이지와 무료 크레딧 제공을 확인하라.
Qwen3.8-Max vs Kimi K3 및 DeepSeek V4 Flash
| 차원 | Qwen3.8-Max | Kimi K3 | DeepSeek V4 Flash |
|---|---|---|---|
| 총/활성 매개변수 | 2.4T / 약 95B | 약 2.8T / 약 104B | 284B / 13B |
| 컨텍스트 | 1M | 1M | 1M |
| 멀티모달 | 텍스트 + 이미지 + 비디오 | 텍스트 + 이미지 + 비디오 | 텍스트 전용 |
| 가격(입력/출력) | $2 / $6 | $3 / $15 | 약 $0.14 / $0.28(매우 저렴) |
| 오픈 가중치 | 예정(다음 주) | 이미 공개 | MIT, 공개됨 |
| 강점 | 장기 자율성, 멀티모달, PaperBench, 출력 측 가격 | 강력한 독립 점수, 프런트엔드 코딩 아레나 리더십 | 극도의 비용 효율, 크기 대비 탄탄한 에이전트 코딩 |
| 상대적 위상 | 여러 에이전트·멀티모달 벤치에서 경쟁력/선도 | 일부 검증된 지능 지수에서 근소 우위 | 뛰어난 가성비; 절대 성능은 더 낮음 |
Qwen3.8-Max는 출력 중심 작업과 멀티모달 과제에서 Kimi K3의 비용 효율성과 대체로 대등하거나 앞서며, DeepSeek V4 Flash는 대량 텍스트 워크로드에서 가성비 왕좌를 유지한다. 많은 팀이 통합 게이트웨이를 통해 세 모델 모두를 사용하며, 단순 트래픽은 Flash급 모델로, 복잡한 에이전트 세션은 Qwen3.8-Max나 Kimi K3로 라우팅한다.
Qwen3.8-Max는 Kimi K3와 대등한가?
일부 측면에서는 그렇다. 1M 컨텍스트 티어를 일치시키며, 멀티모달 포지셔닝이 강하고, 공식 입력/출력 표준 요금에서 더 저렴하다. 다만 2.8T 총 매개변수에는 미치지 못하며, Kimi의 공개 문서는 도구 사용, 컨텍스트 캐싱, 구조화 출력, 비전 가이던스에 대해 특히 상세하다.
Qwen3.8-Max는 DeepSeek V4 Flash와 대등한가?
1M 컨텍스트와 MoE 아키텍처 측면에서 경쟁하지만, 제품 목표는 다르다. DeepSeek V4 Flash는 경제적이고 빠른 경로이고, Qwen3.8-Max는 멀티모달 이해, 고급 추론, 엔터프라이즈 생산성이 최저 토큰 가격보다 중요한 업무를 위한 더 큰 고성능 경로다.
Qwen3.8-Max로 무엇을 할 수 있나?
코딩 및 소프트웨어 엔지니어링
Qwen3.8-Max는 풀스택 개발, 코드 리뷰, 리포지토리 이해, 마이그레이션 계획, API 설계, 디버깅, 테스트 추론, 소프트웨어 아키텍처에 유력하다. 긴 컨텍스트는 다수 파일, 로그, 요구사항을 동시에 고려해야 할 때 도움이 된다. 모든 자동완성이나 단순 린트 설명이 아니라 어려운 코드 작업에 사용하라.
오피스 및 지식 업무
모델의 “Cowork” 포지셔닝은 중요하다. 엔터프라이즈 직원은 단지 질문만 하지 않는다. PDF 비교, 미팅 요약, 슬라이드 검토, 스프레드시트 해석, 계약 검토, 보고서 작성, 복잡한 증거로부터의 의사결정 준비 등을 수행한다. Qwen3.8-Max의 멀티모달·장문 컨텍스트 설계는 텍스트, 문서, 스크린샷, 구조화 데이터를 함께 추론해야 하는 오피스 워크플로에 적합하다.
에이전트형 워크플로
Qwen3.8-Max는 목표를 단계로 분해하고, 호출할 도구를 결정하며, 결과를 평가하고, 계획을 수정하는 에이전트 계획에 유용하다. CometAPI에서는 동일한 애플리케이션이 단순 단계는 더 저렴한 모델로 라우팅하고, 계획 수립이나 검증에만 Qwen3.8-Max를 할당할 수 있어 실용성이 높아진다.
시작하기 및 CometAPI 통합 팁
- 직접 접근: QwenCloud 또는 Alibaba Cloud Model Studio에서 모델 ID
qwen3.8-max를 사용하라. OpenAI 호환과 Anthropic 호환 엔드포인트를 모두 지원한다. - CometAPI를 통한 통합 접근: CometAPI.com에 가입하고 API 키를 발급받은 뒤,
base_url을https://api.cometapi.com/v1로 설정하고model="qwen3.8-max"로 호출하라. 동일 키로 DeepSeek V4 Flash, Kimi K3, Claude, GPT 등 수백 개 모델을 사용할 수 있어 실험, 비용 통제, 프로덕션 라우팅에 이상적이다. CometAPI는 경쟁력 있는 가격, 낮은 지연, 신속한 신모델 추가(Qwen3.8-Max도 출시 직후 등재)를 강조한다. - 에이전트 프레임워크: Claude Code, OpenClaw 또는 커스텀 하네스에 바로 연결하라. 복잡한 장기 과제에는 높은 추론 노력을 활성화하라.
- 오픈 가중치: 온프레미스나 파인튜닝 배포가 필요하다면 곧 공개될 Hugging Face / ModelScope를 모니터링하라.
