TLDR Wan 3.0 (또는 Wan3.0 표기)는 Alibaba Tongyi Lab의 최신 올인원 비디오 모델로, 한 번의 패스로 동기화된 오디오와 함께 최대 1080p의 네이티브 30초 연속 클립을 생성한다. 텍스트-투-비디오, 이미지-투-비디오, 첫/마지막 프레임 컨디셔닝, 그리고 이미지, 비디오, 오디오, 문서(PDF, PPT, XLS, DOC, MD 등), 웹페이지를 받아들이는 강력한 Omni-Reference 워크플로를 지원한다.
공개 베타는 2026년 8월 6일에 시작되었고, 2026년 8월 24일 전후로 더 넓은 접근이 제공되었다. 가격은 대략 480p 기준 초당 $0.05, 720p 초당 $0.10, 1080p 초당 $0.20 수준이다. Wan 계열과 500+ 모델을 단일 통합으로 액세스하려는 개발자/팀에게는 OpenAI 호환 API를 제공하는 CometAPI가 효율적인 경로를 제공하며, 현재 /v1/videos를 통해 Wan 2.7과 확대 중인 비디오 카탈로그를 제공한다.
Key Takeaways
- 네이티브 30초 단일-테이크 생성(이전 Wan 2.7/2.5의 약 15초 제한 대비 2배), 지능형 길이 매칭.
- Omni-Reference: 약 10–20개의 혼합 자산(이미지, 총 15초 이하 비디오, 오디오, 1개의 문서/웹페이지)로 피사체, 제품, 스타일 일관성 강화.
- 문서 및 웹페이지-투-비디오가 돋보임: PDF, 프레젠테이션, 스프레드시트 또는 공개 URL을 넣으면 구조화된 비디오가 생성됨.
- 동일 패스에서 네이티브 오디오 생성; 480p/720p/1080p 해상도; 다양한 화면비.
- 이전 세대 대비 얼굴/미세 표정 충실도 향상, 레퍼런스 안정성 증가, 더 깨끗한 온스크린 텍스트.
- Alibaba Cloud Model Studio / Qwen Cloud(model
wan3.0-video), wan.video, 서드파티 플랫폼을 통해 액세스. 다중 모델 개발을 간소화하려면 CometAPI의 통합 비디오 엔드포인트를 사용. - 촬영 브리프처럼 프롬프트를 작성(주제 + 액션 + 카메라 + 타이밍 + 제약)하고, 레퍼런스는 명시적으로 라벨링(@Image1 등)할 것.
What Is Wan 3.0?
Wan 3.0은 Alibaba의 Tongyi Wanxiang(Wan) 비디오 생성 계열의 최신 플래그십으로, Tongyi Lab이 개발했다. 2025년에 널리 연구된 오픈 Wan 시리즈를 포함한 이전 오픈/클로즈드 Wan 릴리스의 확산-트랜스포머 계보를 기반으로 한다.
Wan 2.7 / 2.5 대비 주요 업그레이드는 다음과 같다:
- 한 번의 연속 생성으로 최대 30초 네이티브 길이(스티칭된 클립이 아님).
- 텍스트/이미지/비디오/오디오를 넘어 오피스 문서와 공개 웹페이지까지 입력 확대.
- 얼굴, 미세 표정, 제품 디테일, 디지털/UI 콘텐츠 일관성에서 개선된 “현실급” 렌더링.
- 텍스트-투-비디오(T2V), 이미지-투-비디오(I2V), 첫/마지막 프레임, 레퍼런스-투-비디오, 관련 편집/확장 기능을 포괄하는 통합 올인원 모델.
Alibaba는 이를 마케팅 영상, 숏 드라마, 소셜 콘텐츠, 제품 데모, 교육/시뮬레이션 영상(예: 로보틱스 또는 AV), 기업용 설명 영상에 적합하도록 포지셔닝한다. 모델은 계속해서 폐쇄 가중치/API 전용이며(오픈 가중치는 이전 Wan 2.x 릴리스까지).
Supporting data & sources: List pricing examples (international): 480p $0.05/s, 720p $0.10/s, 1080p $0.20/s(30초 1080p 클립 ≈ $6, 스탠더드 기준). Some platforms offer Standard vs 더 빠른 Prime 티어 또는 일시적 할인.
How Do You Use Wan 3.0 API
Alibaba Cloud는 Model Studio 비디오 생성 API를 통해 Wan 3.0을 제공한다. 현재 모델 식별자는 다음과 같다:
wan3.0-video
API는 비동기식 비디오 생성을 사용한다. 대표적인 요청은 다음과 같다:
curl --location 'https://{WorkspaceId}.ap-southeast-1.maas.aliyuncs.com/api/v1/services/aigc/video-generation/video-synthesis' \
-H 'X-DashScope-Async: enable' \
-H "Authorization: Bearer $DASHSCOPE_API_KEY" \
-H 'Content-Type: application/json' \
-d '{
"model": "wan3.0-video",
"input": {
"prompt": "A cinematic product commercial showing a premium coffee machine in a modern kitchen."
},
"parameters": {
"resolution": "720P",
"ratio": "16:9",
"duration": 10,
"enable_thinking": false
}
}'
Alibaba의 API 레퍼런스에 따르면 모델, 엔드포인트, API 키는 동일한 리전이어야 한다. API는 비동기식이므로 애플리케이션은 작업을 제출한 후 처리 완료 시 생성 결과를 조회해야 한다.
이미지-투-비디오 및 레퍼런스 기반 워크플로의 경우 input 객체에 레퍼런스 미디어를 포함할 수 있다. Alibaba의 현재 예시는 동일 요청에서 레퍼런스 비디오와 레퍼런스 이미지를 조합하는 방법을 보여준다.
How to Use Wan 3.0 via CometAPI (Recommended for Developers)
CometAPI는 500+ 모델에 대한 통합 OpenAI 호환 인터페이스를 제공하며, Alibaba Wan 계열 비디오 모델(Wan 2.7이 현재 리스트업, 초당 가격 경쟁력; Wan 3.0은 가용성 확장에 따라 카탈로그에서 확인)을 포함한다. 비디오 생성은 멀티파트 폼 데이터를 사용하는 /v1/videos 엔드포인트를 이용하며, 프로덕션 파이프라인, n8n/Make 자동화, 또는 Wan, Seedance, Kling, Veo, MiniMax 등 간 전환에 적합하다.
CometAPI steps:
- cometapi.com에서 가입/로그인 후 API 키(sk-…)를 생성한다.
- 비디오 API 문서(apidoc.cometapi.com)와 모델 리스트를 검토하여 정확한 Wan ID를 확인한다(예:
wan2.7패턴; 최신 확인). - POST
https://api.cometapi.com/v1/videos로 다음 폼 필드를 제출한다: - 작업/ID를 수신하고, 완료될 때까지 상태 엔드포인트를 폴링하거나 웹훅을 사용한다.
- 결과 비디오 콘텐츠를 다운로드한다.
- CometAPI 대시보드에서 사용량과 비용을 모니터링한다(종량제, 월 최소요금 없음).
How to Prompt Wan 3.0 Effectively
프롬프트는 캐주얼한 캡션이 아닌 촬영 브리프로 작성하라. 커뮤니티와 플랫폼 가이드를 참고한 검증된 구조:
SPACE-style 또는 샷 리스트 공식:
- Subject: 누가/무엇인지에 대한 구체적 설명.
- Performance/Action: 시간 순서로 보이는 동작과 상태 변화.
- Ambience/Setting: 장소, 시간, 조명, 날씨.
- Camera: 샷 크기 + 하나의 명확한 카메라 무브(슬로 푸시-인, 오빗, 트래킹, 스태틱).
- Extra: 스타일, 오디오 큐, 페이싱, 제약(“라벨을 읽을 수 있게 유지”, “얼굴 아이덴티티 보존”).
30초 멀티-비트 클립의 경우, 시간 범위로 샷을 번호 매기기:
Overall: A premium product reveal of a ceramic perfume bottle on wet black stone at dusk.
Shot 1 [0-8s]: Wide establishing, slow three-quarter orbit, warm rim light, gentle rain.
Shot 2 [8-18s]: Closer product focus, bottle rotates slowly, label and gold cap remain sharp.
Shot 3 [18-30s]: Final push-in to detail, soft ambient score, hold on the logo.
Keep bottle shape, label position, and gold cap consistent. Cinematic, calm pacing, no text overlays.
Reference binding(Omni-Reference에 중요):
@Image1 is the female character (face and yellow jacket).
@Image2 is the rainy alley background.
@Audio1 provides the voice timbre.
The character from @Image1 walks through the alley from @Image2 and says “…” using the voice of @Audio1.
Additional tips:
- 관찰 가능한 동작과 공간적 관계를 구체적으로 기술하라.
- 흔한 실패 모드(왜곡된 손, 원치 않는 텍스트, 스타일 드리프트)에 대해 네거티브 프롬프트를 사용하라.
- 문서의 경우: “첨부한 PDF의 구조를 따르는 설명 영상을 만들고, 2페이지의 세 가지 핵심 지표와 결론의 권고사항을 강조하라.”
- 반복/개선: 먼저 짧은 버전을 생성하고, 성공한 비트를 확장하라.
- 카메라 언어와 조명 묘사는 시네마틱 품질을 향상시킨다.
Why Use Wan 3.0?
Wan 3.0은 단순히 텍스트 프롬프트를 짧은 클립으로 변환하는 것을 넘어, 여러 종류의 소스 자료를 일관된 비디오로 변환해야 하는 애플리케이션에서 가장 설득력이 크다.
가장 강력한 장점:
- 30초 네이티브 비디오 생성
- 텍스트-투-비디오와 이미지-투-비디오
- 멀티 레퍼런스 비디오 생성
- 텍스트, 이미지, 비디오, 오디오, 문서 입력
- 문서 및 웹페이지-투-비디오 워크플로
- 네이티브 오디오/비주얼 생성
- 1080P 출력
- 명령어 기반 비디오 편집
- 강한 레퍼런스 일관성
- 초당 과금
- 여러 크리에이티브 워크플로를 아우르는 단일 모델
AI 필름 도구, 광고 시스템, 제품 비디오 생성기, 교육 콘텐츠 플랫폼, 멀티모달 크리에이티브 에이전트를 구축하는 개발자에게 이러한 기능은 필요한 별도 모델과 전처리 단계를 크게 줄여준다.
Conclusion and Recommendation
Wan 3.0은 더 긴 연속 테이크, 진정한 문서-투-비디오, 더 강력한 멀티모달 제어로 실무 중심의 AI 비디오에 한 걸음 더 다가섰다. 신중한 프롬프트 작성과 레퍼런스 관리와 결합하면 많은 마케팅, 설명, 숏폼 사용 사례에서 전통적 제작의 수일을 몇 분으로 압축할 수 있다.
애플리케이션이나 내부 도구를 구축하는 개발자/팀은 순수한 Wan 3.0 경험을 위해 공식 Alibaba 채널로 시작하고, CometAPI(cometapi.com)를 고생산성 게이트웨이로 고려하라. 통합 비디오 API, 광범위한 모델 커버리지(현재 Wan 2.7 포함 및 확장 중), OpenAI 호환 인터페이스, 투명한 종량제를 통해 단일 통합으로 실험, 확장, Wan 계열 생성과 보조 LLM, 이미지, 오디오 모델을 결합하기가 용이하다.
최신 모델 리스트와 문서를 CometAPI와 Alibaba Cloud Model Studio에서 확인하고, 짧은 클립으로 실험하며, 샷 리스트 프롬프트를 정교화한 뒤 30초 전체 제작으로 확장하라. 더 긴 네이티브 길이와 Omni-Reference의 결합은 그동안 번거롭거나 비용이 컸던 새로운 크리에이티브 및 비즈니스 워크플로를 연다.
