Wan 3.0 기술 사양
| 사양 | Wan 3.0 |
|---|---|
| 모델 유형 | 멀티모달 올인원 비디오 생성 모델 |
| 모델 상태 | 공개 API 프리뷰 |
| 입력 유형 | 텍스트, 이미지, 비디오, 오디오, 문서, 웹 페이지 |
| 비디오 생성 | 텍스트-투-비디오, 이미지-투-비디오, 레퍼런스-투-비디오 |
| 비디오 편집 | 지시문 기반 및 레퍼런스 기반 편집 |
| 최대 길이 | 단일 생성에서 최대 30초 |
| 출력 해상도 | 480P, 720P, 1080P |
| 네이티브 오디오·비주얼 생성 | 예 |
| 레퍼런스 에셋 | 최대 20개의 멀티모달 레퍼런스 에셋 |
| 문서 입력 | DOC, XLS, PPT, PDF, TXT, KEY, PAGES, NUMBERS, MD |
| 최대 문서 크기 | 100 MB |
| 최대 문서 페이지 | 50페이지 |
| API 액세스 | Alibaba Cloud Model Studio API 프리뷰 |
| API 생성 모드 | 비동기식 |
| 480P 가격 | $0.05/초 |
| 720P 가격 | $0.10/초 |
| 1080P 가격 | $0.20/초 |
Wan 3.0은 Alibaba Cloud가 2026년 8월 공식 출시한 최신 올인원 멀티모달 비디오 생성 모델입니다. 이전 세대 Wan 대비 가장 큰 업그레이드는 단순한 시각 품질 향상이 아니라 텍스트, 이미지, 비디오, 오디오, 문서, 웹 페이지를 하나의 크리에이티브 워크플로로 통합한 점입니다. Alibaba Cloud는 이 모델이 네이티브 30초 비디오 생성, 멀티모달 레퍼런스 입력, 동기화된 오디오·비주얼 생성, 정밀 비디오 편집을 지원한다고 설명합니다.
Wan 3.0란?
Wan 3.0은 텍스트, 이미지, 비디오, 오디오, 문서, 웹 콘텐츠를 일관된 비디오로 전환하도록 설계된 Alibaba의 차세대 멀티모달 비디오 생성 모델입니다.
과거 AI 비디오 워크플로는 텍스트-투-비디오, 이미지-투-비디오, 레퍼런스 일관성, 편집 또는 오디오 등 용도별로 여러 특화 모델이 필요했습니다. Wan 3.0은 이러한 입력을 단일 크리에이티브 지시문을 중심으로 결합할 수 있는 올인원 제작 모델로 나아갑니다.
대표 기능은 네이티브 30초 생성입니다. 5~10초의 짧은 클립을 반복 확장·연결하는 대신, Wan 3.0은 한 번에 연속된 30초 시퀀스를 생성할 수 있습니다. Alibaba의 데모에서는 더 긴 장면에서도 캐릭터, 환경, 동작, 카메라 무빙, 대사, 사운드를 지속적으로 유지하는 모습을 보여줍니다.
또 다른 큰 변화는 Omni-Reference입니다. 개발자는 여러 레퍼런스 에셋을 사용해 캐릭터, 제품, 환경, 모션 또는 기타 시각적 특성을 확립할 수 있습니다. 공식 Wan 3.0 저장소는 최대 20개의 레퍼런스 에셋을 지원한다고 설명하며, Alibaba Cloud 제품 페이지는 이미지, 텍스트, 비디오, 오디오, 문서, 웹 페이지를 크리에이티브 레퍼런스로 결합할 수 있는 기능을 강조합니다.
이로써 Wan 3.0은 단순한 프롬프트-투-비디오 생성기가 아니라 멀티모달 크리에이티브 프로덕션 엔진에 더 가깝습니다.
Wan 3.0의 주요 기능
- 네이티브 30초 비디오 생성: Wan 3.0은 단일 패스로 최대 30초 길이의 비디오를 생성할 수 있으며, 지능형 길이 선택과 비디오 확장 기능을 제공합니다.
- Omni-Reference: 텍스트, 이미지, 비디오, 오디오를 레퍼런스로 결합할 수 있습니다. 또한 문서와 웹 페이지까지 레퍼런스 기반 생성으로 확장합니다.
- 문서-투-비디오: PPT, PDF, DOC, XLS, TXT, KEY, PAGES, NUMBERS, MD 파일을 크리에이티브 입력으로 활용하여 프레젠테이션, 보고서, 구조화된 정보를 비디오 콘텐츠로 전환할 수 있습니다.
- 네이티브 오디오·비주얼 생성: Wan 3.0은 비디오와 사운드를 함께 생성하며, 대사, 환경음 및 음악 지향적 오디오·비주얼 장면을 지원합니다.
- 레퍼런스 일관성: 레퍼런스 기반 생성 전반에 걸쳐 캐릭터, 소품, 환경, 공간적 관계, 스타일을 보존하도록 설계되었습니다.
- 비디오 편집: 매번 처음부터 시작할 필요 없이 생성된 시각 콘텐츠, 플롯, 대사를 수정할 수 있습니다.
Wan 3.0은 다른 비디오 모델과 어떻게 비교되나요?
| 모델 | 네이티브 길이 | 이미지-투-비디오 | 레퍼런스 제어 | 오디오 | 문서/웹 입력 | 주요 강점 |
|---|---|---|---|---|---|---|
| Wan 3.0 | 30s | ✓ | 강함 | ✓ | ✓ | 올인원 멀티모달 프로덕션 |
| Wan 2.7 | 15s | ✓ | ✓ | ✓ | 제한적 | 검증된 Wan 비디오 워크플로 |
| Grok Imagine Video 1.5 | 최대 15s | ✓ | ✓ | ✓ | — | 빠른 숏폼 크리에이티브 비디오 |
| Veo | 모델에 따라 다름 | ✓ | ✓ | ✓ | 멀티모달 | 시네마틱 생성 |
| Kling | 모델에 따라 다름 | ✓ | ✓ | ✓ | — | 캐릭터 및 모션 생성 |
| Seedance | 모델에 따라 다름 | ✓ | ✓ | ✓ | — | 크리에이티브 및 멀티샷 비디오 |
핵심 차별점은 입력 범위입니다.
Grok Imagine Video 1.5와 비교하면, Wan 3.0은 올인원 제작 워크플로에 훨씬 더 가까워졌습니다. Grok은 텍스트, 이미지, 레퍼런스 워크플로를 통한 짧은 비디오 생성에 중점을 두는 반면, Wan 3.0은 여기에 문서, 웹 페이지, 오디오, 비디오를 직접적인 크리에이티브 레퍼런스로 추가로 통합합니다.
Wan 2.7과 비교했을 때 가장 큰 아키텍처/제품 수준의 변화는 통합 멀티모달 워크플로로의 전환과 이전 세대의 더 짧은 클립 대비 30초 네이티브 생성 상한입니다. Alibaba Cloud의 현재 Wan 3.0 자료는 이 모델을 롱폼 내러티브와 Omni-Reference 생성에 초점을 맞춘 것으로 명확히 포지셔닝하고 있습니다.
Kling 및 Veo와 비교할 때, Wan 3.0의 가장 강력한 차별점은 모든 생성 프레임이 반드시 더 뛰어나다는 점이 아닙니다. 오히려 많은 소스 자료를 결합하고 더 긴 생성 동안 그 정보를 유지하는 능력입니다.
입력이 단순히 **"이 프롬프트로 시네마틱 클립을 생성해줘"**인 애플리케이션에서는 다른 모델도 충분히 경쟁력이 있을 수 있습니다. 반면 입력이 **"이 제품 이미지, 캐릭터 레퍼런스, PDF, 스프레드시트, 오디오 샘플, 크리에이티브 브리프를 일관된 비디오로 만들어줘"**인 워크플로에서는 Wan 3.0이 훨씬 더 매력적입니다.
Wan 3.0 대표 사용 사례
1. AI 영화 제작 및 스토리 프로덕션
30초 단일 생성 기능은 수많은 짧은 클립을 이어 붙이지 않고도 연속적인 카메라 무빙, 대사, 다중 동작이 필요한 장면에 유용합니다.
2. 제품 광고
제품 이미지나 여러 레퍼런스를 감독형 프롬프트와 결합하여 제품 데모, UGC 광고, 시네마틱 브랜드 비디오를 제작할 수 있습니다.
3. 프레젠테이션-투-비디오 생성
Wan 3.0은 PPT, PDF, DOC, XLS 및 기타 지원 문서 형식을 처리하므로 보고서, 프레젠테이션, 구조화된 정보를 시각적 내러티브로 변환하는 데 적합합니다.
4. 캐릭터 일관성 비디오
레퍼런스 이미지, 비디오 및 기타 미디어를 사용하여 장면을 생성하기 전에 캐릭터, 오브젝트, 환경을 확립할 수 있습니다.
5. 소셜 미디어 콘텐츠
30초 길이와 세로 9:16 화면비는 Wan 3.0을 숏폼 소셜 콘텐츠, 광고, 내러티브 클립에 적합하게 만듭니다.
6. 비디오 편집과 반복 개선
Wan 3.0은 시각 요소, 스토리 콘텐츠, 대사를 포함해 기존 생성물을 수정할 수 있어 반복적 크리에이티브 워크플로를 지원합니다.
Wan 3.0 API 매개변수
공식 API는 비디오 생성 비동기 엔드포인트를 사용합니다. 단순화된 요청은 model, input, parameters 객체를 포함합니다.
중요한 매개변수는 다음과 같습니다:
| Parameter | 설명 |
|---|---|
| model | wan3.0-video |
| input.prompt | 감독 스타일의 생성 지시문 |
| input.media | 레퍼런스 이미지, 비디오, 오디오, 파일 또는 웹 리소스 |
| parameters.resolution | 480P, 720P, 1080P |
| parameters.ratio | adaptive, 16:9, 4:3, 1:1, 3:4, 9:16 |
| parameters.duration | 2–30초; -1은 스마트 길이 활성화 |
| parameters.audio | 오디오 트랙 포함 여부 |
| parameters.seed | 재현성을 위한 랜덤 시드 |
| parameters.watermark | 워터마크 추가 여부 |
공식 문서에 따르면 비디오 입력이 제공되지 않으면 길이는 2~30초의 정수로 설정할 수 있습니다. 비디오 입력이 제공되는 경우 입력과 출력 길이의 합이 지원되는 총 길이 내에 있어야 합니다.
CometAPI에서 Wan 3.0 API 사용하는 방법
여러 AI 비디오 모델을 활용하는 개발자에게 CometAPI는 Wan 3.0을 다른 비디오 생성 모델과 함께 실험할 수 있는 통합 액세스 레이어로 사용할 수 있습니다.
일반적인 워크플로는 다음과 같습니다:
- CometAPI 계정을 생성하거나 로그인합니다.
- CometAPI API 키를 발급받습니다.
- Wan 3.0 모델 엔드포인트를 선택합니다.
- 텍스트-투-비디오, 이미지-투-비디오 또는 레퍼런스 기반 생성 요청을 제출합니다.
- 해상도, 길이, 화면비 및 기타 지원 매개변수를 지정합니다.
- 비동기 생성 작업을 모니터링합니다.
- 처리 완료 후 생성된 비디오를 가져옵니다.
구체적인 CometAPI 엔드포인트와 지원 매개변수는 구현 전에 최신 CometAPI Wan 3.0 통합 내용을 확인해야 하며, 특히 상위 Alibaba API가 여전히 프리뷰 단계이기 때문입니다.