Flux 3란 무엇인가?
차세대 멀티모달 파운데이션 모델
FLUX 3는 원년 Stable Diffusion 연구자 몇 명이 설립한 회사인 Black Forest Labs가 개발한 최신 프론티어 모델입니다.
이미지 생성, 비디오 생성, 오디오 이해, 로보틱스를 별도의 AI 시스템으로 다루는 대신, FLUX 3는 이를 하나의 공유 신경 표현으로 해결하려고 시도합니다.
전통적인 확산 모델은 주로 다음을 학습합니다:
- 텍스트 → 이미지
- 이미지 편집
- 이미지 변형
반면 FLUX 3는 다음을 학습합니다:
- 이미지 생성
- 비디오 생성
- 오디오 이해
- 운동 예측
- 시간적 일관성
- 행동 예측
- 세계 역학
이 아키텍처는 순수 생성형 AI를 넘어 연구자들이 점점 더 World Models라고 부르는 방향으로 나아갑니다.
기술 사양
| 사양 | Flux 3 |
|---|---|
| 개발사 | Black Forest Labs |
| 출시 | 2026 (프리뷰 발표) |
| 모델 유형 | 통합 멀티모달 파운데이션 모델 |
| 아키텍처 | Flow Matching / 멀티모달 파운데이션 아키텍처 |
| 입력 모달리티 | 텍스트, 이미지, 비디오, 오디오 |
| 출력 모달리티 | 이미지, 비디오, 오디오, 행동 예측 |
| 학습 전략 | 공동 멀티모달 학습 |
| 주요 목표 | 월드 모델링 |
| 이미지 생성 | 예 |
| 비디오 생성 | 예 |
| 오디오 모델링 | 예 |
| 로보틱스 지원 | 예 |
| 행동 예측 | 예 |
| API 제공 여부 | 얼리 액세스 |
| 오픈 소스 | 아니오 (현재) |
| 상용 API | 예정 |
Flux 3의 특징 및 하이라이트
정정: 귀하의 개요에는 "Features and Highlights of Claude Sonnet 5."가 요청되어 있었지만, 이 글은 Flux 3에 관한 것이므로 적절한 섹션은 "Features and Highlights of Flux 3."입니다.
1. 통합 멀티모달 학습
여러 전문가 모델을 조합하는 대신, Flux 3는 지원되는 모든 모달리티를 대상으로 공동 최적화를 수행합니다.
이점은 다음과 같습니다:
- 공유된 의미 이해
- 크로스모달 추론
- 더 나은 일관성
- 모달리티 전환 감소
2. 월드 모델링
가장 큰 혁신은 이미지 합성에서 세계 이해로의 전환일 것입니다.
이 모델은 다음을 학습하려고 시도합니다:
- 중력
- 사물 영속성
- 충돌
- 시간적 운동
- 인과성
- 인간의 움직임
이는 Flux 3를 로보틱스 시뮬레이션과 인터랙티브 환경에 적합하게 만듭니다.
3. 네이티브 비디오 학습
이미지 생성을 비디오로 확장하는 많은 확산 시스템과 달리, 전해진 바에 따르면 Flux 3는 비디오를 핵심 학습 신호로 취급합니다.
Black Forest Labs에 따르면:
- 비디오 학습이 전체 학습 연산의 95% 이상을 사용
- 정적 렌더링보다 시간적 이해를 우선시
- 움직임 예측이 일관성을 개선
4. 오디오 통합
Flux 3는 사후 추가가 아니라 오디오를 공동 학습합니다.
잠재적 역량은 다음을 포함합니다:
- 립싱크
- 환경 음향 이해
- 멀티모달 추론
- 동기화된 비디오 생성
5. 로보틱스 지향 설계
발표에서는 로보틱스를 중요한 배포 대상으로 강조합니다.
잠재적 활용 사례:
- 로봇 계획
- 내비게이션
- 산업 자동화
- 자율 시스템
6. 고품질 이미지 생성
Flux 3는 다음 분야에서 BFL의 강한 명성을 이어가며:
- 포토리얼리즘
- 타이포그래피
- 프롬프트 준수
- 조명 현실감
- 구도
이미지 전용 작업을 넘어 영역을 확장합니다.
모델 버전
출시 시점에 Black Forest Labs는 Flux 3를 다양한 파생군이 아니라 통합 멀티모달 플랫폼으로 소개했습니다. 현재 공개 정보는 다음과 같습니다:
| 모델 | 상태 |
|---|---|
| Flux 3 | 얼리 액세스 |
| Flux 3 API | 예정 |
| 이미지 생성 | 이용 가능 |
| 비디오 생성 | 프리뷰 |
| 오디오 생성 | 프리뷰 |
| 행동 예측 | 프리뷰 |
추가 변형(예: Pro, Dev 또는 경량 에디션)은 아직 공식 발표되지 않았습니다.
벤치마크 성능
모델과 이를 둘러싼 지원 체계가 아직 개발 중이므로, 이 결과는 예비적이며 얼리 액세스 단계 동안 추가 개선이 예상됩니다. 초기 평가 전반에서, FLUX 3는 Grok Imagine Video 대비 최대 69%의 비교에서 선호되었고, Kling v3 Pro 대비 60%, Happy Horse v1 대비 59%, Happy Horse 1.1 대비 57%, Seedance 2.0 및 Gemini Omni Flash 대비 52%에서 선호되었습니다. FLUX 3는 Runway Gen-4.5 대비 77%, Luma Ray 3.2 대비 93%의 비교에서 선호되었습니다.

주장되는 강점은 다음과 같습니다:
- 우수한 시간적 일관성
- 더 나은 물리적 추론
- 향상된 동작 생성
- 네이티브 멀티모달 학습
- 로보틱스 지향 월드 모델링
전통적인 이미지 벤치마크(FID, CLIPScore, GenEval)와 달리, Flux 3의 많은 의도된 애플리케이션은 비디오 일관성, 멀티모달 정렬, 행동 예측에 초점을 맞춘 새로운 평가 방법을 필요로 할 가능성이 큽니다.
제한 사항
인상적인 아키텍처에도 불구하고, Flux 3에는 여전히 몇 가지 제한이 있습니다.
얼리 액세스
현재 모델은 일반적으로 이용할 수 없습니다.
가격 미공개
공식 API 가격은 아직 발표되지 않았습니다.
하드웨어 요구 사항
이 모델은 이미지, 비디오, 오디오, 행동 예측을 공동으로 학습하므로, 추론에는 이미지 전용 FLUX 모델보다 상당히 더 많은 연산 자원이 필요할 것으로 예상됩니다.
문서가 제한적임
많은 아키텍처 세부 사항이 공개되지 않았습니다.
CometAPI에서 Flux 3 API를 사용하는 방법
Flux 3가 API 제공자를 통해 제공되면, CometAPI와 같은 통합 API 게이트웨이는 통합을 단순화할 수 있습니다.
일반적인 워크플로는 다음과 같습니다:
- CometAPI 계정을 등록합니다.
- 대시보드에서 API 키를 발급받습니다.
- Flux 3 모델을 선택합니다(사용 가능해지면).
- 표준 REST 또는 SDK 인터페이스로 요청을 보냅니다.
- 생성된 이미지, 비디오 또는 멀티모달 출력을 수신합니다.
정확한 엔드포인트와 페이로드는 Flux 3 지원이 출시되면 CometAPI가 공개하는 문서에 따르게 됩니다.
CometAPI를 사용하는 이유?
여러 AI 제공업체를 사용할 수 있는 애플리케이션을 구축하는 개발자에게, API 집계 플랫폼은 다음과 같은 운영상의 이점을 제공할 수 있습니다:
- 통합 인터페이스: 여러 파운데이션 모델을 위한 하나의 API로, 개별 통합 유지보수를 줄입니다.
- 제공업체 유연성: 역량이나 가격이 변함에 따라 모델 간 전환이 더 쉬워집니다.
- 간소화된 키 관리: 인증과 청구를 중앙집중식으로 관리합니다.
- 더 빠른 실험: 최소한의 코드 변경으로 서로 다른 이미지 또는 멀티모달 모델을 비교합니다.
- 확장성: 제공업체 간 요청을 라우팅하고 사용량을 더 효율적으로 관리합니다.
CometAPI가 Flux 3를 지원하는지—그리고 정확한 기능 세트—는 현재 모델 카탈로그와 출시 일정에 따라 달라집니다.