GPT-6.1 Sol are now live on CometAPI →
ai-model/Recherche CometAPI

Qu'est-ce que FLUX 3 ? Spécifications, tests de performance, fonctionnalités, tarifs et accès à l'API

Explorez le modèle d’IA multimodale de Black Forest Labs, y compris les spécifications de FLUX 3, les tests de référence, les fonctionnalités, la tarification, l’architecture Self-Flow, les concurrents et l’accès à l’API.

CometAPI
Deon GoodwinÉquipe de recherche sur les modèles IA et API
Mis à jour Oct 3, 2026 22 min de lecture
Qu'est-ce que FLUX 3 ? Spécifications, tests de performance, fonctionnalités, tarifs et accès à l'API
Utiliser ce modèle

Passez le premier appel API.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR : FLUX 3 est le modèle fondation multimodal unifié de Black Forest Labs. Son API Vidéo publique génère des clips jusqu’à 20 secondes à 24 ips, avec audio synchronisé en option, à partir de texte, d’images, d’images clés ou de vidéo existante. Elle prend en charge des résolutions de la HD à l’UHD/4K, tandis que FLUX 3 Image et le modèle FLUX 3 Dev à poids ouverts restent des éléments de déploiement distincts.

Qu’est-ce que FLUX 3 ?

FLUX 3 est un modèle multimodal de pointe de Black Forest Labs. Plutôt que d’entraîner séparément un modèle pour les images, un autre pour la vidéo, et un autre pour l’audio, BFL entraîne une représentation partagée à travers ces modalités.

L’idée centrale est que les images, la vidéo et le son sont des observations différentes du même monde sous-jacent. Une voiture en mouvement possède une apparence visuelle, un mouvement, un son, des relations spatiales, des propriétés matérielles et un comportement causal. Apprendre ces signaux ensemble impose au modèle davantage de contraintes que l’apprentissage isolé d’images individuelles.

C’est pourquoi Black Forest Labs décrit FLUX 3 comme une étape vers un modèle de réalité ou modèle du monde plutôt qu’un simple générateur d’images ou de vidéos. Le système vidéo publié en témoigne déjà : audio synchronisé, mouvement, structure de scène, dialogue, comportement de la caméra et sons d’ambiance sont pris en charge dans un seul flux de génération.

Toutes les capacités annoncées de FLUX 3 ne sont pas encore publiques. En septembre 2026, FLUX 3 Video est disponible, tandis que FLUX 3 Image et le modèle FLUX 3 Dev à poids ouverts restent des éléments de déploiement distincts.

Caractéristiques de FLUX 3 en un coup d’œil

Les spécifications suivantes reflètent la documentation développeur actuelle de FLUX 3 plutôt que la configuration préliminaire du lancement de juillet.

SpécificationDocumentation officielle de FLUX 3
DéveloppeurBlack Forest Labs
Famille de modèlesFLUX 3
Type de modèleFondation multimodale unifiée / modèle vidéo génératif
Publication vidéo publique4 août 2026
Orientation d’entraînementApprentissage conjoint des représentations image/vidéo/audio
Base de rechercheSelf-Flow
Sortie principale actuelle de l’APIVidéo avec audio synchronisé
Texte vers vidéoPris en charge
Image vers vidéoPris en charge
Images clés vers vidéoPris en charge
Continuation vidéoPris en charge
Durée maximale T2V/I2V20 secondes
Durée de continuation vidéo5–15 secondes
Fréquence d’images24 ips
RésolutionHD, FHD, QHD/2K et UHD/4K
Résolution FHD 16:91920 × 1088
Références d’imagesJusqu’à 10 pour les flux I2V/images clés
Audio natifOui
Dialogue multilingueOui
Synchronisation labialeOui
Génération multi-plansOui
Draft ModeOui
Point de terminaison FLUX 3 pour image fixe (public)Pas encore généralement publié par BFL
FLUX 3 Dev à poids ouvertsPrévu

La documentation actuelle de BFL précise 5–20 secondes pour texte-vers-vidéo et image-vers-vidéo, tandis que la continuation vidéo accepte une fenêtre de génération de 5–15 secondes. Les rapports d’aspect pris en charge incluent 21:9, 2:1, 16:9, 4:3, 1:1, 3:4 et 9:16.

Comment fonctionne FLUX 3 ?

Self-Flow

La base de recherche clé est Self-Flow, l’approche d’appariement de flux auto-supervisée de Black Forest Labs. Les pipelines d’entraînement génératif traditionnels s’appuient souvent sur des modèles de représentation préentraînés distincts ou une supervision auxiliaire. Self-Flow est conçu pour apprendre des représentations utiles directement à partir de l’objectif génératif.

Un mécanisme majeur est le Dual-Timestep Scheduling. Différents groupes de jetons peuvent se voir attribuer des niveaux de bruit différents pendant l’entraînement. Cela crée une asymétrie d’information : certaines parties de l’entrée contiennent plus d’informations exploitables que d’autres, forçant le réseau à construire des représentations qui aident à déduire ce qui manque.

Concrètement, FLUX 3 est encouragé à apprendre les relations entre objets, images, mouvement, son et événements temporels plutôt que de simplement mémoriser l’apparence d’images individuelles.

Qu'est-ce que FLUX 3 ? Spécifications, tests de performance, fonctionnalités, tarifs et accès à l'API

Architecture de la méthode Self-Flow - source d’image officielle : Projet Self-Flow de Black Forest Labs

BFL a également testé un entraînement multimodal conjoint en utilisant un backbone dérivé de FLUX.2 avec des millions de vidéos et des centaines de millions d’images. Les expériences renforcent l’hypothèse plus large de FLUX 3 selon laquelle l’apprentissage de représentations et la génération n’ont pas besoin d’être des systèmes séparés.

Pourquoi la vidéo est au cœur de FLUX 3

La vidéo est particulièrement précieuse pour la modélisation du monde car elle contient des informations qu’une image fixe ne peut pas fournir. Une seule image peut montrer une balle au-dessus du sol ; une vidéo peut révéler que la balle tombe, rebondit, se déforme à l’impact, émet un son et change ensuite de direction.

BFL a indiqué que la prédiction vidéo représente plus de 95 % du calcul d’entraînement de FLUX 3. L’audio est relativement peu coûteux car c’est un signal de bien plus faible dimension étroitement couplé aux événements visibles. Cette répartition aide à expliquer pourquoi la vidéo est la première capacité de FLUX 3 à atteindre la disponibilité générale.

Que peut faire FLUX 3 ?

Texte vers vidéo

Les utilisateurs peuvent générer une vidéo complète à partir d’instructions en langage naturel. BFL indique que le modèle publié gère des prompts simples et complexes tout en coordonnant mouvement, logique de scène, composition visuelle et son. C’est particulièrement utile pour des prompts contenant plusieurs événements séquentiels plutôt qu’un seul sujet animé.

Image vers vidéo et images clés

FLUX 3 peut animer une image initiale, viser une image de fin, ou utiliser plusieurs images comme images clés temporisées. L’API actuelle prend en charge jusqu’à dix références d’images dans les flux image-vers-vidéo, permettant aux créateurs de contrôler l’évolution d’une scène dans le temps plutôt que de demander au modèle d’improviser toute la séquence.

Continuation vidéo

Une vidéo existante et son audio peuvent être fournis comme contexte et FLUX 3 peut générer la suite. BFL décrit une continuation qui préserve le mouvement, le comportement de la caméra, le dialogue et le son à travers la transition, ce qui est matériellement différent de générer un second clip indépendant puis d’assembler les deux fichiers a posteriori.

Audio natif et dialogue

FLUX 3 produit l’audio au moment de la génération au lieu d’exiger une passe distincte de génération de parole ou de son. Ses capacités audio publiées incluent dialogue, effets sonores et ambiance. Le dialogue multilingue avec synchronisation labiale est également pris en charge.

Plusieurs plans en une seule génération

Un seul prompt peut contenir plusieurs scènes ou angles de caméra. Cela compte car de nombreux modèles vidéo antérieurs sont meilleurs quand on leur demande un plan court et visuellement continu ; FLUX 3 est explicitement conçu pour prendre en charge des séquences multi-plans au sein d’une seule génération.

Draft Mode

Le Draft Mode est l’un des ajouts les plus pratiques pour la génération vidéo à fort volume. Au lieu de payer le plein tarif pour chaque essai de prompt, les développeurs peuvent créer un aperçu plus rapide et moins coûteux puis améliorer l’esquisse sélectionnée tout en préservant la composition et le mouvement choisis. Selon la tarification BFL actuelle, un brouillon T2V/I2V standard coûte 0,06 $ par seconde, contre 0,17 $ par seconde pour une génération HD normale.

Qu’est-ce qui n’a pas encore été livré ?

L’annonce de lancement de FLUX 3 décrivait des capacités image, vidéo, audio et action sous une même direction architecturale, mais la disponibilité est échelonnée.

CapacitéFeuille de route BFL actuelle et disponibilité
Génération vidéo FLUX 3Généralement disponible
Audio vidéo natifGénéralement disponible
Texte vers vidéoGénéralement disponible
Image vers vidéo / images clésGénéralement disponible
Continuation vidéoGénéralement disponible
Combinaisons plus riches de références image/vidéo/audioExtension prévue
Génération et édition d’images FLUX 3À venir
FLUX 3 Dev à poids ouvertsPrévu
Déploiement de prédiction d’actionsRecherche / voie partenaires commerciaux

Cette distinction est particulièrement importante pour les utilisateurs familiers de FLUX.2 Max. FLUX.2 reste une option dédiée actuelle pour la génération d’images fixes, tandis que le produit public FLUX 3 est centré sur la vidéo et l’audio.

Performances de référence de FLUX 3

Il existe désormais deux types utiles de preuves de référence pour FLUX 3 : l’évaluation interne post-publication de BFL et l’évaluation indépendante tierce. La première montre la préférence humaine relative selon le protocole de BFL ; la seconde vérifie si ces forces restent visibles selon un benchmark conçu séparément.

Évaluation ELO post-publication de BFL

L’annonce initiale de juillet incluait des taux de victoire préliminaires. Le benchmark le plus pertinent pour les utilisateurs actuels est l’évaluation du modèle publié le 4 août par BFL. Black Forest Labs rapporte un score ELO texte-vers-vidéo de 1135 dans son évaluation interne tous-contre-tous.

Qu'est-ce que FLUX 3 ? Spécifications, tests de performance, fonctionnalités, tarifs et accès à l'API

Évaluation ELO du modèle publié FLUX 3 - source d’image officielle : Black Forest Labs

IndicateurÉvaluation du modèle publié par BFL
ELO texte-vers-vidéo1135
Position T2VScore le plus élevé du groupe testé par BFL
Résultat image-vers-vidéoÀ égalité avec le meilleur concurrent testé et supérieur aux autres modèles évalués
Type d’évaluationÉvaluation interne de préférence humaine
Phase du modèlePublication générale de FLUX 3 Video

C’est une preuve plus solide que le benchmark préliminaire du lancement car il évalue le modèle d’août publié. Cela reste toutefois un benchmark opéré par le fournisseur et ne doit pas être interprété comme une preuve que FLUX 3 surpassera chaque concurrent sur chaque catégorie de prompts.

Benchmark indépendant de FLUX 3

Le v-benchmark v2 de Megaton fournit une vérification indépendante. FLUX 3 a été évalué en août 2026 et affiche actuellement un Indice Megaton de 76,51/100, se classant n° 3 dans l’ensemble publié au moment de l’évaluation.

Dimension du benchmarkÉvaluation de FLUX 3 par Megaton
Indice Megaton76,51
Conformité au prompt87,07
Cohérence de scène94,76
Physique70,63
Fidélité humaine73,70
Fidélité des objets et produits83,82
Cohérence causale et sémantique80,91
Fidélité du texte82,41
Cinématographie71,43
Goût et direction artistique65,00

Le profil est plus informatif que le score global. La cohérence de scène à 94,76 est la catégorie majeure la plus forte, tandis que la conformité au prompt, la fidélité des objets, la cohérence causale et la fidélité du texte dépassent également 80. La physique, la fidélité humaine et le goût/direction artistique sont plus faibles, montrant qu’une représentation temporelle plus forte n’élimine pas les mouvements synthétiques ou la variabilité de qualité artistique.

Cela explique aussi pourquoi les conclusions de benchmark peuvent diverger : le test de préférence interne de BFL place FLUX 3 en tête de son ensemble comparatif, tandis que le classement indépendant de Megaton le place troisième. Des prompts différents, des dimensions de notation, des populations d’évaluateurs et des méthodes d’agrégation différentes peuvent produire des classements différents.

FLUX 3 vs Seedance 2.5 vs MiniMax H3 vs Wan 3.0

Le marché de la vidéo IA a évolué rapidement en 2026. FLUX 3 rivalise désormais avec des systèmes multimodaux qui combinent de plus en plus la génération longue, l’audio synchronisé, les références et l’édition.

DimensionFLUX 3Seedance 2.5MiniMax H3Wan 3.0
DéveloppeurBlack Forest LabsByteDance SeedMiniMaxAlibaba
Durée maximale annoncée du clip20 s30 s15 s30 s
Résolution vidéoHD / FHD / QHD (2K) / UHD (4K)Dépend du palier APIJusqu’à 2KJusqu’à 1080p
Audio natifOuiOuiOui, stéréoOui
Texte vers vidéoOuiOuiOuiOui
Entrée image/référenceOuiOuiOuiOui
Contrôle par images clés/référencesImages clés temporisées robustesContrôle de référence multimodal robusteConditionnement multimodalContrôle par références multimodal
Continuation/édition vidéoContinuation disponibleFlux orienté éditionFocalisation omni-générationFlux d’édition et de référence
Génération multi-plansOuiOuiOuiOui
Atout distinctifArchitecture de modèle de réalité, cohérence de scène, Self-FlowRécits longue durée et contrôle par référenceGénération audiovisuelle 2K et contexte omni-modalClips longs et coût de départ inférieur
Prix de départ/unitaire CometAPI*0,136 $/s0,0824 $/s indiqué0,064 $/s0,040 $/s

* Les prix ne sont qu’une comparaison approximative. Les API vidéo utilisent des résolutions, durées, niveaux de qualité et règles de facturation différents ; le prix par seconde le plus bas n’est pas nécessairement le moins cher pour une qualité équivalente.

FLUX 3 vs Seedance 2.5

Seedance 2.5 a un avantage évident en durée, avec une génération jusqu’à 30 secondes contre 20 secondes pour FLUX 3. Il est également fortement orienté vers la génération pilotée par références, l’édition et les récits longue durée. FLUX 3 se différencie par son architecture de modèle du monde partagé, la cohérence de scène, la génération audiovisuelle native, les images clés temporisées et une feuille de route plus large sur l’image/l’action.

Les tests indépendants confirment qu’il s’agit d’une compétition haut de gamme réelle : Megaton place actuellement Seedance 2.5 devant FLUX 3 au global.

FLUX 3 vs MiniMax H3

MiniMax H3 propose jusqu’à 2K et un audio stéréo natif, offrant une spécification technique solide pour le contenu audiovisuel. FLUX 3 prend en charge une fenêtre de génération maximale plus longue — 20 secondes contre 15 secondes pour H3 — et son Draft Mode propose un flux d’itération à coût maîtrisé.

FLUX 3 vs Wan 3.0

Wan 3.0 met l’accent sur des entrées multimodales étendues, la génération audiovisuelle, l’édition et des clips jusqu’à 30 secondes. Il est également moins cher au prix de départ indiqué par CometAPI. FLUX 3 est plus onéreux mais se différencie par son positionnement de modèle de réalité, la cohérence de scène, la base de recherche Self-Flow, le Draft Mode et l’intégration avec la prédiction d’actions.

Tarification de FLUX 3

Black Forest Labs facture FLUX 3 en fonction de la durée de la vidéo générée.

ModeTarification officielle BFL FLUX 3
T2V / I2V Draft HD0,06 $/s
T2V / I2V HD0,17 $/s
T2V / I2V FHD0,29 $/s
T2V / I2V QHD (2K)0,40 $/s
T2V / I2V UHD (4K)0,80 $/s
Continuation vidéo Draft0,12 $/s
Continuation vidéo HD0,41 $/s
Continuation vidéo FHD0,53 $/s
Continuation vidéo QHD (2K)0,65 $/s
Continuation vidéo UHD (4K)0,95 $/s

Une génération HD standard de 10 secondes coûte donc environ 1,70 $ au tarif affiché par BFL, tandis qu’une génération FHD de 10 secondes coûte environ 2,90 $. La continuation vidéo est sensiblement plus chère que la génération ordinaire, de sorte que les applications prolongeant fréquemment des clips doivent modéliser ces coûts séparément.

Prix de FLUX 3 sur CometAPI

CometAPI répertorie actuellement FLUX 3 comme disponible avec l’ID de modèle flux-3.

RésolutionTarification FLUX 3 sur CometAPI
720p0,136 $/s
1080p0,232 $/s

Pour une génération de 10 secondes, cela correspond à environ 1,36 $ en 720p ou 2,32 $ en 1080p. Comparés aux tarifs de 0,17 $/s et 0,29 $/s affichés par BFL, les prix par défaut de CometAPI sont environ 20 % plus bas pour ces deux paliers.

Note de disponibilité : certains anciens textes descriptifs sur CometAPI reflètent encore la période d’accès anticipé de juillet. L’actuelle fiche modèle en ligne, la section tarification et l’exemple d’API indiquent flux-3 comme Disponible, avec une date de sortie CometAPI au 13 août 2026. Pour les décisions d’intégration, l’API active et les champs de tarification sont plus pertinents que les anciens textes de disponibilité.

Pourquoi FLUX 3 compte au-delà de la vidéo IA

La partie la plus inhabituelle de FLUX 3 n’est pas la génération de vidéos de 20 secondes. Plusieurs concurrents peuvent déjà générer des clips aussi longs ou plus longs. Le pari technique majeur est qu’une représentation vidéo solide peut devenir une base pour d’autres formes d’intelligence.

De la prédiction vidéo à la prédiction d’actions

Les signaux de contrôle robotique sont des prédictions temporelles conditionnées par des observations visuelles, si bien que BFL utilise la représentation vidéo de FLUX 3 comme base pour la prédiction d’actions. Sa collaboration avec mimic robotics a produit FLUX-mimic, où un décodeur d’actions lit des représentations issues du modèle vidéo au lieu d’entraîner une pile de perception entièrement indépendante.

BFL indique que le backbone FLUX-mimic peut s’exécuter en moins de 80 ms sur une RTX 5090, tandis que le système robotique complet atteint une boucle de réaction d’environ 101 ms. L’entreprise a également évoqué une évaluation industrielle avec Audi.

Cela ne fait pas de l’API publique FLUX 3 Video une API de robotique. Cela démontre pourquoi BFL a investi massivement dans la représentation vidéo multimodale plutôt que de traiter la génération vidéo comme une tâche média isolée.

Quelles sont les principales forces de FLUX 3 ?

  • Cohérence temporelle et de scène. Le score de Cohérence de scène de 94,76 chez Megaton est la catégorie majeure la plus forte du modèle.
  • Génération audiovisuelle native. Dialogue, effets, ambiance et visuels peuvent être générés ensemble plutôt que raboutés à partir de modèles séparés.
  • Forte conformité au prompt. Le résultat indépendant de 87,07 en Conformité au prompt suggère que les forces du modèle vont au-delà du simple fini visuel.
  • Contrôle par images clés. Jusqu’à dix images peuvent participer aux flux image-vers-vidéo actuels, donnant aux créateurs un contrôle temporel explicite.
  • Flux brouillon-vers-final. Le Draft Mode répond à un vrai problème de coût en vidéo IA : beaucoup de générations sont jetées pendant l’itération de prompt.
  • Large registre visuel. BFL positionne FLUX 3 comme capable de rendus bruts, naturels, cinématographiques, nostalgiques, ludiques, stylisés et atypiques plutôt qu’un style maison unique.
  • Orientation recherche de modèle du monde. Self-Flow et la prédiction d’actions rendent FLUX 3 pertinent au-delà de la génération média.

Quelles sont les limites de FLUX 3 ?

  • La feuille de route multimodale complète n’a pas été livrée. Il ne faut pas présumer l’existence publique de FLUX 3 Image et de FLUX 3 Dev à poids ouverts à partir de l’annonce de famille.
  • 20 secondes n’est plus une durée de tête d’affiche dans l’industrie. Certains concurrents 2026 prennent déjà en charge 30 secondes.
  • La physique n’est pas résolue. Megaton attribue à FLUX 3 un score Physique de 70,63, nettement inférieur à sa cohérence de scène.
  • La fidélité humaine peut encore progresser. Un score indépendant de 73,70 signifie qu’une anatomie difficile et des mouvements humains réalistes peuvent encore échouer.
  • La continuation vidéo est coûteuse. Le prix de continuation de BFL est substantiellement plus élevé par seconde que la T2V/I2V ordinaire.
  • Le benchmark compétitif phare de BFL est interne. Les décisions de production devraient aussi inclure des tests indépendants utilisant les prompts, types de plans, langues et ressources de référence propres à l’application.

Comment utiliser FLUX 3 avec CometAPI

La couverture antérieure de FLUX 3 par CometAPI explique la phase d’accès anticipé de juillet, les benchmarks préliminaires et le déploiement prévu. Cette section se concentre sur l’intégration de production actuelle, la tarification et le flux d’API fonctionnel pour éviter de répéter ce parcours historique. Le modèle FLUX 3 de production utilise l’ID de modèle flux-3.

Une requête 720p de base utilise l’endpoint /v1/videos :

Bash

curl --request POST "https://api.cometapi.com/v1/videos" \
--header "Authorization: Bearer $COMETAPI_KEY" \
--form-string "model=flux-3" \
--form-string "prompt=Un bateau en papier glisse sur un étang immobile sous une douce lumière matinale" \
--form-string "seconds=5" \
--form-string "size=1280x720"

Le flux vidéo est asynchrone. Après la requête initiale qui renvoie un ID de tâche, l’application interroge la tâche jusqu’à ce que la génération soit terminée, puis récupère la vidéo résultante. Pour les applications de production, la génération devrait normalement être gérée par un job en arrière-plan ou une file de tâches plutôt que de garder une requête HTTP ouverte pendant tout le temps de rendu.

Qui devrait utiliser FLUX 3 ?

FLUX 3 est particulièrement convaincant pour les applications qui ont besoin de plus que de jolis clips de cinq secondes : systèmes publicitaires avec visuels et audio synchronisés, production automatisée de formats courts, démonstrations produit où la persistance des objets compte, génération de dialogues multilingues, flux storyboard-vers-vidéo, animation contrôlée par images clés, contenus éducatifs et expérimentations avec des pipelines multimodaux plus longs.

Il peut être moins attractif lorsque la seule exigence est le coût par seconde le plus bas, quand plus de 20 secondes doivent être générées en une seule passe, ou lorsque la génération d’images fixes est la tâche principale. Pour les images fixes, un modèle d’image FLUX existant tel que FLUX.2 Max peut actuellement être un meilleur choix.

FLUX 3 est-il meilleur que les autres modèles vidéo IA ?

Il n’existe pas de réponse unique défendable pour tous les cas d’usage. L’évaluation interne de BFL place le FLUX 3 publié en tête de sa comparaison texte-vers-vidéo, tandis que l’évaluation indépendante de Megaton classe FLUX 3 troisième au global derrière des concurrents plus récents. Les deux résultats peuvent être valides car les tests mesurent des distributions de prompts et des dimensions de qualité différentes.

FLUX 3 semble particulièrement fort lorsque la cohérence de scène, le suivi du prompt, la fidélité des objets, la cohérence causale, le rendu de texte, le son synchronisé et les images clés contrôlables comptent. D’autres modèles peuvent l’emporter sur la durée maximale, la résolution, les préférences artistiques, la fidélité humaine, les flux d’édition ou le coût. Pour les développeurs, la comparaison correcte est spécifique à la charge de travail plutôt qu’au classement.

Foire aux questions

FLUX 3 est-il disponible maintenant ?

Oui. FLUX 3 Video est devenu généralement disponible via BFL le 4 août 2026. CometAPI indique également FLUX 3 comme Disponible sous l’ID de modèle flux-3. La publication d’images fixes FLUX 3 et les poids ouverts FLUX 3 Dev restent des éléments distincts de la feuille de route.

FLUX 3 peut-il générer de l’audio ?

Oui. FLUX 3 Video génère un audio natif synchronisé incluant dialogue, ambiance et effets. Le dialogue multilingue et la synchronisation labiale sont également pris en charge.

Quelle est la durée maximale des vidéos FLUX 3 ?

La génération texte-vers-vidéo et image-vers-vidéo actuelle prend en charge 5–20 secondes. La continuation vidéo prend en charge 5–15 secondes de contenu nouvellement généré.

Quelle résolution FLUX 3 prend-il en charge ?

BFL prend en charge la HD (jusqu’à 1 mégapixel par image), la FHD (jusqu’à 2 MP), la QHD/2K (jusqu’à 4 MP) et l’UHD/4K (jusqu’à 8 MP). Une sortie FHD 16:9 est de 1920 × 1088. Les bandes de résolution sont basées sur le nombre total de pixels par image plutôt que sur le format d’image ; le Draft Mode est uniquement en HD.

FLUX 3 prend-il en charge image-vers-vidéo ?

Oui. La génération image-vers-vidéo et par images clés fait partie de l’ensemble de fonctionnalités FLUX 3 Video disponible généralement.

FLUX 3 est-il un modèle de génération d’images ?

Architecturalement, FLUX 3 est entraîné sur images, vidéo et audio, et BFL a démontré de la recherche en génération et édition d’images. Cependant, le produit FLUX 3 Image reste une publication à venir ; ne confondez pas la feuille de route de famille avec l’API publique actuelle FLUX 3 Video.

FLUX 3 est-il open source ?

Pas pour l’instant. BFL a annoncé FLUX 3 Dev, une variante multimodale à poids ouverts, mais n’a pas encore fourni de date de sortie publique.

Combien coûte FLUX 3 ?

BFL facture le texte/image-vers-vidéo à 0,06 $/s pour Draft HD, 0,17 $/s pour HD, 0,29 $/s pour FHD, 0,40 $/s pour QHD et 0,80 $/s pour UHD. La vidéo-vers-vidéo coûte 0,12 $/s pour Draft HD, puis 0,41 $/s pour HD, 0,53 $/s pour FHD, 0,65 $/s pour QHD et 0,95 $/s pour UHD. CometAPI indique actuellement 0,136 $/s pour 720p et 0,232 $/s pour 1080p.

Qu’est-ce que Self-Flow ?

Self-Flow est l’approche de recherche d’appariement de flux auto-supervisée de BFL. Elle est conçue pour permettre à un modèle génératif de développer des représentations internes utiles sans dépendre d’un modèle de représentation externe. Son utilisation de niveaux de bruit différents à travers les jetons encourage le réseau à déduire l’information manquante et à apprendre les relations entre observations multimodales.

FLUX 3 est-il un modèle du monde ?

Black Forest Labs positionne FLUX 3 comme une fondation de modèle de réalité parce que ses représentations partagées s’étendent de la prédiction audiovisuelle vers la prédiction d’actions physiques. Le qualifier de modèle du monde généraliste complet serait plus fort que les preuves actuelles ne le permettent ; une description plus précise est un modèle fondation multimodal explicitement conçu autour d’objectifs de modélisation du monde.

Conclusion

FLUX 3 représente pour Black Forest Labs un changement plus important qu’une simple mise à jour d’un modèle d’image FLUX vers un autre. L’idée clé est d’entraîner une représentation multimodale partagée du monde, puis d’utiliser cette représentation pour la vidéo, le son, les images, et à terme les actions. Self-Flow fournit la base de recherche, tandis que le modèle FLUX 3 Video publié est la première démonstration de production de cette stratégie.

En septembre 2026, FLUX 3 Video prend en charge des clips jusqu’à 20 secondes, 24 ips, des sorties de la HD à l’UHD/4K, l’audio synchronisé, le dialogue multilingue, l’image-vers-vidéo, les images clés, la continuation vidéo, la génération multi-plans et le Draft Mode.

Le paysage des benchmarks est aussi plus crédible qu’au lancement. L’évaluation actuelle du modèle publié par BFL place FLUX 3 premier dans son test ELO T2V interne, tandis que l’évaluation indépendante de Megaton le classe troisième au global et met en évidence une cohérence de scène particulièrement forte.

FLUX 3 n’est donc pas automatiquement le meilleur modèle vidéo pour toutes les charges de travail. Seedance 2.5, MiniMax H3, et Wan 3.0 peuvent offrir une génération plus longue, une résolution nominale plus élevée, un prix plus bas, ou des capacités différentes en matière de références et d’édition.

Ce qui rend FLUX 3 particulièrement intéressant, c’est l’orientation sous-jacente au générateur vidéo : BFL parie que les mêmes représentations nécessaires pour prédire une vidéo convaincante pourront à terme prendre en charge la génération d’images, l’audio, le raisonnement physique et les actions robotiques. Les développeurs peuvent déjà tester la première étape de production via FLUX 3 sur CometAPI en utilisant l’ID de modèle flux-3.

Continuer à apprendre

Reliez cet article à la décision suivante.

Voir tous les sujets
Publié le Oct 3, 2026
Dernière mise à jour Oct 3, 2026
0 vues
Revu pour la clarté, l'attribution des sources et la terminologie API actuelle.

En savoir plus