Resumo em uma frase: FLUX 3 é o modelo multimodal unificado de base da Black Forest Labs. Sua API pública de Vídeo gera clipes de até 20 segundos a 24 fps, com áudio sincronizado opcional, a partir de texto, imagens, quadros‑chave ou vídeo existente. Suporta resoluções de HD a UHD/4K, enquanto FLUX 3 Image e o modelo FLUX 3 Dev com pesos abertos permanecem como itens de lançamento separados.
O que é o FLUX 3?
FLUX 3 é um modelo multimodal de ponta da Black Forest Labs. Em vez de treinar de forma independente um modelo para imagens, outro para vídeo e outro para áudio, a BFL treina uma representação compartilhada entre essas modalidades.
A ideia central é que imagens, vídeo e som são observações diferentes do mesmo mundo subjacente. Um carro em movimento tem aparência visual, movimento, som, relações espaciais, propriedades materiais e comportamento causal. Aprender esses sinais em conjunto impõe mais restrições ao modelo do que aprender quadros individuais isoladamente.
É por isso que a Black Forest Labs descreve o FLUX 3 como um passo em direção a um modelo de realidade ou “modelo de mundo”, em vez de apenas um gerador de imagem ou vídeo. O sistema de vídeo lançado já demonstra essa direção: áudio sincronizado, movimento, estrutura de cena, diálogo, comportamento de câmera e sons ambientais são tratados em um único fluxo de geração.
Nem todos os recursos anunciados do FLUX 3 estão disponíveis publicamente ainda. Em setembro de 2026, o FLUX 3 Video está disponível, enquanto FLUX 3 Image e o modelo FLUX 3 Dev com pesos abertos permanecem como itens de lançamento separados.
Especificações do FLUX 3 em resumo
As especificações abaixo refletem a documentação atual do FLUX 3 para desenvolvedores, e não a configuração preliminar do lançamento de julho.
| Especificação | Documentação oficial do FLUX 3 |
|---|---|
| Desenvolvedor | Black Forest Labs |
| Família do modelo | FLUX 3 |
| Tipo de modelo | Modelo fundamental multimodal unificado / gerador de vídeo |
| Lançamento público de vídeo | 4 de agosto de 2026 |
| Direção central do treinamento | Aprendizado conjunto de representações de imagem, vídeo e áudio |
| Base de pesquisa | Self-Flow |
| Saída principal atual da API | Vídeo com áudio sincronizado |
| Texto para vídeo | Suportado |
| Imagem para vídeo | Suportado |
| Quadros‑chave para vídeo | Suportado |
| Continuação de vídeo | Suportado |
| Duração máxima de T2V/I2V | 20 segundos |
| Duração de continuação de vídeo | 5–15 segundos |
| Taxa de quadros | 24 fps |
| Resolução | HD, FHD, QHD/2K e UHD/4K |
| Resolução FHD 16:9 | 1920 × 1088 |
| Referências de imagem | Até 10 para fluxos I2V/quadros‑chave |
| Áudio nativo | Sim |
| Diálogo multilíngue | Sim |
| Sincronização labial | Sim |
| Geração com múltiplas tomadas | Sim |
| Modo Rascunho | Sim |
| Endpoint público de imagem estática do FLUX 3 | Ainda não lançado publicamente pela BFL |
| FLUX 3 Dev com pesos abertos | Planejado |
A documentação atual da BFL especifica 5–20 segundos para texto‑para‑vídeo e imagem‑para‑vídeo, enquanto a continuação de vídeo aceita uma janela de geração de 5–15 segundos. As proporções suportadas incluem 21:9, 2:1, 16:9, 4:3, 1:1, 3:4 e 9:16.
Como o FLUX 3 funciona?
Self-Flow
A base de pesquisa é o Self-Flow, a abordagem de ajuste de fluxo auto‑supervisionada da Black Forest Labs. Pipelines tradicionais de treinamento generativo costumam depender de modelos de representação pré‑treinados separados ou de supervisão auxiliar. O Self-Flow é projetado para aprender representações úteis diretamente a partir do objetivo generativo.
Um mecanismo importante é o Dual-Timestep Scheduling. Diferentes grupos de tokens podem receber diferentes níveis de ruído durante o treinamento. Isso cria assimetria de informação: algumas partes da entrada contêm mais informação utilizável do que outras, forçando a rede a construir representações que ajudem a inferir o que está faltando.
Na prática, o FLUX 3 é incentivado a aprender relações entre objetos, quadros, movimento, som e eventos temporais, em vez de simplesmente memorizar como quadros individuais devem parecer.

Arquitetura do método Self-Flow - fonte oficial da imagem: Projeto Self-Flow da Black Forest Labs
A BFL também testou treinamento multimodal conjunto usando um backbone derivado do FLUX.2 com milhões de vídeos e centenas de milhões de imagens. Os experimentos dão suporte à hipótese mais ampla do FLUX 3 de que aprendizado de representação e geração não precisam ser sistemas separados.
Por que o vídeo é central no FLUX 3
O vídeo é particularmente valioso para modelagem de mundo porque contém informação que uma imagem estática não pode fornecer. Um único quadro pode mostrar uma bola acima do chão; um vídeo pode revelar que a bola está caindo, quicando, deformando no impacto, produzindo som e mudando de direção depois.
A BFL divulgou que a previsão de vídeo representa mais de 95% do compute de treinamento do FLUX 3. O áudio é relativamente barato porque é um sinal de dimensão muito menor, estreitamente acoplado a eventos visíveis. Essa alocação ajuda a explicar por que o vídeo é o primeiro recurso do FLUX 3 a chegar à disponibilidade geral.
O que o FLUX 3 pode fazer?
Texto para vídeo
Usuários podem gerar um vídeo completo a partir de instruções em linguagem natural. A BFL afirma que o modelo lançado lida com prompts simples e complexos, coordenando movimento, lógica de cena, composição visual e som. Isso é especialmente útil para prompts que contêm múltiplos eventos sequenciais, e não apenas um único sujeito animado.
Imagem para vídeo e quadros‑chave
O FLUX 3 pode animar uma imagem inicial, trabalhar em direção a um quadro final ou usar múltiplas imagens como quadros‑chave temporizados. A API atual suporta até dez referências de imagem em fluxos de imagem‑para‑vídeo, permitindo que criadores controlem como uma cena muda ao longo do tempo, em vez de pedir ao modelo que improvise toda a sequência.
Continuação de vídeo
Um vídeo existente e seu áudio podem ser fornecidos como contexto e o FLUX 3 pode gerar o que acontece em seguida. A BFL descreve uma continuação que mantém movimento, comportamento de câmera, diálogo e som através da transição, o que é materialmente diferente de gerar um segundo clipe independente e juntar os dois arquivos depois.
Áudio nativo e diálogo
O FLUX 3 produz áudio no momento da geração, sem exigir uma etapa separada de geração de fala ou som. Seus recursos de áudio lançados incluem diálogo, efeitos sonoros e som ambiente. Diálogo multilíngue com sincronização labial também é suportado.
Múltiplas tomadas em uma única geração
Um único prompt pode conter múltiplas cenas ou ângulos de câmera. Isso é importante porque muitos modelos de vídeo anteriores são mais fortes quando solicitados a produzir uma tomada curta e visualmente contínua; o FLUX 3 é projetado explicitamente para suportar sequências com múltiplas tomadas em uma única geração.
Modo Rascunho
O Modo Rascunho é uma das adições mais práticas para geração de vídeo em grande volume. Em vez de pagar preço cheio por cada experimento de prompt, desenvolvedores podem criar uma prévia mais rápida e de menor custo e, em seguida, aprimorar o rascunho selecionado preservando a composição e o movimento escolhidos. Segundo a precificação atual da BFL, um rascunho padrão T2V/I2V custa US$ 0,06 por segundo, contra US$ 0,17 por segundo para geração HD normal.
O que ainda não foi lançado?
O anúncio de lançamento do FLUX 3 descreveu recursos de imagem, vídeo, áudio e ação sob uma mesma direção arquitetural, mas a disponibilidade é escalonada.
| Recurso | Roteiro atual da BFL e disponibilidade |
|---|---|
| Geração de vídeo do FLUX 3 | Disponível publicamente |
| Áudio nativo em vídeo | Disponível publicamente |
| Texto para vídeo | Disponível publicamente |
| Imagem para vídeo / quadros‑chave | Disponível publicamente |
| Continuação de vídeo | Disponível publicamente |
| Combinações mais ricas de referências (imagem/vídeo/áudio) | Expansão planejada |
| Geração e edição de imagem no FLUX 3 | Em breve |
| FLUX 3 Dev com pesos abertos | Planejado |
| Implantação de previsão de ação | Pesquisa / trilha para parceiros comerciais |
Essa distinção é especialmente importante para usuários familiarizados com o FLUX.2 Max. O FLUX.2 permanece como opção dedicada atual para geração de imagens estáticas, enquanto o produto público FLUX 3 é centrado em vídeo e áudio.
Desempenho do FLUX 3 em benchmarks
Agora há dois tipos úteis de evidência de benchmark para o FLUX 3: a avaliação interna pós‑lançamento da BFL e a avaliação independente de terceiros. A primeira mostra preferência humana relativa sob o protocolo da BFL; a segunda verifica se essas forças permanecem visíveis em um benchmark projetado separadamente.
Avaliação ELO pós‑lançamento da BFL
O anúncio inicial de julho incluiu taxas de vitória preliminares. O benchmark mais relevante para usuários atuais é a avaliação do modelo lançado pela BFL em 4 de agosto. A Black Forest Labs relata um ELO de texto‑para‑vídeo de 1135 em sua avaliação interna all‑vs‑all.

Avaliação ELO do modelo lançado do FLUX 3 - fonte oficial da imagem: Black Forest Labs
| Métrica | Avaliação do modelo lançado pela BFL |
|---|---|
| ELO de texto para vídeo | 1135 |
| Posição em T2V | Maior pontuação no grupo testado pela BFL |
| Resultado de imagem para vídeo | Empatou com o concorrente mais forte testado e superou os demais modelos avaliados |
| Tipo de avaliação | Avaliação interna de preferência humana |
| Estágio do modelo | Lançamento do FLUX 3 Video disponível publicamente |
Esta é uma evidência mais forte do que o benchmark preliminar de lançamento porque avalia o modelo de agosto lançado. Ainda é um benchmark conduzido pelo fornecedor e não deve ser interpretado como prova de que o FLUX 3 superará todos os concorrentes em todas as categorias de prompts.
Benchmark independente do FLUX 3
O v-benchmark v2 da Megaton fornece uma verificação independente. O FLUX 3 foi avaliado em agosto de 2026 e atualmente registra um Índice Megaton de 76,51/100, ocupando a posição nº 3 no conjunto publicado na época da avaliação.
| Dimensão do benchmark | Avaliação da Megaton para o FLUX 3 |
|---|---|
| Índice Megaton | 76,51 |
| Aderência ao prompt | 87,07 |
| Consistência de cena | 94,76 |
| Física | 70,63 |
| Fidelidade humana | 73,70 |
| Fidelidade de objetos e produtos | 83,82 |
| Coerência causal e semântica | 80,91 |
| Fidelidade de texto | 82,41 |
| Cinematografia | 71,43 |
| Gosto e direção de arte | 65,00 |
O perfil é mais informativo do que a pontuação geral. Consistência de cena, com 94,76, é a categoria principal mais forte, enquanto aderência ao prompt, fidelidade de objetos, coerência causal e fidelidade de texto também superam 80. Física, fidelidade humana e gosto/direção de arte são mais fracos, mostrando que uma representação temporal mais forte não elimina movimento sintético ou variação de qualidade artística.
Isso também explica por que conclusões de benchmark podem divergir: o teste interno de preferência da BFL coloca o FLUX 3 no topo de seu conjunto de comparação, enquanto o ranking independente da Megaton o coloca em terceiro. Prompts diferentes, dimensões de pontuação, populações de avaliadores e métodos de agregação podem produzir classificações diferentes.
FLUX 3 vs Seedance 2.5 vs MiniMax H3 vs Wan 3.0
O mercado de vídeo com IA avançou rapidamente em 2026. O FLUX 3 agora compete com sistemas multimodais que combinam cada vez mais geração de longa duração, áudio sincronizado, referências e edição.
| Dimensão | FLUX 3 | Seedance 2.5 | MiniMax H3 | Wan 3.0 |
|---|---|---|---|---|
| Desenvolvedor | Black Forest Labs | ByteDance Seed | MiniMax | Alibaba |
| Duração máxima anunciada do clipe | 20 s | 30 s | 15 s | 30 s |
| Resolução de vídeo | HD / FHD / QHD (2K) / UHD (4K) | Dependente do nível da API | Até 2K | Até 1080p |
| Áudio nativo | Sim | Sim | Sim, estéreo | Sim |
| Texto para vídeo | Sim | Sim | Sim | Sim |
| Entrada de imagem/referência | Sim | Sim | Sim | Sim |
| Controle por quadros‑chave/referências | Quadros‑chave temporizados robustos | Controle multimodal por referências robusto | Condicionamento multimodal | Controle multimodal por referências |
| Continuação/edição de vídeo | Continuação disponível | Fluxo de trabalho orientado à edição | Foco em geração “omni” | Fluxos de edição e referência |
| Geração com múltiplas tomadas | Sim | Sim | Sim | Sim |
| Força distintiva | Arquitetura de modelo de realidade, consistência de cena, Self-Flow | Narrativa longa e controle por referências | Geração audiovisual em 2K e contexto omnimodal | Clipes longos e menor custo inicial |
| Preço inicial/unidade da CometAPI* | US$ 0,136/s | US$ 0,0824/s listado | US$ 0,064/s | US$ 0,040/s |
* A precificação é apenas uma comparação aproximada. As APIs de vídeo usam diferentes resoluções, durações, níveis de qualidade e regras de cobrança; assim, o valor mais baixo por segundo não é necessariamente o mais barato para um resultado de qualidade equivalente.
FLUX 3 vs Seedance 2.5
O Seedance 2.5 tem uma vantagem óbvia de duração, com geração de até 30 segundos em comparação com 20 segundos do FLUX 3. Também é fortemente orientado para geração baseada em referências, edição e narrativa longa. O FLUX 3 se diferencia por meio de sua arquitetura de modelo de mundo, consistência de cena, geração audiovisual nativa, quadros‑chave temporizados e um roteiro mais amplo de imagem/ação.
Testes independentes reforçam que esta é uma competição genuinamente de alto nível: a Megaton atualmente coloca o Seedance 2.5 acima do FLUX 3 no geral.
FLUX 3 vs MiniMax H3
O MiniMax H3 oferece saída de até 2K e áudio estéreo nativo, oferecendo uma especificação técnica forte para conteúdo audiovisual. O FLUX 3 suporta uma janela de geração mais longa — 20 segundos versus 15 segundos do H3 — e seu Modo Rascunho fornece um fluxo de iteração com controle de custos.
FLUX 3 vs Wan 3.0
O Wan 3.0 enfatiza entradas multimodais amplas, geração audiovisual, edição e clipes de até 30 segundos. Também é mais barato no preço inicial listado pela CometAPI. O FLUX 3 é mais caro, mas se diferencia por seu posicionamento como modelo de realidade, consistência de cena, base de pesquisa Self-Flow, Modo Rascunho e integração com previsão de ação.
Preços do FLUX 3
A Black Forest Labs cobra o FLUX 3 pela duração do vídeo gerado.
| Modo | Preços oficiais do FLUX 3 pela BFL |
|---|---|
| T2V / I2V Rascunho HD | US$ 0,06/s |
| T2V / I2V HD | US$ 0,17/s |
| T2V / I2V FHD | US$ 0,29/s |
| T2V / I2V QHD (2K) | US$ 0,40/s |
| T2V / I2V UHD (4K) | US$ 0,80/s |
| Continuação de vídeo Rascunho | US$ 0,12/s |
| Continuação de vídeo HD | US$ 0,41/s |
| Continuação de vídeo FHD | US$ 0,53/s |
| Continuação de vídeo QHD (2K) | US$ 0,65/s |
| Continuação de vídeo UHD (4K) | US$ 0,95/s |
Uma geração HD padrão de 10 segundos custa, portanto, aproximadamente US$ 1,70 na taxa listada pela BFL, enquanto uma geração FHD de 10 segundos custa aproximadamente US$ 2,90. A continuação de vídeo é substancialmente mais cara do que a geração comum, portanto, aplicações que estendem clipes com frequência devem modelar esses custos separadamente.
Preço do FLUX 3 na CometAPI
A CometAPI atualmente lista o FLUX 3 como disponível com ID de modelo flux-3.
| Resolução | Preços do FLUX 3 na CometAPI |
|---|---|
| 720p | US$ 0,136/s |
| 1080p | US$ 0,232/s |
Para uma geração de 10 segundos, isso corresponde a aproximadamente US$ 1,36 em 720p ou US$ 2,32 em 1080p. Em comparação com as taxas listadas pela BFL de US$ 0,17/s e US$ 0,29/s, os preços padrão da CometAPI são cerca de 20% mais baixos nesses dois níveis.
Observação sobre disponibilidade: parte do texto descritivo mais antigo na CometAPI ainda reflete o período de Acesso Antecipado de julho. O cartão de modelo ao vivo, a seção de preços e o exemplo de API atuais listam o flux-3 como Available, com data de lançamento na CometAPI em 13 de agosto de 2026. Para decisões de integração, a API ao vivo e os campos de preço são mais relevantes do que o texto de disponibilidade antigo.
Por que o FLUX 3 é importante além de vídeo com IA
A parte mais incomum do FLUX 3 não é a geração de vídeo de 20 segundos. Vários concorrentes já conseguem gerar clipes igualmente longos ou mais longos. A aposta técnica maior é que uma representação de vídeo sólida pode se tornar base para outras formas de inteligência.
Da previsão de vídeo à previsão de ação
Sinais de controle de robôs são previsões temporais condicionadas a observações visuais, então a BFL usa a representação de vídeo do FLUX 3 como base para previsão de ação. Sua colaboração com a mimic robotics produziu o FLUX-mimic, no qual um decodificador de ação lê representações do modelo de vídeo em vez de treinar uma pilha de percepção totalmente independente.
A BFL relata que o backbone do FLUX-mimic pode rodar em menos de 80 ms em uma única RTX 5090, enquanto o sistema robótico completo atinge um ciclo de reação de aproximadamente 101 ms. A empresa também discutiu avaliação industrial com a Audi.
Isso não torna a API pública FLUX 3 Video uma API de robótica. Mostra, porém, por que a BFL investiu pesadamente em representação multimodal de vídeo em vez de tratar geração de vídeo como uma tarefa isolada de mídia.
Quais são os principais pontos fortes do FLUX 3?
- Consistência temporal e de cena. A pontuação de Consistência de Cena de 94,76 da Megaton é a categoria principal mais forte do modelo.
- Geração audiovisual nativa. Diálogo, efeitos, ambiência e visuais podem ser gerados juntos, em vez de agregados a partir de modelos separados.
- Forte aderência ao prompt. O resultado independente de Aderência ao Prompt de 87,07 sugere que os pontos fortes do modelo vão além do polimento visual.
- Controle por quadros‑chave. Até dez imagens podem participar dos fluxos atuais de imagem‑para‑vídeo, dando controle temporal explícito aos criadores.
- Fluxo de rascunho para final. O Modo Rascunho aborda um problema real de custo em vídeo com IA: muitas gerações são descartadas durante a iteração de prompts.
- Ampla variedade visual. A BFL posiciona o FLUX 3 como capaz de saídas cruas, naturais, cinematográficas, nostálgicas, lúdicas, estilizadas e incomuns, em vez de um estilo próprio fixo.
- Direção de pesquisa de modelo de mundo. Self-Flow e previsão de ação tornam o FLUX 3 relevante além da geração de mídia.
Quais são as limitações do FLUX 3?
- O roteiro multimodal completo ainda não foi entregue. Não se deve assumir que FLUX 3 Image e FLUX 3 Dev com pesos abertos estejam públicos apenas por causa do anúncio da família.
- 20 segundos já não é duração líder no setor. Alguns concorrentes de 2026 já suportam gerações de 30 segundos.
- Física não está resolvida. A Megaton atribui ao FLUX 3 uma pontuação de Física de 70,63, consideravelmente abaixo de sua consistência de cena.
- Fidelidade humana ainda pode melhorar. Uma pontuação independente de 73,70 significa que anatomia difícil e movimento humano realista ainda podem falhar.
- Continuação de vídeo é cara. O preço de continuação da BFL é substancialmente mais alto por segundo que a geração T2V/I2V comum.
- O benchmark competitivo de manchete da BFL é interno. Decisões de produção também devem incluir testes independentes usando prompts, tipos de tomada, idiomas e ativos de referência da própria aplicação.
Como usar o FLUX 3 com a CometAPI
A cobertura anterior do FLUX 3 da CometAPI explica a fase de Acesso Antecipado de julho, benchmarks preliminares e o plano de lançamento. Esta seção foca a integração de produção atual, preços e o fluxo de API funcional, para não repetir aquele passo a passo histórico. O modelo de produção FLUX 3 usa o ID de modelo flux-3.
Uma solicitação básica em 720p usa o endpoint /v1/videos:
Bash
curl --request POST "https://api.cometapi.com/v1/videos" \--header "Authorization: Bearer $COMETAPI_KEY" \ --form-string "model=flux-3" \ --form-string "prompt=A paper boat glides across a still pond in soft morning light" \ --form-string "seconds=5" \ --form-string "size=1280x720" |
|---|
O fluxo de vídeo é assíncrono. Após a solicitação inicial retornar um ID de tarefa, a aplicação verifica a tarefa até que a geração seja concluída e então recupera o vídeo resultante. Para aplicações de produção, a geração deve normalmente ser tratada por um job em background ou fila de tarefas, em vez de manter uma requisição HTTP aberta por todo o tempo de renderização.
Quem deve usar o FLUX 3?
O FLUX 3 é particularmente atraente para aplicações que precisam de mais do que clipes visualmente bonitos de cinco segundos: sistemas de publicidade com visuais e áudio sincronizados, produção automatizada de formatos curtos, demonstrações de produto em que persistência de objetos importa, geração de diálogos multilíngues, fluxos de storyboard‑para‑vídeo, animação controlada por quadros‑chave, conteúdo educacional e experimentos com pipelines multimodais mais longos.
Pode ser menos atraente quando o único requisito é o menor custo possível por segundo, quando é necessário gerar mais de 20 segundos em uma única passada ou quando a geração de imagens estáticas é a tarefa principal. Para imagens estáticas, um modelo de imagem FLUX existente como o FLUX.2 Max pode ser atualmente uma opção melhor.
O FLUX 3 é melhor que outros modelos de vídeo com IA?
Não há uma resposta única defensável para todos os casos de uso. A avaliação interna da BFL coloca o FLUX 3 lançado no topo de sua comparação de texto‑para‑vídeo, enquanto a avaliação independente da Megaton coloca o FLUX 3 em terceiro no geral, atrás de concorrentes mais novos. Ambos os resultados podem ser válidos porque os testes medem distribuições de prompts e dimensões de qualidade diferentes.
O FLUX 3 parece particularmente forte quando consistência de cena, seguimento de prompt, fidelidade de objetos, coerência causal, renderização de texto, som sincronizado e quadros‑chave controláveis importam. Outros modelos podem vencer em duração máxima, resolução, preferências artísticas, fidelidade humana, fluxos de edição ou custo. Para desenvolvedores, a comparação correta é específica da carga de trabalho, e não do ranking de leaderboard.
Perguntas frequentes
O FLUX 3 está disponível agora?
Sim. O FLUX 3 Video tornou‑se disponível publicamente pela BFL em 4 de agosto de 2026. A CometAPI também lista o FLUX 3 como Available sob o ID de modelo flux-3. O lançamento de imagem estática do FLUX 3 e os pesos abertos do FLUX 3 Dev permanecem como itens separados do roteiro.
O FLUX 3 gera áudio?
Sim. O FLUX 3 Video gera áudio nativo sincronizado, incluindo diálogo, som ambiente e efeitos. Diálogo multilíngue e sincronização labial também são suportados.
Qual é a duração máxima dos vídeos do FLUX 3?
A geração atual de texto‑para‑vídeo e imagem‑para‑vídeo suporta 5–20 segundos. A continuação de vídeo suporta 5–15 segundos de conteúdo recém‑gerado.
Qual resolução o FLUX 3 suporta?
A BFL suporta HD (até 1 megapixel por quadro), FHD (até 2 MP), QHD/2K (até 4 MP) e UHD/4K (até 8 MP). Uma saída FHD 16:9 é 1920 × 1088. As faixas de resolução são baseadas no total de pixels por quadro e não na proporção; o Modo Rascunho é apenas HD.
O FLUX 3 suporta imagem para vídeo?
Sim. Imagem‑para‑vídeo e geração por quadros‑chave fazem parte do conjunto de recursos do FLUX 3 Video disponível publicamente.
O FLUX 3 é um modelo de geração de imagens?
Do ponto de vista arquitetural, o FLUX 3 é treinado em imagens, vídeo e áudio, e a BFL demonstrou pesquisa em geração e edição de imagens. No entanto, o produto FLUX 3 Image permanece um lançamento futuro; não confunda o roteiro da família com a API pública atual FLUX 3 Video.
O FLUX 3 é open source?
Atualmente, não. A BFL anunciou o FLUX 3 Dev, uma variante multimodal com pesos abertos, mas ainda não forneceu uma data pública de lançamento.
Quanto custa o FLUX 3?
A BFL precifica texto/imagem‑para‑vídeo em US$ 0,06/s para Rascunho HD, US$ 0,17/s para HD, US$ 0,29/s para FHD, US$ 0,40/s para QHD e US$ 0,80/s para UHD. Vídeo‑para‑vídeo custa US$ 0,12/s para Rascunho HD, depois US$ 0,41/s para HD, US$ 0,53/s para FHD, US$ 0,65/s para QHD e US$ 0,95/s para UHD. A CometAPI atualmente lista US$ 0,136/s para 720p e US$ 0,232/s para 1080p.
O que é Self-Flow?
Self-Flow é a abordagem de ajuste de fluxo auto‑supervisionada da BFL. Ela é projetada para permitir que um modelo generativo desenvolva representações internas úteis sem depender de um modelo de representação externo. Seu uso de diferentes níveis de ruído entre tokens incentiva a rede a inferir informação ausente e a aprender relações entre observações multimodais.
O FLUX 3 é um modelo de mundo?
A Black Forest Labs posiciona o FLUX 3 como uma base de modelo de realidade porque suas representações compartilhadas se estendem da previsão audiovisual para a previsão de ação física. Chamá‑lo de um modelo de mundo geral e completo seria mais forte do que as evidências atualmente suportam; uma descrição mais precisa é um modelo fundamental multimodal explicitamente projetado em torno de objetivos de modelagem de mundo.
Conclusão
O FLUX 3 representa uma mudança maior para a Black Forest Labs do que uma atualização convencional de um modelo de imagem FLUX para outro. Sua ideia‑chave é treinar uma representação multimodal compartilhada do mundo e, em seguida, usar essa representação para vídeo, som, imagens e, eventualmente, ações. O Self-Flow fornece a base de pesquisa, enquanto o FLUX 3 Video lançado é a primeira demonstração de produção dessa estratégia.
Em setembro de 2026, o FLUX 3 Video suporta clipes de até 20 segundos, 24 fps, saída de HD a UHD/4K, áudio sincronizado, diálogo multilíngue, imagem‑para‑vídeo, quadros‑chave, continuação de vídeo, geração com múltiplas tomadas e Modo Rascunho.
O panorama de benchmarks também é mais crível do que no lançamento. A avaliação atual do modelo lançado pela BFL coloca o FLUX 3 em primeiro em seu teste interno de ELO para texto‑para‑vídeo, enquanto o teste independente da Megaton o classifica em terceiro no geral e destaca consistência de cena particularmente forte.
FLUX 3 portanto não é automaticamente o melhor modelo de vídeo para toda carga de trabalho. Seedance 2.5, MiniMax H3 e Wan 3.0 podem oferecer geração mais longa, resolução nominal mais alta, preços mais baixos ou diferentes capacidades de referência e edição.
O que torna o FLUX 3 particularmente interessante é a direção subjacente ao gerador de vídeo: a BFL aposta que as mesmas representações necessárias para prever vídeo convincente podem, eventualmente, dar suporte a geração de imagens, áudio, raciocínio físico e ações robóticas. Desenvolvedores já podem testar o primeiro passo em produção por meio do FLUX 3 na CometAPI usando o ID de modelo flux-3.
