Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
ai-model/CometAPI-forskning

Hva er FLUX 3? Spesifikasjoner, ytelsesmålinger, funksjoner, priser og API-tilgang

Utforsk Black Forest Labs’ multimodale KI-modell, inkludert FLUX 3-spesifikasjoner, benchmark-resultater, funksjoner, priser, Self-Flow-arkitektur, konkurrenter og API-tilgang.

CometAPI
Deon GoodwinForskerteam for AI-modeller og API
Oppdatert Oct 3, 2026 18 min lesetid
Hva er FLUX 3? Spesifikasjoner, ytelsesmålinger, funksjoner, priser og API-tilgang
Bruk dette mønsteret

Gjør det første API-kallet.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

Kort oppsummert: FLUX 3 er Black Forest Labs’ enhetlige multimodale grunnmodell. Den offentlig tilgjengelige Video-API-en genererer klipp på opptil 20 sekunder ved 24 fps, med valgfri synkronisert lyd, fra tekst, bilder, nøkkelbilder eller eksisterende video. Den støtter oppløsninger fra HD til UHD/4K, mens FLUX 3 Image og den åpne modellen FLUX 3 Dev fortsatt lanseres separat.

Hva er FLUX 3?

FLUX 3 er en frontlinjemodell innen multimodalitet fra Black Forest Labs. I stedet for å trene én modell for bilder, en annen for video og en tredje for lyd, trener BFL en delt representasjon på tvers av disse modalitetene.

Kjerneideen er at bilder, video og lyd er ulike observasjoner av den samme underliggende verden. En bil i bevegelse har visuell fremtoning, bevegelse, lyd, romlige relasjoner, materialegenskaper og kausal atferd. Å lære disse signalene sammen gir modellen flere begrensninger enn å lære enkeltbilder alene.

Derfor beskriver Black Forest Labs FLUX 3 som et skritt mot en realitetsmodell eller verdensmodell snarere enn bare en bilde- eller videogenerator. Den utgitte videosystemet viser allerede den retningen: synkronisert lyd, bevegelse, scenestruktur, dialog, kameraføring og miljølyd håndteres i én generasjonsflyt.

Ikke alle annonserte FLUX 3-kapasiteter er offentlig tilgjengelige ennå. Per september 2026 er FLUX 3 Video tilgjengelig, mens FLUX 3 Image og den åpne FLUX 3 Dev-modellen fortsatt lanseres separat.

FLUX 3 – spesifikasjoner i kortform

Følgende spesifikasjoner speiler dagens FLUX 3-utviklerdokumentasjon snarere enn den foreløpige konfigurasjonen fra juli.

SpesifikasjonOffisiell FLUX 3-dokumentasjon
UtviklerBlack Forest Labs
ModellslektFLUX 3
ModelltypeEnhetlig multimodal grunnmodell / generativ videomodell
Offentlig videoutgivelse4. august 2026
Kjerne-treningsretningFelles læring av representasjoner for bilde, video og lyd
ForskningsfundamentSelf-Flow
Nåværende primær API-utdataVideo med synkronisert lyd
Tekst-til-videoStøttet
Bilde-til-videoStøttet
Nøkkelbilder-til-videoStøttet
VideofortsettelseStøttet
Maks T2V/I2V-varighet20 sekunder
Varighet for videofortsettelse5–15 sekunder
Bildfrekvens24 fps
OppløsningHD, FHD, QHD/2K og UHD/4K
FHD 16:9-oppløsning1920 × 1088
BildereferanserOpptil 10 for I2V/nøkkelbilde-arbeidsflyter
Naturlig lydJa
Flerspråklig dialogJa
Leppe-synkroniseringJa
Multiscene-genereringJa
Draft ModeJa
Offentlig stillbilde-endepunktIkke allment utgitt av BFL ennå
Åpne vekter FLUX 3 DevPlanlagt

Gjeldende BFL-dokumentasjon angir 5–20 sekunder for tekst-til-video og bilde-til-video, mens videofortsettelse aksepterer et generasjonsvindu på 5–15 sekunder. Støttede sideforhold inkluderer 21:9, 2:1, 16:9, 4:3, 1:1, 3:4 og 9:16.

Hvordan fungerer FLUX 3?

Self-Flow

Det viktigste forskningsfundamentet er Self-Flow, BFLs selvtilsynsbaserte flow-matching-tilnærming. Tradisjonelle generative treningsrør ofte bygger på separate forhåndstrente representasjonsmodeller eller hjelpemål. Self-Flow er utformet for å lære nyttige representasjoner direkte fra det generative målet.

En sentral mekanisme er Dual-Timestep Scheduling. Ulike grupper av tokens kan tildeles forskjellige støynivåer under trening. Dette skaper informasjonsasymmetri: noen deler av input inneholder mer brukbar informasjon enn andre, noe som tvinger nettverket til å bygge representasjoner som hjelper å inferere det som mangler.

I praksis oppmuntres FLUX 3 til å lære relasjoner mellom objekter, bilder, bevegelse, lyd og tidslige hendelser i stedet for bare å memorere hvordan enkeltbilder skal se ut.

Hva er FLUX 3? Spesifikasjoner, ytelsesmålinger, funksjoner, priser og API-tilgang

Self-Flow-metodens arkitektur – offisiell bildkilde: Black Forest Labs Self-Flow-prosjekt

BFL testet også felles multimodal trening med en FLUX.2-avledet ryggrad på millioner av videoer og hundrevis av millioner bilder. Eksperimentene støtter den bredere FLUX 3-hypotesen om at representasjonslæring og generasjon ikke behøver å være separate systemer.

Hvorfor video er sentralt i FLUX 3

Video er særlig verdifull for verdensmodellering fordi den inneholder informasjon som et stillbilde ikke kan gi. Et enkelt bilde kan vise en ball over gulvet; en video kan avdekke at ballen faller, spretter, deformeres ved støt, lager lyd og endrer retning etterpå.

BFL opplyste at videoprediksjon står for mer enn 95 % av FLUX 3s treningsberegning. Lyd er relativt rimelig fordi det er et langt lavere-dimensjonalt signal som er tett koblet til synlige hendelser. Den fordelingen bidrar til å forklare hvorfor video er den første FLUX 3-kapasiteten som når generell tilgjengelighet.

Hva kan FLUX 3 gjøre?

Tekst-til-video

Brukere kan generere en komplett video fra instruksjoner i naturlig språk. BFL sier at den utgitte modellen håndterer både enkle og komplekse prompt, samtidig som den koordinerer bevegelse, scenelogikk, visuell komposisjon og lyd. Dette er spesielt nyttig for prompt som inneholder flere sekvensielle hendelser snarere enn ett enkelt animert motiv.

Bilde-til-video og nøkkelbilder

FLUX 3 kan animere et startbilde, jobbe mot et sluttbilde, eller bruke flere bilder som tidsbestemte nøkkelbilder. Den nåværende API-en støtter opptil ti bildereferanser i bilde-til-video-arbeidsflyter, slik at skapere kan styre hvordan en scene endres over tid fremfor å la modellen improvisere hele sekvensen.

Videofortsettelse

En eksisterende video og dens lyd kan gis som kontekst, og FLUX 3 kan generere hva som skjer videre. BFL beskriver fortsettelse som bevarer bevegelse, kameraføring, dialog og lyd over overgangen, noe som er vesentlig annerledes enn å generere et andre, uavhengig klipp og sammenføye filene i etterkant.

Naturlig lyd og dialog

FLUX 3 produserer lyd ved genereringstid i stedet for å kreve en separat tale- eller lydgenereringspass. De utgitte lydkapasitetene inkluderer dialog, lydeffekter og omgivelseslyd. Flerspråklig dialog med leppesynkronisering støttes også.

Flere scener i én generering

Én prompt kan inneholde flere scener eller kameravinkler. Dette er viktig fordi mange tidligere videomodeller er sterkest når de bes om én kort, visuelt sammenhengende scene; FLUX 3 er eksplisitt utformet for å støtte multiscene-sekvenser i én generering.

Draft Mode

Draft Mode er et av de mer praktiske tilskuddene for høyvolums videoproduksjon. I stedet for å betale full pris for hvert prompteksperiment, kan utviklere lage en raskere, rimeligere forhåndsvisning og deretter forbedre den valgte utkastet, samtidig som valgt komposisjon og bevegelse bevares. Ifølge dagens BFL-priser koster et standard T2V/I2V-utkast $0,06 per sekund, mot $0,17 per sekund for vanlig HD-generering.

Hva er ikke lansert ennå?

FLUX 3s lanseringskunngjøring beskrev bilde-, video-, lyd- og handlingskapasiteter under én arkitektonisk retning, men tilgjengeligheten rulles ut trinnvis.

KapasitetDagens BFL veikart og tilgjengelighet
FLUX 3 videogenereringGenerelt tilgjengelig
Naturlig video-lydGenerelt tilgjengelig
Tekst-til-videoGenerelt tilgjengelig
Bilde-til-video / nøkkelbilderGenerelt tilgjengelig
VideofortsettelseGenerelt tilgjengelig
Rikere kombinasjoner av bilde-/video-/lydreferanserPlanlagt utvidelse
FLUX 3 bildelaging og redigeringKommer
FLUX 3 Dev åpne vekterPlanlagt
Handlingsprediksjon i driftForskning / kommersielt partnerløp

Dette skillet er særlig viktig for brukere kjent med FLUX.2 Max. FLUX.2 er fortsatt et aktuelt, dedikert alternativ for stillbildegenerering, mens det offentlige FLUX 3-produktet er sentrert rundt video og lyd.

FLUX 3 – benchmarkytelse

Det finnes nå to nyttige typer bevis for FLUX 3-benchmarks: BFLs interne evaluering etter utgivelse og uavhengig tredjeparts evaluering. Den første viser relativ menneskelig preferanse under BFLs protokoll; den andre sjekker om disse styrkene er synlige under en separat utformet benchmark.

BFLs ELO-evaluering etter utgivelse

Den første kunngjøringen i juli inkluderte foreløpige vinnerandeler. Den mer relevante benchmarken for nåværende brukere er BFLs 4. august evaluering av den utgitte modellen. Black Forest Labs rapporterer en tekst-til-video ELO-score på 1135 i deres interne all-vs-all-evaluering.

Hva er FLUX 3? Spesifikasjoner, ytelsesmålinger, funksjoner, priser og API-tilgang

FLUX 3 – ELO-evaluering av utgitt modell – offisiell bildkilde: Black Forest Labs

MetrikkBFLs evaluering av utgitt modell
Tekst-til-video ELO1135
T2V-posisjonHøyeste score i BFLs testede gruppe
Bilde-til-video-resultatDelt sterkeste testede konkurrent og slo de øvrige evaluerte modellene
EvalueringstypeIntern menneskelig-preferansevaluering
ModellstadiumGenerelt tilgjengelig FLUX 3 Video-utgivelse

Dette er sterkere bevis enn den foreløpige lanseringsbenchmarken fordi den evaluerer den utgitte augustmodellen. Det er fortsatt en leverandørstyrt benchmark, og bør ikke tolkes som bevis for at FLUX 3 vil overgå enhver konkurrent på alle promptkategorier.

Uavhengig FLUX 3-benchmark

Megatons v-benchmark v2 gir en uavhengig kontroll. FLUX 3 ble evaluert i august 2026 og ligger for tiden på en Megaton-indeks på 76,51/100, rangert som nr. 3 i den publiserte settet på evalueringstidspunktet.

Benchmark-dimensjonMegaton FLUX 3-evaluering
Megaton-indeks76,51
Prompt-etterlevelse87,07
Scenekonsistens94,76
Fysikk70,63
Menneskelig troverdighet73,70
Objekt- og produkttroverdighet83,82
Kausal og semantisk sammenheng80,91
Teksttroverdighet82,41
Kinematografi71,43
Smak og kunstnerisk retning65,00

Profilen er mer informativ enn totalscoren. Scenekonsistens på 94,76 er den sterkeste hovedkategorien, mens prompt-etterlevelse, objekt-troverdighet, kausal sammenheng og teksttroverdighet også overstiger 80. Fysikk, menneskelig troverdighet og smak/kunstnerisk retning er svakere, noe som viser at sterkere tidslig representasjon ikke eliminerer syntetisk bevegelse eller variasjon i kunstnerisk kvalitet.

Dette forklarer også hvorfor benchmarkkonklusjoner kan variere: BFLs interne preferansetest plasserer FLUX 3 øverst i deres sammenligningssett, mens Megatons uavhengige leaderboard plasserer den som nummer tre. Ulike prompt, scoringsdimensjoner, evalueringspopulasjoner og aggregeringsmetoder kan gi ulike rangeringer.

FLUX 3 vs Seedance 2.5 vs MiniMax H3 vs Wan 3.0

Markedet for AI-video beveget seg raskt i 2026. FLUX 3 konkurrerer nå med multimodale systemer som i økende grad kombinerer lengre generering, synkronisert lyd, referanser og redigering.

DimensjonFLUX 3Seedance 2.5MiniMax H3Wan 3.0
UtviklerBlack Forest LabsByteDance SeedMiniMaxAlibaba
Maks annonsert klipp20 s30 s15 s30 s
VideooppløsningHD / FHD / QHD (2K) / UHD (4K)Avhenger av API-nivåOpptil 2KOpptil 1080p
Naturlig lydJaJaJa, stereoJa
Tekst-til-videoJaJaJaJa
Bilde-/referanseinputJaJaJaJa
Nøkkelbilde-/referansestyringSterke tidsbestemte nøkkelbilderSterk multimodal referansestyringMultimodal kondisjoneringMultimodal referansestyring
Videofortsettelse/redigeringFortsettelse tilgjengeligRedigeringsorientert arbeidsflytOmni-genereringsfokusRedigering og referansearbeidsflyter
SærpregRealitetsmodell-arkitektur, scenekonsistens, Self-FlowLangformfortelling og referansestyring2K audiovisuell generasjon og omni-modal kontekstLange klipp og lavere startkostnad
CometAPI start-/enhetspris*$0,136/sOppført $0,0824/s$0,064/s$0,040/s

* Prisene er kun en grov sammenligning. Video-API-er bruker ulike oppløsninger, varigheter, kvalitetstrinn og faktureringsregler, så den laveste per-sekund-prisen er ikke nødvendigvis billigst i tilsvarende kvalitet.

FLUX 3 vs Seedance 2.5

Seedance 2.5 har en åpenbar varighetsfordel, med opptil 30 sekunders generering sammenlignet med FLUX 3s 20 sekunder. Den er også sterkt orientert mot referansedrevet generering, redigering og langformfortelling. FLUX 3 skiller seg gjennom sin delte verdensmodell-arkitektur, scenekonsistens, naturlig audiovisuell generering, tidsbestemte nøkkelbilder og en bredere bilde-/handlingsvei.

Uavhengig testing understreker at dette er en reell high-end-konkurranse: Megaton plasserer Seedance 2.5 foran FLUX 3 samlet sett.

FLUX 3 vs MiniMax H3

MiniMax H3 tilbyr opptil 2K utdata og naturlig stereo-lyd, noe som gir en sterk teknisk spesifikasjon for audiovisuelt innhold. FLUX 3 støtter et lengre maksimalt generasjonsvindu – 20 sekunder mot H3s 15 – og Draft Mode gir en kostnadskontrollert iterasjonsarbeidsflyt.

FLUX 3 vs Wan 3.0

Wan 3.0 vektlegger bred multimodal input, audiovisuell generering, redigering og klipp på opptil 30 sekunder. Den er også billigere på CometAPIs oppførte startpris. FLUX 3 er dyrere, men skiller seg gjennom sin realitetsmodell-posisjonering, scenekonsistens, Self-Flow-forskningsfundament, Draft Mode og integrasjon med handlingsprediksjon.

FLUX 3-priser

Black Forest Labs priser FLUX 3 etter generert videovarighet.

ModusOffisiell BFL FLUX 3-prising
T2V / I2V Draft HD$0,06/s
T2V / I2V HD$0,17/s
T2V / I2V FHD$0,29/s
T2V / I2V QHD (2K)$0,40/s
T2V / I2V UHD (4K)$0,80/s
Videofortsettelse Draft$0,12/s
Videofortsettelse HD$0,41/s
Videofortsettelse FHD$0,53/s
Videofortsettelse QHD (2K)$0,65/s
Videofortsettelse UHD (4K)$0,95/s

En standard 10-sekunders HD-generering koster derfor omtrent $1,70 etter BFLs oppførte sats, mens en 10-sekunders FHD-generering koster omtrent $2,90. Videofortsettelse er vesentlig dyrere enn ordinær generering, så applikasjoner som ofte forlenger klipp bør modellere disse kostnadene separat.

FLUX 3-pris på CometAPI

CometAPI lister for tiden FLUX 3 som tilgjengelig med modell-ID flux-3.

OppløsningCometAPI FLUX 3-prising
720p$0,136/s
1080p$0,232/s

For en 10-sekunders generering tilsvarer det omtrent $1,36 ved 720p eller $2,32 ved 1080p. Sammenlignet med BFLs oppførte satser på $0,17/s og $0,29/s, er CometAPIs standardpriser omtrent 20 % lavere for disse to nivåene.

Tilgjengelighetsnotis: noe eldre beskrivende tekst på CometAPI reflekterer fortsatt Early Access-perioden i juli. Den nåværende live-modellkortet, prisseksjonen og API-eksempelet lister flux-3 som Available, med CometAPI-utgivelsesdato 13. august 2026. For integrasjonsbeslutninger er live-API-et og prisfeltene mer relevante enn den eldre tilgjengelighetsteksten.

Hvorfor FLUX 3 betyr mer enn AI-video

Det mest uvanlige med FLUX 3 er ikke 20-sekunders videogenerering. Flere konkurrenter kan allerede generere like lange eller lengre klipp. Den større tekniske satsingen er at en sterk videorepresentasjon kan bli et fundament for andre former for intelligens.

Fra videoprediksjon til handlingsprediksjon

Robotsignaler for kontroll er tidslige prediksjoner kondisjonert på visuelle observasjoner, så BFL bruker FLUX 3s videorepresentasjon som fundament for handlingsprediksjon. Samarbeidet med mimic robotics resulterte i FLUX-mimic, der en handlingsdekoder leser representasjoner fra videomodellen i stedet for å trene en helt egen persepsjonsstakk.

BFL rapporterer at FLUX-mimic-ryggraden kan kjøre på under 80 ms på ett RTX 5090-kort, mens det komplette robotsystemet oppnår en reaksjonssløyfe på omtrent 101 ms. Selskapet har også diskutert industriell evaluering med Audi.

Dette gjør ikke den offentlige FLUX 3 Video-API-en til en robotikk-API. Det demonstrerer hvorfor BFL investerte tungt i multimodal videorepresentasjon i stedet for å behandle videogenerering som en isolert medieoppgave.

FLUX 3s viktigste styrker

  • Tidslig og scenekonsistens. Megatons scenekonsistensscore på 94,76 er modellens sterkeste hovedkategori.
  • Naturlig audiovisuell generering. Dialog, effekter, ambience og visuelle elementer kan genereres sammen i stedet for å sys sammen fra separate modeller.
  • Sterk prompt-etterlevelse. Den uavhengige resultatet på 87,07 antyder at styrkene strekker seg utover ren visuell finish.
  • Nøkkelbildestyring. Opptil ti bilder kan inngå i dagens bilde-til-video-arbeidsflyter, som gir skapere eksplisitt tidskontroll.
  • Utkast-til-final-arbeidsflyt. Draft Mode adresserer et reelt kostnadsproblem i AI-video: mange genereringer kasseres under prompt-iterasjon.
  • Bredt visuelt spenn. BFL posisjonerer FLUX 3 som kapabel til rå, naturlige, filmatiske, nostalgiske, lekne, stiliserte og uvanlige utganger fremfor én fast husstil.
  • Verdensmodell-forskningsretning. Self-Flow og handlingsprediksjon gjør FLUX 3 relevant utover mediegenerering.

FLUX 3s begrensninger

  • Hele multimodal veikart er ikke levert. Offentlig FLUX 3 Image og FLUX 3 Dev åpne vekter må ikke antas fra familiespesifikasjonen.
  • 20 sekunder er ikke lenger bransjeledende varighet. Noen konkurrenter i 2026 støtter allerede 30-sekunders generering.
  • Fysikk er ikke løst. Megaton gir FLUX 3 en fysikkscore på 70,63, betydelig under scenekonsistensen.
  • Menneskelig troverdighet har fortsatt forbedringsrom. En uavhengig score på 73,70 betyr at vanskelig anatomi og realistisk menneskelig bevegelse fortsatt kan feile.
  • Videofortsettelse er kostbar. BFLs fortsettelsespris er betydelig høyere per sekund enn vanlig T2V/I2V.
  • BFLs fremste konkurransebenchmark er intern. Produksjonsbeslutninger bør også inkludere uavhengige tester med applikasjonens egne prompt, opptakstyper, språk og referanseaktiva.

Hvordan bruke FLUX 3 med CometAPI

CometAPIs tidligere omtale av FLUX 3 forklarer Early Access-fasen i juli, foreløpige benchmarks og planlagt utrulling. Denne seksjonen fokuserer på dagens produksjonsintegrasjon, prising og fungerende API-flyt, slik at den ikke gjentar den historiske gjennomgangen. Den FLUX 3 produksjonsmodellen bruker modell-ID-en flux-3.

En grunnleggende 720p-forespørsel bruker endepunktet /v1/videos:

Bash

curl --request POST "https://api.cometapi.com/v1/videos" \
--header "Authorization: Bearer $COMETAPI_KEY" \
--form-string "model=flux-3" \
--form-string "prompt=A paper boat glides across a still pond in soft morning light" \
--form-string "seconds=5" \
--form-string "size=1280x720"

Videoworkflowen er asynkron. Etter at den første forespørselen returnerer en oppgave-ID, sjekker applikasjonen oppgaven til genereringen er fullført og henter deretter den resulterende videoen. For produksjonsapplikasjoner bør generering normalt håndteres av en bakgrunnsjobb eller oppgavekø i stedet for å holde en HTTP-forespørsel åpen hele rendertiden.

Hvem bør bruke FLUX 3?

FLUX 3 er særlig overbevisende for applikasjoner som trenger mer enn visuelt attraktive femsekunders klipp: annonse-systemer med synkronisert bilde og lyd, automatisert kortformproduksjon, produktdemonstrasjoner der objektpersistens er viktig, flerspråklig dialoggenerering, storyboard-til-video-arbeidsflyter, nøkkelbildestyrt animasjon, opplæringsinnhold og eksperimenter med lengre multimodale rør.

Den kan være mindre attraktiv når kravet er lavest mulig kost per sekund, når mer enn 20 sekunder må genereres i én pass, eller når stillbildegenerering er den primære oppgaven. For stillbilder kan en eksisterende FLUX-bildemodell som FLUX.2 Max for tiden være et bedre valg.

Er FLUX 3 bedre enn andre AI-videomodeller?

Det finnes ikke ett eneste forsvarlig svar for alle brukstilfeller. BFLs interne evaluering plasserer den utgitte FLUX 3 øverst i sin tekst-til-video-sammenligning, mens uavhengig Megaton-evaluering plasserer FLUX 3 som nummer tre, bak nyere konkurrenter. Begge resultatene kan være gyldige fordi testene måler ulike promptfordelinger og kvalitetsdimensjoner.

FLUX 3 virker særlig sterk når scenekonsistens, promptfølge, objekt-troverdighet, kausal sammenheng, tekstrendering, synkronisert lyd og kontrollerbare nøkkelbilder betyr mye. Andre modeller kan vinne på maksimal varighet, oppløsning, kunstneriske preferanser, arbeidsflyter for redigering eller kost. For utviklere er riktig sammenligning arbeidslast-spesifikk snarere enn leaderboard-spesifikk.

Ofte stilte spørsmål

Er FLUX 3 tilgjengelig nå?

Ja. FLUX 3 Video ble generelt tilgjengelig via BFL 4. august 2026. CometAPI lister også FLUX 3 som Available under modell-ID-en flux-3. Stillbildeutgaven FLUX 3 og FLUX 3 Dev åpne vekter forblir separate veikart-elementer.

Kan FLUX 3 generere lyd?

Ja. FLUX 3 Video genererer synkronisert, naturlig lyd, inkludert dialog, omgivelseslyd og effekter. Flerspråklig dialog og leppe-synkronisering støttes også.

Hvor lange kan FLUX 3-videoer være?

Gjeldende tekst-til-video og bilde-til-video støtter 5–20 sekunder. Videofortsettelse støtter 5–15 sekunder med ny generert innhold.

Hvilken oppløsning støtter FLUX 3?

BFL støtter HD (opptil 1 megapiksel per bilde), FHD (opptil 2 MP), QHD/2K (opptil 4 MP) og UHD/4K (opptil 8 MP). En 16:9 FHD-utgang er 1920 × 1088. Oppløsningsbåndene baseres på totale piksler per bilde heller enn sideforhold; Draft Mode er kun HD.

Støtter FLUX 3 bilde-til-video?

Ja. Bilde-til-video og nøkkelbildelaging er del av den generelt tilgjengelige FLUX 3 Video-funksjonssettet.

Er FLUX 3 en bildemodell?

Arkitektonisk er FLUX 3 trent på tvers av bilder, video og lyd, og BFL har demonstrert forskning på bildegenerering og redigering. Imidlertid er produktet FLUX 3 Image fortsatt en kommende utgivelse; ikke forveksle familie-veikartet med den nåværende offentlige FLUX 3 Video-API-en.

Er FLUX 3 åpen kildekode?

Ikke nå. BFL har annonsert FLUX 3 Dev, en multimodal variant med åpne vekter, men har ennå ikke oppgitt en offentlig utgivelsesdato.

Hvor mye koster FLUX 3?

BFL priser tekst-/bilde-til-video til $0,06/s for Draft HD, $0,17/s for HD, $0,29/s for FHD, $0,40/s for QHD og $0,80/s for UHD. Video-til-video koster $0,12/s for Draft HD, deretter $0,41/s for HD, $0,53/s for FHD, $0,65/s for QHD og $0,95/s for UHD. CometAPI lister for tiden $0,136/s for 720p og $0,232/s for 1080p.

Hva er Self-Flow?

Self-Flow er BFLs selvtilsynsbaserte flow-matching-forskningsmetode. Den er utformet for å la en generativ modell utvikle nyttige interne representasjoner uten å være avhengig av en ekstern representasjonsmodell. Bruken av ulike støynivåer på tvers av tokens oppmuntrer nettverket til å inferere manglende informasjon og lære relasjoner mellom multimodale observasjoner.

Er FLUX 3 en verdensmodell?

Black Forest Labs posisjonerer FLUX 3 som et fundament for realitetsmodellering fordi delte representasjoner strekker seg fra audiovisuell prediksjon mot fysisk handlingsprediksjon. Å kalle den en komplett, generell verdensmodell ville være en sterkere påstand enn dagens bevis støtter; en mer presis beskrivelse er en multimodal generativ grunnmodell eksplisitt utformet rundt verdensmodell-mål.

Konklusjon

FLUX 3 representerer en større endring for Black Forest Labs enn en konvensjonell oppgradering fra én FLUX-bildemodell til en annen. Hovedideen er å trene en delt multimodal representasjon av verden, og deretter bruke den representasjonen for video, lyd, bilder og etter hvert handlinger. Self-Flow gir forskningsfundamentet, mens den utgitte FLUX 3 Video-modellen er den første produksjonsdemonstrasjonen av den strategien.

Per september 2026 støtter FLUX 3 Video klipp på opptil 20 sekunder, 24 fps, HD til UHD/4K-utgang, synkronisert lyd, flerspråklig dialog, bilde-til-video, nøkkelbilder, videofortsettelse, multiscene-generering og Draft Mode.

Benchmarkbildet er også mer troverdig enn ved lansering. BFLs nåværende evaluering av utgitt modell plasserer FLUX 3 først i deres interne T2V ELO-test, mens uavhengig Megaton-testing rangerer den som nummer tre totalt og fremhever særlig sterk scenekonsistens.

FLUX 3 er dermed ikke automatisk den beste videomodellen for enhver arbeidslast. Seedance 2.5, MiniMax H3, og Wan 3.0 kan tilby lengre generering, høyere nominell oppløsning, lavere prising eller andre referanse- og redigeringskapasiteter.

Det som gjør FLUX 3 uvanlig interessant, er retningen under selve videogeneratoren: BFL satser på at de samme representasjonene som kreves for å forutsi overbevisende video, til slutt kan støtte bildegenerering, lyd, fysisk resonnering og robotiske handlinger. Utviklere kan allerede teste det første produksjonstrinnet via FLUX 3 på CometAPI med modell-ID-en flux-3.

Fortsett å lære

Koble denne artikkelen til neste beslutning.

Se alle temaer
Publisert Oct 3, 2026
Sist oppdatert Oct 3, 2026
0 visninger
Gjennomgått for klarhet, kildeangivelse og gjeldende API-terminologi.

Les mer