Claude Haiku 5.5 and Nano Banana 2.1 are now live on CometAPI →
ai-model/CometAPI research

Hvad er FLUX 3? Specifikationer, benchmarks, funktioner, priser og API-adgang

Udforsk Black Forest Labs’ multimodale AI-model, herunder FLUX 3-specifikationer, benchmarkresultater, funktioner, priser, Self-Flow-arkitektur, konkurrenter og API-adgang.

CometAPI
Deon GoodwinForskningshold for AI-modeller og API
Opdateret Oct 3, 2026 18 min. læsning
Hvad er FLUX 3? Specifikationer, benchmarks, funktioner, priser og API-adgang
Brug dette mønster

Lav det første API-kald.

from openai import OpenAI

client = OpenAI(
    api_key="YOUR_COMETAPI_KEY",
    base_url="https://api.cometapi.com/v1",
)

response = client.chat.completions.create(
    model="gpt-5-mini",
    messages=[{"role": "user", "content": "Build this workflow."}],
)

print(response.choices[0].message.content)

TL;DR: FLUX 3 er Black Forest Labs’ samlede multimodale foundation-model. Dens offentligt tilgængelige Video API genererer klip på op til 20 sekunder ved 24 fps, med valgfri synkroniseret lyd, ud fra tekst, billeder, keyframes eller eksisterende video. Den understøtter opløsninger fra HD til UHD/4K, mens FLUX 3 Image og open-weight-modellen FLUX 3 Dev fortsat udrulles separat.

Hvad er FLUX 3?

FLUX 3 er en banebrydende multimodal model fra Black Forest Labs. I stedet for at træne én model til billeder, en anden til video og en tredje til lyd uafhængigt, træner BFL en delt repræsentation på tværs af disse modaliteter.

Den centrale idé er, at billeder, video og lyd er forskellige observationer af den samme underliggende verden. En bil i bevægelse har visuel fremtoning, bevægelse, lyd, rumlige relationer, materialegenskaber og kausal adfærd. At lære disse signaler sammen giver modellen flere begrænsninger end at lære individuelle frames alene.

Derfor beskriver Black Forest Labs FLUX 3 som et skridt mod en virkelighedsmodel eller verdensmodel snarere end blot en billed- eller videogenerator. Det udgivne videosystem viser allerede den retning: synkroniseret lyd, bevægelse, scenernes struktur, dialog, kameraføring og omgivelseslyde håndteres i én genereringsproces.

Ikke alle annoncerede FLUX 3-funktioner er offentligt tilgængelige endnu. Per september 2026 er FLUX 3 Video tilgængelig, mens FLUX 3 Image og open-weight-modellen FLUX 3 Dev stadig er separate udrulningspunkter.

FLUX 3-specifikationer i korte træk

Følgende specifikationer afspejler den aktuelle FLUX 3-udviklerdokumentation frem for den foreløbige konfiguration ved lanceringen i juli.

SpecifikationOfficiel FLUX 3-dokumentation
UdviklerBlack Forest Labs
ModelfamilieFLUX 3
ModeltypeSamlet multimodal foundation-/generativ videomodel
Offentlig videofrigivelse4. august 2026
Kernetilgang i træningFælles repræsentationslæring for billede, video og lyd
Forskningsmæssigt fundamentSelf-Flow
Nuværende primære API-outputVideo med synkroniseret lyd
Tekst-til-videoUnderstøttet
Billede-til-videoUnderstøttet
Keyframe-til-videoUnderstøttet
VideofortsættelseUnderstøttet
Maksimal T2V/I2V-varighed20 sekunder
Varighed for videofortsættelse5–15 sekunder
Billedhastighed24 fps
OpløsningHD, FHD, QHD/2K og UHD/4K
FHD 16:9-opløsning1920 × 1088
BilledreferencerOp til 10 for I2V/keyframe-workflows
Indbygget lydJa
Flersproget dialogJa
LippesynkroniseringJa
Multishot-genereringJa
Draft ModeJa
Offentligt FLUX 3-endpoint for stillbillederEndnu ikke generelt frigivet af BFL
Open-weight FLUX 3 DevPlanlagt

Den nuværende BFL-dokumentation angiver 5–20 sekunder for tekst-til-video og billede-til-video, mens videofortsættelse accepterer et genereringsvindue på 5–15 sekunder. Understøttede sideforhold omfatter 21:9, 2:1, 16:9, 4:3, 1:1, 3:4 og 9:16.

Hvordan fungerer FLUX 3?

Self-Flow

Det centrale forskningsfundament er Self-Flow, Black Forest Labs’ selvvejledte flow-matching-tilgang. Traditionelle generative træningspipelines er ofte afhængige af separate fortrænede repræsentationsmodeller eller supplerende supervision. Self-Flow er designet til at lære nyttige repræsentationer direkte fra den generative målsætning.

En central mekanisme er Dual-Timestep Scheduling. Forskellige grupper af tokens kan tildeles forskellige støjniveauer under træningen. Dette skaber informationsasymmetri: nogle dele af inputtet indeholder mere brugbar information end andre, hvilket tvinger netværket til at opbygge repræsentationer, der hjælper med at udlede det, der mangler.

I praksis tilskyndes FLUX 3 dermed til at lære relationer mellem objekter, frames, bevægelse, lyd og tidslige hændelser frem for blot at memorere, hvordan individuelle frames skal se ud.

Hvad er FLUX 3? Specifikationer, benchmarks, funktioner, priser og API-adgang

Self-Flow-metodens arkitektur – officiel billedkilde: Black Forest Labs’ Self-Flow-projekt

BFL testede også fælles multimodal træning med en FLUX.2-afledt backbone med millioner af videoer og hundredvis af millioner billeder. Eksperimenterne understøtter den bredere FLUX 3-hypotese om, at repræsentationslæring og generering ikke behøver at være separate systemer.

Hvorfor video er centralt for FLUX 3

Video er særligt værdifuldt for verdensmodellering, fordi den indeholder information, som et stillbillede ikke kan give. En enkelt frame kan vise en bold over gulvet; en video kan afsløre, at bolden falder, hopper, deformeres ved sammenstød, laver en lyd og ændrer retning bagefter.

BFL oplyste, at videoprædiktion udgør mere end 95 % af FLUX 3’s træningscompute. Lyd er relativt billig, fordi det er et langt lavere-dimensionelt signal, der er tæt koblet til synlige hændelser. Denne fordeling hjælper med at forklare, hvorfor video er den første FLUX 3-funktion, der når generel tilgængelighed.

Hvad kan FLUX 3?

Tekst-til-video

Brugere kan generere en komplet video fra naturlige sprog. BFL siger, at den udgivne model håndterer simple og komplekse prompts, mens den koordinerer bevægelse, scenelogik, visuel komposition og lyd. Dette er især nyttigt for prompts, der indeholder flere sekventielle begivenheder frem for et enkelt animeret motiv.

Billede-til-video og keyframes

FLUX 3 kan animere et startbillede, arbejde hen imod en slutframe eller bruge flere billeder som timede keyframes. Det nuværende API understøtter op til ti billedreferencer i billede-til-video-workflows, så skabere kan styre, hvordan en scene ændrer sig over tid, i stedet for at bede modellen improvisere hele sekvensen.

Videofortsættelse

En eksisterende video og dens lyd kan leveres som kontekst, og FLUX 3 kan generere, hvad der sker næste gang. BFL beskriver en fortsættelse, der bevarer bevægelse, kameraføring, dialog og lyd på tværs af overgangen, hvilket er væsentligt anderledes end at generere et andet uafhængigt klip og sammenføje begge filer bagefter.

Indbygget lyd og dialog

FLUX 3 producerer lyd under genereringen i stedet for at kræve en separat tale- eller lydgenereringsfase. De udgivne lydfunktioner omfatter dialog, lydeffekter og ambient lyd. Flersproget dialog med lippesynkronisering understøttes også.

Flere shots i én generering

En enkelt prompt kan indeholde flere scener eller kameravinkler. Dette er vigtigt, fordi mange tidligere videomodeller er stærkest, når de bliver bedt om ét kort, visuelt kontinuerligt shot; FLUX 3 er eksplicit designet til at understøtte multishot-sekvenser i én generering.

Draft Mode

Draft Mode er en af de mere praktiske tilføjelser til videogenerering i stor skala. I stedet for at betale fuld pris for hvert promteksperiment kan udviklere oprette en hurtigere, billigere forhåndsvisning og derefter forbedre den valgte kladde, mens den valgte komposition og bevægelse bevares. Ifølge aktuel BFL-prissætning koster en standard T2V/I2V-kladde $0.06 pr. sekund, mod $0.17 pr. sekund for almindelig HD-generering.

Hvad er endnu ikke lanceret?

FLUX 3’s lanceringsmeddelelse beskrev billede-, video-, lyd- og handlingsfunktioner under én arkitektonisk retning, men tilgængeligheden er forskudt.

FunktionAktuel BFL-roadmap og tilgængelighed
FLUX 3 videogenereringGenerelt tilgængelig
Indbygget video-lydGenerelt tilgængelig
Tekst-til-videoGenerelt tilgængelig
Billede-til-video / keyframesGenerelt tilgængelig
VideofortsættelseGenerelt tilgængelig
Rigere kombinationer af billede-/video-/lydreferencerPlanlagt udvidelse
FLUX 3 Image-generering og -redigeringKommende
FLUX 3 Dev open weightsPlanlagt
Handlingsprædiktion i produktionForskning / kommercielt partnerforløb

Denne sondring er især vigtig for brugere, der kender FLUX.2 Max. FLUX.2 er fortsat en aktuel dedikeret løsning til stillbilledgenerering, mens det offentlige FLUX 3-produkt er centreret om video og lyd.

FLUX 3 benchmarkresultater

Der findes nu to nyttige former for FLUX 3-benchmarks: BFL’s evaluering efter frigivelse og uafhængig tredjepartsevaluering. Den første viser relativ menneskelig præference under BFL’s protokol; den anden kontrollerer, om disse styrker forbliver synlige under et separat designet benchmark.

BFL ELO-evaluering efter frigivelse

Den første meddelelse i juli omfattede foreløbige sejrprocenter. Det mere relevante benchmark for nuværende brugere er BFL’s 4. august evaluering af den frigivne model. Black Forest Labs rapporterer en tekst-til-video ELO-score på 1135 i deres interne all-vs-all-evaluering.

Hvad er FLUX 3? Specifikationer, benchmarks, funktioner, priser og API-adgang

FLUX 3 ELO-evaluering af frigivet model – officiel billedkilde: Black Forest Labs

MåleparameterBFL-evaluering af frigivet model
Tekst-til-video ELO1135
T2V-positionHøjeste score i BFL’s testede gruppe
Billede-til-video-resultatDelt førsteplads med den stærkeste testede konkurrent og slog de øvrige modeller
EvalueringstypeIntern evaluering af menneskelig præference
ModelstadieGenerelt tilgængelig FLUX 3 Video-udgivelse

Dette er stærkere evidens end det foreløbige benchmark ved lanceringen, fordi det evaluerer den frigivne august-model. Det er stadig et leverandørkørt benchmark og bør ikke tolkes som bevis for, at FLUX 3 overgår enhver konkurrent i alle promptkategorier.

Uafhængigt FLUX 3-benchmark

Megatons v-benchmark v2 giver en uafhængig kontrol. FLUX 3 blev evalueret i august 2026 og har i øjeblikket en Megaton Index på 76,51/100, placeret som nr. 3 i det offentliggjorte sæt på tidspunktet for evalueringen.

Benchmark-dimensionMegaton FLUX 3-evaluering
Megaton Index76.51
Prompt-efterlevelse87.07
Scenekonsistens94.76
Fysik70.63
Menneskelig troværdighed73.70
Objekt- og produkttroværdighed83.82
Kausal og semantisk sammenhæng80.91
Teksttroværdighed82.41
Cinematografi71.43
Smag & art direction65.00

Profilen er mere informativ end den samlede score. Scenekonsistens på 94,76 er den stærkeste større kategori, mens prompt-efterlevelse, objekttroværdighed, kausal sammenhæng og teksttroværdighed også ligger over 80. Fysik, menneskelig troværdighed og smag/art direction er svagere og viser, at stærkere tidslig repræsentation ikke eliminerer syntetisk bevægelse eller variation i kunstnerisk kvalitet.

Det forklarer også, hvorfor benchmark-konklusioner kan afvige: BFL’s interne præferencetest placerer FLUX 3 øverst i deres sammenligningsgruppe, mens Megatons uafhængige rangliste placerer den som nummer tre. Forskellige prompts, scoringsdimensioner, evaluatorpopulationer og aggregeringsmetoder kan give forskellige rangeringer.

FLUX 3 vs Seedance 2.5 vs MiniMax H3 vs Wan 3.0

Markedet for AI-video udviklede sig hurtigt i 2026. FLUX 3 konkurrerer nu med multimodale systemer, der i stigende grad kombinerer langtids-generering, synkroniseret lyd, referencer og redigering.

DimensionFLUX 3Seedance 2.5MiniMax H3Wan 3.0
UdviklerBlack Forest LabsByteDance SeedMiniMaxAlibaba
Maks. annonceret kliplængde20 s30 s15 s30 s
VideoopløsningHD / FHD / QHD (2K) / UHD (4K)Afhængig af API-niveauOp til 2KOp til 1080p
Indbygget lydJaJaJa, stereoJa
Tekst-til-videoJaJaJaJa
Billede/reference-inputJaJaJaJa
Keyframe/reference-kontrolStærke timede keyframesStærk multimodal referencekontrolMultimodal conditioningMultimodal referencekontrol
Videofortsættelse/redigeringFortsættelse tilgængeligRedigeringsorienteret workflowOmni-genereringsfokusRedigerings- og reference-workflows
Multishot-genereringJaJaJaJa
SærkendeVirkelighedsmodel-arkitektur, scenekonsistens, Self-FlowLangformet storytelling og referencekontrol2K audiovisuel generering og omni-modal kontekstLange klip og lavere startpris
CometAPI start-/enhedspris*$0.136/s$0.0824/s opført$0.064/s$0.040/s

* Prissætning er kun en grov sammenligning. Video-API’er bruger forskellige opløsninger, varigheder, kvalitetstrin og afregningsregler, så det billigste pris pr. sekund er ikke nødvendigvis den billigste output ved ækvivalent kvalitet.

FLUX 3 vs Seedance 2.5

Seedance 2.5 har en tydelig varighedsfordel med op til 30 sekunders generering sammenlignet med FLUX 3’s 20 sekunder. Den er også stærkt orienteret mod referencebaseret generering, redigering og langformet storytelling. FLUX 3 differentierer sig gennem sin delte verdensmodel-arkitektur, scenekonsistens, indbygget audiovisuel generering, timede keyframes og en bredere billed-/handlings-roadmap.

Uafhængig testning bekræfter, at dette er en ægte high-end-konkurrence: Megaton placerer i øjeblikket Seedance 2.5 over FLUX 3 samlet set.

FLUX 3 vs MiniMax H3

MiniMax H3 tilbyder op til 2K-output og indbygget stereolyd, hvilket giver stærke tekniske specifikationer for audiovisuelle outputs. FLUX 3 understøtter et længere maksimalt genereringsvindue – 20 sekunder mod H3’s 15 sekunder – og dens Draft Mode leverer en omkostningskontrolleret iterativ workflow.

FLUX 3 vs Wan 3.0

Wan 3.0 lægger vægt på brede multimodale input, audiovisuel generering, redigering og klip på op til 30 sekunder. Den er også billigere ved CometAPI’s opførte startpris. FLUX 3 er dyrere, men differentierer sig gennem sin virkelighedsmodel-positionering, scenekonsistens, Self-Flow-forskningsfundament, Draft Mode og integration med handlingsprædiktion.

FLUX 3-priser

Black Forest Labs tager betaling for FLUX 3 efter genereret videovarighed.

TilstandOfficiel BFL-prissætning for FLUX 3
T2V / I2V Draft HD$0.06/s
T2V / I2V HD$0.17/s
T2V / I2V FHD$0.29/s
T2V / I2V QHD (2K)$0.40/s
T2V / I2V UHD (4K)$0.80/s
Videofortsættelse Draft$0.12/s
Videofortsættelse HD$0.41/s
Videofortsættelse FHD$0.53/s
Videofortsættelse QHD (2K)$0.65/s
Videofortsættelse UHD (4K)$0.95/s

En standard 10-sekunders HD-generering koster derfor cirka $1.70 ved BFL’s opførte sats, mens en 10-sekunders FHD-generering koster cirka $2.90. Videofortsættelse er væsentligt dyrere end almindelig generering, så applikationer, der ofte forlænger klip, bør modellere disse omkostninger særskilt.

FLUX 3-pris på CometAPI

CometAPI opfører i øjeblikket FLUX 3 som tilgængelig med model-id’et flux-3.

OpløsningCometAPI FLUX 3-pris
720p$0.136/s
1080p$0.232/s

For en 10-sekunders generering svarer det til cirka $1.36 ved 720p eller $2.32 ved 1080p. Sammenlignet med BFL’s opførte satser på $0.17/s og $0.29/s er de standard CometAPI-priser cirka 20 % lavere for disse to niveauer.

Bemærkning om tilgængelighed: noget ældre beskrivende tekst på CometAPI afspejler stadig Early Access-perioden i juli. Det aktuelle live modelkort, prissektion og API-eksempel angiver flux-3 som Available, med en CometAPI-udgivelsesdato den 13. august 2026. Til integrationsbeslutninger er det live API og prisfelterne mere relevante end den ældre tilgængelighedstekst.

Hvorfor FLUX 3 betyder noget ud over AI-video

Det mest usædvanlige ved FLUX 3 er ikke 20-sekunders videogenerering. Flere konkurrenter kan allerede generere lige så lange eller længere klip. Det større tekniske sats er, at en stærk videorepræsentation kan blive et fundament for andre former for intelligens.

Fra videoprædiktion til handlingsprædiktion

Robotsignaler til styring er tidslige prædiktioner betinget af visuelle observationer, så BFL bruger FLUX 3’s videorepræsentation som fundament for handlingsprædiktion. Deres samarbejde med mimic robotics resulterede i FLUX-mimic, hvor en handlingsdekoder læser repræsentationer fra videomodellen i stedet for at træne en helt uafhængig perceptionsstak.

BFL rapporterer, at FLUX-mimic-backbonen kan køre på under 80 ms på en enkelt RTX 5090, mens det komplette robotsystem når en reaktionssløjfe på cirka 101 ms. Virksomheden har også drøftet industriel evaluering med Audi.

Det gør ikke den offentlige FLUX 3 Video-API til en robot-API. Det demonstrerer dog, hvorfor BFL investerede tungt i multimodal videorepræsentation i stedet for at behandle videogenerering som en isoleret medieopgave.

Hvad er FLUX 3’s vigtigste styrker?

  • Tidslig og scenemæssig konsistens. Megatons scenekonsistens-score på 94,76 er modellens stærkeste større benchmarkkategori.
  • Indbygget audiovisuel generering. Dialog, effekter, ambience og visuelle elementer kan genereres samlet i stedet for at blive sammenstykket fra separate modeller.
  • Stærk prompt-efterlevelse. Den uafhængige Prompt-efterlevelses-score på 87,07 antyder, at modellens styrker rækker ud over ren visuel finish.
  • Keyframe-kontrol. Op til ti billeder kan deltage i de nuværende billede-til-video-workflows, hvilket giver skabere eksplicit tidslig kontrol.
  • Kladde-til-finalt workflow. Draft Mode adresserer et reelt omkostningsproblem i AI-video: mange genereringer kasseres under prompt-iteration.
  • Bredt visuelt spænd. BFL positionerer FLUX 3 som i stand til rå, naturlige, filmiske, nostalgiske, legende, stiliserede og usædvanlige outputs frem for en fast husstil.
  • Verdensmodel-forskningsretning. Self-Flow og handlingsprædiktion gør FLUX 3 relevant ud over mediegenerering.

Hvad er FLUX 3’s begrænsninger?

  • Den fulde multimodale roadmap er ikke lanceret. Offentlige FLUX 3 Image og FLUX 3 Dev open weights bør ikke antages ud fra familielanceringen alene.
  • 20 sekunder er ikke længere branches førende varighed. Nogle konkurrenter i 2026 understøtter allerede 30-sekunders genereringer.
  • Fysik er ikke løst. Megaton giver FLUX 3 en fysik-score på 70,63, betydeligt under dens scenekonsistens-score.
  • Menneskelig troværdighed har stadig forbedringspotentiale. En uafhængig score på 73,70 betyder, at svær anatomi og realistisk menneskelig bevægelse stadig kan fejle.
  • Videofortsættelse er dyrt. BFL’s fortsættelsespris er væsentligt højere pr. sekund end almindelig T2V/I2V.
  • BFL’s overskriftsbenchmark er internt. Produktionsbeslutninger bør også inkludere uafhængige tests med applikationens egne prompts, shottyper, sprog og referenceaktiver.

Sådan bruger du FLUX 3 med CometAPI

CometAPI’s tidligere dækning af FLUX 3 forklarer Early Access-fasen i juli, foreløbige benchmarks og planlagt udrulning. Dette afsnit fokuserer på den aktuelle produktionsintegration, priser og arbejdende API-flow, så den historiske gennemgang gentages ikke. FLUX 3-produktionsmodellen bruger model-id’et flux-3.

En grundlæggende 720p-anmodning bruger /v1/videos-endpoint’et:

Bash

curl --request POST "https://api.cometapi.com/v1/videos" \
--header "Authorization: Bearer $COMETAPI_KEY" \
--form-string "model=flux-3" \
--form-string "prompt=En papirbåd glider hen over en stille dam i blødt morgenlys" \
--form-string "seconds=5" \
--form-string "size=1280x720"

Videoworkflowet er asynkront. Efter den første anmodning returnerer et opgave-id, tjekker applikationen opgaven, indtil genereringen er fuldført, og henter derefter den resulterende video. For produktionsapplikationer bør generering normalt håndteres af en baggrundsjob- eller kø-opgave i stedet for at holde en HTTP-anmodning åben i hele render-tiden.

Hvem bør bruge FLUX 3?

FLUX 3 er særligt overbevisende for applikationer, der har brug for mere end visuelt attraktive femsekunders klip: annoncesystemer med synkroniserede visuelle og lydlige elementer, automatiseret kortform-produktion, produktdemonstrationer hvor objektpersistens er vigtig, flersproget dialoggenerering, storyboard-til-video-workflows, keyframe-kontrolleret animation, uddannelsesindhold og eksperimenter med længere multimodale pipelines.

Den kan være mindre attraktiv, når det eneste krav er lavest mulige pris pr. sekund, når mere end 20 sekunder skal genereres i ét løb, eller når stillbilledgenerering er den primære opgave. For stillbilleder kan en eksisterende FLUX-billedmodel som FLUX.2 Max i øjeblikket være et bedre valg.

Er FLUX 3 bedre end andre AI-videomodeller?

Der findes ikke ét enkelt forsvarligt svar på tværs af alle anvendelser. BFL’s interne evaluering placerer den frigivne FLUX 3 øverst i deres tekst-til-video-sammenligning, mens uafhængig Megaton-evaluering placerer FLUX 3 som nummer tre samlet set efter nyere konkurrenter. Begge resultater kan være gyldige, fordi testene måler forskellige promptfordelinger og kvalitetsdimensioner.

FLUX 3 synes særligt stærk, når scenekonsistens, prompt-efterlevelse, objekttroværdighed, kausal sammenhæng, tekstrendering, synkroniseret lyd og kontrollerbare keyframes er vigtige. Andre modeller kan vinde på maksimal varighed, opløsning, kunstneriske præferencer, menneskelig troværdighed, redigeringsworkflows eller pris. For udviklere er den rigtige sammenligning brugsafhængig snarere end ranglisteafhængig.

Ofte stillede spørgsmål

Er FLUX 3 tilgængelig nu?

Ja. FLUX 3 Video blev generelt tilgængelig via BFL den 4. august 2026. CometAPI opfører også FLUX 3 som Available under model-id’et flux-3. Stillbilledudgivelsen FLUX 3 Image og FLUX 3 Dev open weights er fortsat separate roadmap-punkter.

Kan FLUX 3 generere lyd?

Ja. FLUX 3 Video genererer synkroniseret indbygget lyd, inklusive dialog, ambient lyd og effekter. Flersproget dialog og lippesynkronisering understøttes også.

Hvor lange kan FLUX 3-videoer være?

Aktuel tekst-til-video og billede-til-video understøtter 5–20 sekunder. Videofortsættelse understøtter 5–15 sekunder af nygenereret indhold.

Hvilken opløsning understøtter FLUX 3?

BFL understøtter HD (op til 1 megapixel pr. frame), FHD (op til 2 MP), QHD/2K (op til 4 MP) og UHD/4K (op til 8 MP). Et 16:9 FHD-output er 1920 × 1088. Opløsningsbånd er baseret på det samlede antal pixels pr. frame frem for sideforhold; Draft Mode er kun HD.

Understøtter FLUX 3 billede-til-video?

Ja. Billede-til-video og keyframe-generering er en del af det generelt tilgængelige FLUX 3 Video-funktionssæt.

Er FLUX 3 en billedgenereringsmodel?

Arkitektonisk er FLUX 3 trænet på tværs af billeder, video og lyd, og BFL har demonstreret forskning i billedgenerering og -redigering. Men FLUX 3 Image-produktet er stadig en kommende udgivelse; forveksl ikke familie-roadmappen med det aktuelt offentlige FLUX 3 Video API.

Er FLUX 3 open source?

Ikke på nuværende tidspunkt. BFL har annonceret FLUX 3 Dev, en open-weight multimodal variant, men har endnu ikke angivet en offentlig udgivelsesdato.

Hvad koster FLUX 3?

BFL prissætter tekst/billede-til-video til $0.06/s for Draft HD, $0.17/s for HD, $0.29/s for FHD, $0.40/s for QHD og $0.80/s for UHD. Video-til-video koster $0.12/s for Draft HD, derefter $0.41/s for HD, $0.53/s for FHD, $0.65/s for QHD og $0.95/s for UHD. CometAPI opfører i øjeblikket $0.136/s for 720p og $0.232/s for 1080p.

Hvad er Self-Flow?

Self-Flow er BFL’s selvvejledte flow-matching-forskningsmetode. Den er designet til at lade en generativ model udvikle nyttige interne repræsentationer uden at afhænge af en ekstern repræsentationsmodel. Dens brug af forskellige støjniveauer på tværs af tokens tilskynder netværket til at udlede manglende information og lære relationer mellem multimodale observationer.

Er FLUX 3 en verdensmodel?

Black Forest Labs positionerer FLUX 3 som et fundament for virkelighedsmodellering, fordi dens delte repræsentationer strækker sig fra audiovisuel prædiktion mod fysisk handlingsprædiktion. At kalde den en komplet generel verdensmodel ville være stærkere end den evidens, der aktuelt foreligger; en mere præcis beskrivelse er en multimodal generativ foundation-model eksplicit designet omkring verdensmodel-objektiver.

Konklusion

FLUX 3 repræsenterer en større ændring for Black Forest Labs end en konventionel opgradering fra én FLUX-billedmodel til en anden. Den centrale idé er at træne en delt multimodal repræsentation af verden og derefter bruge den repræsentation til video, lyd, billeder og i sidste ende handlinger. Self-Flow leverer forskningsfundamentet, mens den udgivne FLUX 3 Video-model er den første produktionsdemonstration af den strategi.

Per september 2026 understøtter FLUX 3 Video klip på op til 20 sekunder, 24 fps, output fra HD til UHD/4K, synkroniseret lyd, flersproget dialog, billede-til-video, keyframes, videofortsættelse, multishot-generering og Draft Mode.

Benchmark-billedet er også mere troværdigt end ved lanceringen. BFL’s aktuelle evaluering af den frigivne model placerer FLUX 3 først i deres interne T2V ELO-test, mens uafhængig Megaton-testning rangerer den som nummer tre samlet og fremhæver en særlig stærk scenekonsistens.

FLUX 3 er derfor ikke automatisk den bedste videomodel til enhver arbejdsbyrde. Seedance 2.5, MiniMax H3, og Wan 3.0 kan tilbyde længere generering, højere nominelle opløsninger, lavere prissætning eller andre reference- og redigeringsfunktioner.

Det, der gør FLUX 3 usædvanligt interessant, er retningen under videogeneratoren: BFL satser på, at de samme repræsentationer, der kræves for at forudsige overbevisende video, i sidste ende kan understøtte billedgenerering, lyd, fysisk ræsonnement og robot-handlinger. Udviklere kan allerede teste det første produktionsskridt via FLUX 3 på CometAPI ved at bruge model-id’et flux-3.

Fortsæt læring

Knyt denne artikel til den næste beslutning.

Se alle emner
Udgivet den Oct 3, 2026
Sidst opdateret Oct 3, 2026
7 visninger
Gennemgået for klarhed, kildeangivelse og aktuel API-terminologi.

Læs mere