Black Forest Labs lanceert multimodale FLUX 3
2 mins read

Black Forest Labs lanceert multimodale FLUX 3

Black Forest Labs, de Duitse studio achter de FLUX-beeldmodellen, heeft op 23 juli FLUX 3 aangekondigd. Het is de opvolger van de FLUX.1- en FLUX.2-families, maar de sprong zit niet in scherpere plaatjes. FLUX 3 leert beeld, video en geluid binnen één architectuur en zet die kennis in één rekenstap om, meldt het bedrijf in zijn aankondiging via GlobeNewswire.

Beeld, video en geluid uit één model

Waar de meeste generatoren tekst-naar-beeld en tekst-naar-video als losse taken behandelen, traint FLUX 3 ruimtelijke structuur, beweging en klank samen. Volgens Black Forest Labs kan het model clips tot twintig seconden maken met bijpassend geluid dat uit hetzelfde flow-matching-raamwerk komt als de videobeelden zelf. Dat native audio in dezelfde stap ontstaat, is het grootste verschil met eerdere systemen, schrijft Cryptobriefing. Het model werkt vanuit tekst, een bestaande foto of een bestaand filmpje, en ondersteunt videovervolg, keyframe-overgangen en meertalige dialoog.

De ambitie reikt verder dan mediaproductie. Yahoo Finance citeert het bedrijf dat de architectuur uitbreidbaar is naar het voorspellen van acties, wat de deur opent naar robotica. FLUX 3 zou dan niet alleen tonen hoe een scene eruitziet, maar ook hoe een systeem in die scene kan handelen.

Handen bedienen de faders van een mengpaneel in een geluidsstudio

Hoe FLUX 3 zich verhoudt tot de concurrentie

Black Forest Labs deelde eigen voorkeurstests, dus enige terughoudendheid is op zijn plaats. In die vergelijkingen kozen beoordelaars FLUX 3 boven Grok Imagine Video in 69 procent van de gevallen, boven Kling v3 Pro in 60 procent, boven Runway Gen 4.5 in 77 procent en boven Luma Ray 3.2 in 93 procent. De videomodule ging meteen in beperkte toegang. Een open-weight versie, FLUX 3 Dev, staat gepland voor later dit jaar, wat lokale inzet en aanpassing mogelijk moet maken.

De timing valt op. De strijd om AI-videogeneratie is de afgelopen maanden hard geworden, met flinke investeringen en snelle modelupdates. Ook op het vlak van stilstaand beeld ligt de druk hoog, getuige de recente Gemini-beeldmodellen van Google en de compacte Nano Banana 2 Lite. FLUX 3 probeert dat hele speelveld in één model te vangen.

Wat betekent dit

Voor videomakers en marketeers verschuift de werkwijze. Wie eerst beeld, montage en geluid apart regelde, kan straks in één opdracht een clip met stem en omgevingsgeluid genereren. Dat scheelt tijd, maar roept ook vragen op over herkenbaarheid en rechten, zeker nu synthetisch beeld steeds moeilijker van echt te onderscheiden is. De onderliggende techniek bouwt voort op het snelle onderzoek naar diffusiemodellen, dat dit jaar op ICML werd bekroond. En met de aangekondigde open-weight variant sluit FLUX 3 aan bij de bredere beweging richting open modellen. Of de robotica-ambitie waargemaakt wordt, moet blijken; voorlopig is de belofte groter dan het bewijs. Wie met AI-media werkt, doet er goed aan de beperkte toegang en de latere Dev-release in de gaten te houden.