Eine einheitliche Bildsprache
Durch das gemeinsame Training mit Bildern, Videos und Audio bleiben Figur, Farbpalette und Beleuchtung aufeinander abgestimmt, wenn aus einem Standbild eine bewegte Szene wird.
FLUX 3 von Black Forest Labs generiert KI-Videos mit nativem Audio und mehrsprachigen Dialogen. Verwandle einen Text-zu-Video-Prompt, ein Bild oder Schlüsselbilder in eine Szene mit einheitlicher Bildsprache.
Durch das gemeinsame Training mit Bildern, Videos und Audio bleiben Figur, Farbpalette und Beleuchtung aufeinander abgestimmt, wenn aus einem Standbild eine bewegte Szene wird.
Gib einem Dialogsatz, einer Reaktion und einer Kamerabewegung Raum, sich zu entfalten – mit bis zu 20 Sekunden Video und Audio pro Generierung.
Verbinde Clips zu längeren Szenen mit mehreren Einstellungen. Beschreibe Motiv, Beleuchtung und Kameraführung in jedem Prompt präzise, damit die Einstellungen zusammenpassen.
Lege Figur, Farbpalette und Bildausschnitt in einem Referenzbild fest oder starte direkt mit einem Text-zu-Video-Prompt.
Beschreibe die Handlung und die Kamerabewegung. Ein Startbild, ein Endbild oder Schlüsselbilder können die Aufnahme steuern.
Gib Dialoge, Sprache und Umgebungsgeräusche im Prompt an. Natives Audio wird zusammen mit dem Bild generiert.
| Merkmal | FLUX 2 | FLUX 3 |
|---|---|---|
| Modalitäten | Bilder – Text-zu-Bild und Bildbearbeitung in einem Modell. | Bild, Video, Audio und Handlungsvorhersage in einem Modell. |
| Video | Kein Videomodell. | Bis zu 20 Sekunden mit Audio in einer einzigen Generierung. |
| Audio | Keines. | Native Audiogenerierung mit mehrsprachigen Dialogen. |
| Architektur | Latentes Flow Matching, das ein Bild-Sprach-Modell mit 24 Milliarden Parametern mit einem Rectified-Flow-Transformer verbindet. | Basiert auf Self-Flow und wurde modalitätsübergreifend mit Bildern, Videos und Audiodaten trainiert. |
| Verfügbarkeit | Jetzt auf YouArt verfügbar, mit Modi zum Erstellen und Bearbeiten. | Jetzt auf YouArt verfügbar. |
YouArt bietet FLUX 3 Video in 720p oder 1080p mit synchronisiertem Audio an. Nutze FLUX 2 oder Flux Kontext zum Generieren und Bearbeiten von Bildern.
Verwandle ein Kampagnenbild in einen zwanzigsekündigen Werbespot und erstelle Sprachfassungen mit einheitlicher Produktdarstellung, Farbpalette und Botschaft.
Animiere Produktbilder mit Ton und erhalte dabei Form, Farbe und Textur, damit Kunden das Produkt wiedererkennen.
Visualisiere eine Szene vorab mit Dialogen, Kamerabewegung und Toneffekten, damit das Team ihr Erzähltempo beurteilen kann.
Stelle eine Sprecherperson über alle Schulungsmodule hinweg einheitlich dar und generiere weitere Sprachfassungen nach denselben Gestaltungsvorgaben.
Ein gemeinsames Credits-Guthaben für FLUX 3 Video, FLUX 2, Flux Kontext und mehr.
Für Hobbykreative und Neugierige
Für Kreative und Profis
Für Vielnutzer und Teams
Für Teams und Studios
FLUX 3 ist das multimodale Modell von Black Forest Labs, das am 23. Juli 2026 angekündigt wurde. Es vereint Bild, Video, Audio und Handlungsvorhersage in einem einzigen Modell, das modalitätsübergreifend trainiert wurde, statt aus getrennten Systemen zusammengesetzt zu sein. Wie bei jeder Vorabversion können sich Verfügbarkeit und unterstützte Modi weiterentwickeln. Auf YouArt kannst du FLUX 3 Video bereits jetzt selbst zum Generieren nutzen.
Ja – mit FLUX 2 und Flux Kontext, die beide bereits auf YouArt verfügbar sind. FLUX 2 bietet Text-zu-Bild und referenzgestützte Bearbeitung in den Modi zum Erstellen und Bearbeiten. Flux Kontext bearbeitet Bilder anhand von Anweisungen und einem einzelnen Referenzbild, mit maskenbasiertem Inpainting. Du musst keine separaten Modellgewichte verwalten, um diese Workflows in YouArt zu nutzen.
FLUX 2 ist ein Bildmodell: Text-zu-Bild sowie die Bearbeitung mit einer oder mehreren Referenzen in einem einzigen Modell-Checkpoint. FLUX 3 erweitert dies um Text-zu-Video, Video, Audio und Handlungsvorhersage in einem einzigen gemeinsam trainierten Modell und generiert bis zu 20 Sekunden Video mit Audio in einem Durchgang.
Ja – bis zu 20 Sekunden Video mit Audio in einer einzigen Generierung, einschließlich mehrsprachiger Dialoge. Außerdem lassen sich ein Eingabevideo und dessen Audio fortsetzen. Für längere Videos werden Clips zu Sequenzen mit mehreren Einstellungen verbunden, statt eine einzelne Generierung zu verlängern.
Bis zu 20 Sekunden in einer einzigen Generierung. Für längere Sequenzen werden einzelne Clips zu Szenen mit mehreren Einstellungen verbunden, statt eine einzelne Generierung weiter zu verlängern.
Die Abrechnung erfolgt für alle Modelle auf YouArt über ein gemeinsames Credits-System. FLUX 3 Video wird nach Dauer mit 55 Credits pro Sekunde abgerechnet. Tarife und Preise für die einzelnen Modelle findest du auf der Preisseite. Vergleiche bei der API-Planung die Rendering-Dauer, die Auflösung, die Anzahl der Prompt-Überarbeitungen und die Anforderungen deines Produktionsworkflows, bevor du die Kosten pro Projekt schätzt.
In den eigenen Präferenztests von Black Forest Labs wurde FLUX 3 in 93 % der Vergleiche gegenüber Luma Ray 3.2 und in 77 % gegenüber Runway Gen-4.5 bevorzugt. Gegenüber den stärksten Konkurrenten waren die Abstände geringer. Dabei handelt es sich um vorläufige Ergebnisse eines Modell-Checkpoints aus der Mitte des Trainings, getestet mit 10-sekündigen 720p-Clips mit Audio. Kling und FLUX 3 können sich für unterschiedliche Anforderungen an die Videogenerierung eignen. Vergleiche daher Ausgabequalität, Steuerung per Prompt, Bewegung, Audio und den verfügbaren API-Workflow im Hinblick auf dein Projekt. Unabhängige Tests liegen bislang nur in begrenztem Umfang vor.
Ja. FLUX 3 ist auf YouArt als FLUX 3 Video verfügbar: Videos in 720p oder 1080p mit synchronisiertem nativem Audio – aus einem Prompt allein, einem zu animierenden Startbild, einem Start- und Endbild für die Bewegung dazwischen oder bis zu 10 auf der Zeitleiste platzierten Schlüsselbildern. FLUX 2 und Flux Kontext bleiben die FLUX-Modelle für Bilder.
FLUX, FLUX.2 und FLUX 3 sind Marken von Black Forest Labs Inc. YouArt ist weder mit Black Forest Labs verbunden noch wird es von Black Forest Labs empfohlen.
Bei jedem Wechsel zwischen Werkzeugen kann sich dein Look verändern. FLUX 3 vereint diese Schritte in einem einzigen Modell. So bleibt das, was du im ersten Bild freigegeben hast, bis zum letzten erhalten. Für ein Kreativteam bedeutet das weniger Wechsel zwischen Modellen, weniger Überarbeitungen von Prompts und ein stimmigeres Ergebnis vom Bild über die Bewegung bis zum Ton.
FLUX 3 vereint Bildgenerierung und -bearbeitung, Text-zu-Video, Video und Ton in einem einzigen Modell statt in einer Kette spezialisierter Modelle. So bleibt das, was du im Standbild festlegst, auch in der Bewegung und der Tonmischung erhalten. Das multimodale Verständnis des Modells verbindet die visuelle und akustische Gestaltung schon vor Beginn der Generierung.
Bis zu 20 Sekunden Video mit Audio in einem einzigen Durchgang – lang genug für einen vollständigen Erzählmoment. Für längere Werke lassen sich Clips zu Sequenzen mit mehreren Einstellungen verbinden. So baust du deine Geschichte mit gezielten Einstellungen auf, statt eine einzelne Generierung über ihre sinnvolle Länge hinaus zu strecken.
Audio entsteht direkt mit dem Video – einschließlich mehrsprachiger Dialoge. Es muss nicht nachträglich hinzugefügt und mühsam synchronisiert werden. Sprachversionen werden so zu einer kreativen Entscheidung beim Schreiben des Prompts, statt einen eigenen Workflow zum Austausch der Tonspur zu erfordern.
Bildgenerierung, Bildbearbeitung und Video sind im selben Modell vereint. Das Standbild, das du verfeinerst, und das Bild, das du animierst, stammen damit aus einem System statt aus zwei Systemen, die nur ungefähr übereinstimmen. Wenn du mit Vorabzugängen oder Modellvorschauen arbeitest, kann das den Transfer von Vorlagen zwischen noch unvollständigen Werkzeugen reduzieren, während der endgültige Funktionsumfang weiterentwickelt wird.
Ein gemeinsam trainiertes Modell. Eine stimmige Gestaltung vom Standbild über die Bewegung bis zum Ton
Bis zu 20 Sekunden in einer Generierung. Ein vollständiger Moment statt eines Fragments
Audio direkt bei der Generierung. Dialoge sind bereits auf das Bild abgestimmt
Mehrsprachige Dialoge. Ein Dreh, mehrere Sprachfassungen
Teams, die nicht länger ein Bildmodell mit einem Videomodell und einem Audiotool zusammenstückeln möchten, sondern ein durchgängig einheitliches System suchen.
Eine Szene, die bereits mit FLUX 2 auf YouArt erstellt wurde, wird mit Bewegung und Dialog zum Leben erweckt – genau diesen Wechsel zwischen Modellen soll FLUX 3 überflüssig machen. Nutze Text-zu-Video-Prompts, wenn du mit einer Idee beginnst, oder ein Standbild und Schlüsselbilder, wenn Bildausschnitt und visuelle Gewichtung bereits feststehen.
Einzelne Standbilder, bei denen du mit FLUX 2 bereits schneller ans Ziel kommst.
Ein einziges, modalitätsübergreifend trainiertes Modell sorgt dafür, dass Figur, Farbpalette und Beleuchtung aus deinem Standbild erhalten bleiben, sobald die Aufnahme in Bewegung kommt.
Lang genug für einen Dialogsatz und eine Reaktion – statt eines Fragments, an das du deinen Schnitt anpassen musst.
Die native Audiogenerierung erspart dir die nachträgliche Synchronisierung, die normalerweise zwischen dem fertigen Rendering und der fertigen Szene liegt.
Dank mehrsprachiger Dialoge kannst du eine zweite Sprachfassung generieren, ohne neu zu drehen.
Kreativdirektoren behalten eine einheitliche Gestaltungsidee über Standbild, bewegte Aufnahme und Tonspur hinweg bei, statt sie in jedem Tool neu festlegen zu müssen.
Performance-Marketing-Teams erstellen Varianten und Sprachfassungen mit demselben Look, ohne für jede neu drehen zu müssen.
Filmschaffende visualisieren Szenen vorab mit fertigen Dialogen. So lässt sich das Erzähltempo beurteilen, statt es sich nur vorzustellen.
Social-Media-Creator machen aus einer Idee einen kurzen Beitrag mit Ton, ohne dafür erst mehrere Tools miteinander verbinden zu müssen.