Une direction visuelle unique
L’entraînement conjoint sur les images, la vidéo et l’audio préserve la cohérence du personnage, de la palette et de l’éclairage lorsqu’une image fixe devient une scène animée.
FLUX 3 de Black Forest Labs génère des vidéos par IA avec audio natif et dialogues multilingues. Transformez un prompt de génération vidéo, une image ou des images clés en une scène à la direction visuelle cohérente.
L’entraînement conjoint sur les images, la vidéo et l’audio préserve la cohérence du personnage, de la palette et de l’éclairage lorsqu’une image fixe devient une scène animée.
Laissez le temps à une réplique, une réaction et un mouvement de caméra de se déployer, avec jusqu’à 20 secondes de vidéo et d’audio par génération.
Enchaînez les clips pour créer des scènes plus longues en plusieurs plans. Précisez le sujet, l’éclairage et la direction de la caméra dans chaque prompt pour assurer la continuité entre les plans.
Définissez le personnage, la palette et le cadrage dans une image de référence, ou commencez directement avec un prompt de génération vidéo à partir de texte.
Décrivez l’action et les mouvements de caméra. Une première image, une image de fin ou des images clés peuvent guider le plan.
Précisez les dialogues, la langue et les sons ambiants dans le prompt. L’audio natif est généré avec l’image.
| Critère | FLUX 2 | FLUX 3 |
|---|---|---|
| Modalités | Images — génération à partir de texte et retouche d’images dans un seul modèle. | Image, vidéo, audio et prédiction d’actions dans un seul modèle. |
| Vidéo | Ce n’est pas un modèle vidéo. | Jusqu’à 20 secondes avec audio en une seule génération. |
| Audio | Aucun. | Génération audio native avec dialogues multilingues. |
| Architecture | Appariement de flux dans l’espace latent, associant un modèle vision-langage de 24 milliards de paramètres à un transformeur à flux rectifié. | Fondé sur Self-Flow et entraîné conjointement sur les images, la vidéo et l’audio. |
| Disponibilité | Disponible dès aujourd’hui sur YouArt, avec des modes de création et de retouche. | Disponible dès aujourd’hui sur YouArt. |
YouArt propose FLUX 3 Video en 720p ou 1080p avec audio synchronisé. Pour générer et retoucher des images, utilisez FLUX 2 ou Flux Kontext.
Transformez un visuel de campagne en spot de vingt secondes et créez des versions dans plusieurs langues en conservant le même produit, la même palette et le même message.
Animez des photos de produits avec du son tout en préservant la forme, la couleur et la texture qui permettent aux acheteurs de les reconnaître.
Prévisualisez une scène avec les dialogues, les mouvements de caméra et les éléments sonores déjà en place pour permettre à l’équipe d’en évaluer le rythme.
Conservez le même porte-parole d’un module de formation à l’autre et générez des versions dans d’autres langues à partir des mêmes consignes.
Un seul solde de crédits pour FLUX 3 Video, FLUX 2, Flux Kontext et bien d’autres.
Pour les amateurs et les curieux
Pour les créateurs et les professionnels
Pour les utilisateurs avancés et les équipes
Pour les équipes et les studios
FLUX 3 est le modèle multimodal de Black Forest Labs, annoncé le 23 juillet 2026. Il réunit l’image, la vidéo, l’audio et la prédiction d’actions dans un seul modèle entraîné conjointement sur ces modalités, plutôt que d’assembler des systèmes distincts. Comme pour toute version en accès anticipé, sa disponibilité et les modes pris en charge peuvent évoluer ; YouArt propose FLUX 3 Video pour vous permettre de générer des vidéos dès aujourd’hui.
Oui, avec FLUX 2 et Flux Kontext, tous deux disponibles sur YouArt dès aujourd’hui. FLUX 2 permet de générer des images à partir de texte et de les retoucher à l’aide de références dans ses modes de création et de retouche. Flux Kontext permet de retoucher une image de référence à partir de consignes, avec une retouche localisée par masque. Vous n’avez pas besoin de gérer des poids de modèles distincts pour utiliser ces flux de travail dans YouArt.
FLUX 2 est un modèle d’image qui réunit, dans un seul point de contrôle, la génération à partir de texte et la retouche à partir d’une ou plusieurs références. FLUX 3 élargit ces capacités à la génération de vidéos à partir de texte, à la vidéo, à l’audio et à la prédiction d’actions dans un modèle unique entraîné conjointement. Il génère jusqu’à 20 secondes de vidéo avec audio en une seule passe.
Oui, jusqu’à 20 secondes de vidéo avec audio en une seule génération, y compris des dialogues multilingues. Il peut aussi prolonger une vidéo fournie en entrée avec son audio. Pour obtenir des vidéos plus longues, les clips sont enchaînés en séquences de plusieurs plans, plutôt que d’allonger une seule génération.
Jusqu’à 20 secondes en une seule génération. Les séquences plus longues enchaînent des clips individuels pour former des scènes à plusieurs plans, plutôt que de prolonger davantage une seule génération.
Tous les modèles sur YouArt utilisent un système de crédits. FLUX 3 Video est facturé à la durée, à raison de 55 crédits par seconde. Vous pouvez consulter les offres et les tarifs par modèle sur la page des tarifs. Si vous prévoyez d’utiliser l’API, comparez la durée des vidéos à générer, la résolution, les ajustements successifs du prompt et les exigences de votre flux de travail de production avant d’estimer le coût par projet.
Dans les tests de préférence menés par Black Forest Labs — des résultats préliminaires obtenus avec un point de contrôle en cours d’entraînement, sur des clips de 10 secondes en 720p avec audio — FLUX 3 a été préféré à Luma Ray 3.2 dans 93 % des comparaisons et à Runway Gen-4.5 dans 77 %, avec des écarts plus faibles face aux meilleurs concurrents. Kling et FLUX 3 peuvent répondre à des besoins différents en matière de génération vidéo. Comparez donc la qualité des résultats, le contrôle par prompt, les mouvements, l’audio et le flux de travail disponible via l’API en fonction de votre projet. Les tests indépendants restent limités.
Oui. FLUX 3 est proposé sur YouArt sous le nom de FLUX 3 Video : des vidéos en 720p ou 1080p avec audio natif synchronisé, générées à partir d’un simple prompt, d’une première image à animer, d’une première et d’une dernière image entre lesquelles créer le mouvement, ou d’un maximum de 10 images clés placées sur la chronologie. FLUX 2 et Flux Kontext restent les modèles FLUX dédiés aux images.
FLUX, FLUX.2 et FLUX 3 sont des marques de Black Forest Labs Inc. YouArt n’est ni affilié à Black Forest Labs ni approuvé par cette société.
Chaque passage d’un outil à l’autre risque d’altérer votre esthétique. FLUX 3 réunit ces étapes dans un seul modèle : ce que vous avez validé dans la première image se retrouve dans la dernière. Pour une équipe créative, cela signifie moins de transferts entre modèles, moins de réécritures de prompts et un résultat plus cohérent, de l’image au mouvement et au son.
FLUX 3 réunit la génération et l’édition d’images, la conversion de texte en vidéo, la vidéo et le son dans un seul modèle, au lieu d’enchaîner des outils spécialisés. Ce que vous définissez dans une image fixe se retrouve ainsi dans le mouvement et le mixage. Grâce à sa compréhension multimodale, le modèle relie les orientations visuelles et sonores avant même de lancer la génération.
Jusqu’à 20 secondes de vidéo avec audio en une seule génération : assez pour développer un moment narratif complet. Pour les formats plus longs, les clips s’enchaînent en séquences de plusieurs plans. Vous construisez ainsi votre histoire avec des plans pensés pour elle, sans étirer une génération au-delà de sa durée utile.
L’audio natif est généré avec la vidéo, dialogues multilingues compris, au lieu d’être ajouté puis synchronisé après coup. Les versions linguistiques deviennent ainsi un choix créatif dès le prompt, sans nécessiter un flux de travail distinct pour remplacer l’audio.
La génération et l’édition d’images partagent le même modèle que la vidéo. L’image fixe que vous affinez et celle que vous animez proviennent donc d’un seul système, au lieu de deux systèmes dont les résultats ne concordent qu’approximativement. Pour les utilisateurs en accès anticipé ou travaillant avec des versions préliminaires du modèle, cela peut réduire les transferts de ressources entre des outils encore incomplets, pendant que les fonctionnalités définitives évoluent.
Un seul modèle entraîné sur toutes les modalités. Une esthétique cohérente, de l’image fixe au mouvement et au son
Jusqu’à 20 secondes en une seule génération. Un moment complet, pas un fragment
Un audio natif dès la génération. Des dialogues déjà intégrés à l’image
Des dialogues multilingues. Un seul tournage, plusieurs versions linguistiques
Les équipes qui en ont assez de raccorder un modèle d’image à un modèle vidéo puis à un outil audio, et qui veulent un système cohérent de bout en bout.
Une scène déjà créée avec FLUX 2 sur YouArt, puis animée avec des dialogues : c’est ce passage d’un modèle à l’autre que FLUX 3 vise à supprimer. Utilisez des prompts de génération vidéo à partir de texte si vous partez d’une idée, ou une image fixe et des images clés si le cadrage et l’équilibre visuel sont déjà définis.
Les images fixes ponctuelles que FLUX 2 permet déjà de créer plus vite.
Un seul modèle entraîné sur toutes les modalités conserve le personnage, la palette et l’éclairage définis dans l’image fixe lorsque le plan s’anime.
Assez pour une réplique et une réaction, au lieu d’un fragment qui impose ses contraintes au montage.
La génération audio native supprime l’étape de synchronisation qui sépare habituellement le rendu final de la scène terminée.
Avec les dialogues multilingues, une version dans une autre langue demande une nouvelle génération, pas un nouveau tournage.
Les directeurs de création conservent une même intention visuelle entre une image fixe, un plan animé et une bande-son, sans devoir la redéfinir dans chaque outil.
Les spécialistes du marketing à la performance déclinent une même esthétique en variantes et en versions linguistiques, sans nouveau tournage pour chacune.
Les cinéastes prévisualisent les scènes avec les dialogues déjà intégrés pour en évaluer le rythme, au lieu de l’imaginer.
Les créateurs pour les réseaux sociaux passent d’une idée à une courte vidéo avec le son déjà intégré, sans devoir combiner plusieurs outils.