Un'unica direzione visiva
L'addestramento congiunto su immagini, video e audio mantiene coerenti personaggio, palette e illuminazione mentre un'immagine diventa una scena in movimento.
FLUX 3 di Black Forest Labs genera video IA con audio nativo e dialoghi multilingue. Trasforma un prompt per generare video da testo, un'immagine o dei fotogrammi chiave in una scena con una direzione visiva coerente.
L'addestramento congiunto su immagini, video e audio mantiene coerenti personaggio, palette e illuminazione mentre un'immagine diventa una scena in movimento.
Dai spazio a una battuta, una reazione e un movimento di camera, con fino a 20 secondi di video e audio per generazione.
Unisci le clip in scene più lunghe con più inquadrature. Specifica soggetto, illuminazione e direzione della camera in ogni prompt per dare continuità alle riprese.
Definisci personaggio, palette e inquadratura in un'immagine di riferimento, oppure parti direttamente da un prompt per generare un video da testo.
Descrivi l'azione e il movimento della camera. Puoi guidare la ripresa con un fotogramma iniziale, uno finale o dei fotogrammi chiave.
Includi dialoghi, lingua e suoni ambientali nel prompt. L'audio nativo viene generato insieme alle immagini.
| Caratteristica | FLUX 2 | FLUX 3 |
|---|---|---|
| Modalità | Immagini: generazione da testo e modifica delle immagini in un unico modello. | Immagini, video, audio e previsione delle azioni in un unico modello. |
| Video | Non è un modello video. | Fino a 20 secondi con audio in un'unica generazione. |
| Audio | Assente. | Generazione audio nativa con dialoghi multilingue. |
| Architettura | Flow matching nello spazio latente, che abbina un modello visivo-linguistico da 24 miliardi di parametri a un transformer a flusso rettificato. | Basato su Self-Flow, addestrato congiuntamente su immagini, video e audio. |
| Disponibilità | Già disponibile su YouArt, con modalità di creazione e modifica. | Già disponibile su YouArt. |
YouArt offre FLUX 3 Video a 720p o 1080p con audio sincronizzato. Per generare e modificare immagini, usa FLUX 2 o Flux Kontext.
Trasforma un'immagine della campagna in uno spot di venti secondi e crea versioni in più lingue mantenendo coerenti prodotto, palette e messaggio.
Anima le immagini dei prodotti con l'audio, preservando forma, colore e texture che aiutano i clienti a riconoscerli.
Previsualizza una scena con dialoghi, movimenti di camera e segnali sonori già inseriti, così il team può valutarne il ritmo.
Mantieni coerente l'aspetto del portavoce nei moduli di formazione e genera versioni in altre lingue seguendo la stessa direzione creativa.
Un unico saldo di crediti per FLUX 3 Video, FLUX 2, Flux Kontext e molti altri.
Per appassionati e curiosi
Per creativi e professionisti
Per utenti esperti e team
Per team e studi
FLUX 3 è il modello multimodale di Black Forest Labs, annunciato il 23 luglio 2026. Comprende immagini, video, audio e previsione delle azioni in un unico modello addestrato congiuntamente su queste modalità, anziché assemblato da sistemi separati. Come per ogni versione in accesso anticipato, disponibilità e modalità supportate possono evolversi; su YouArt puoi già usare FLUX 3 Video per generare video.
Sì, con FLUX 2 e Flux Kontext, entrambi già disponibili su YouArt. FLUX 2 gestisce la generazione di immagini da testo e la modifica guidata da riferimenti nelle modalità di creazione e modifica. Flux Kontext modifica una singola immagine di riferimento seguendo le istruzioni, con ritocchi localizzati tramite maschere. Per usare questi flussi di lavoro su YouArt non devi gestire separatamente i pesi dei modelli.
FLUX 2 è un modello per immagini: riunisce in un unico checkpoint la generazione da testo e la modifica con uno o più riferimenti. FLUX 3 estende queste capacità alla generazione di video da testo, ai video, all'audio e alla previsione delle azioni in un unico modello addestrato congiuntamente, e genera fino a 20 secondi di video con audio in un solo passaggio.
Sì, fino a 20 secondi di video con audio in un'unica generazione, inclusi dialoghi multilingue. Può anche proseguire un video fornito in ingresso insieme al suo audio. Per creare video più lunghi, si uniscono le clip in sequenze con più inquadrature anziché prolungare una singola generazione.
Fino a 20 secondi in un'unica generazione. Per sequenze più lunghe, si uniscono singole clip in scene con più inquadrature anziché estendere ulteriormente una sola generazione.
Tutti i modelli su YouArt usano un sistema a crediti. FLUX 3 Video viene addebitato in base alla durata, a 55 crediti al secondo; puoi consultare i piani e i prezzi dei singoli modelli nella pagina dei prezzi. Se prevedi di usare le API, valuta durata del rendering, risoluzione, revisioni del prompt e requisiti del flusso di lavoro di produzione prima di stimare il costo per progetto.
Nei test di preferenza condotti da Black Forest Labs, con risultati preliminari ottenuti da un checkpoint intermedio dell'addestramento su clip di 10 secondi a 720p con audio, FLUX 3 è stato preferito a Luma Ray 3.2 nel 93% dei confronti e a Runway Gen-4.5 nel 77%, con margini più contenuti rispetto ai concorrenti più forti. Kling e FLUX 3 possono rispondere a esigenze diverse nella generazione video: confronta qualità dei risultati, controllo tramite prompt, movimento, audio e flussi di lavoro API disponibili in base al tuo progetto. I test indipendenti sono ancora limitati.
Sì. FLUX 3 è disponibile su YouArt come FLUX 3 Video: genera video a 720p o 1080p con audio nativo sincronizzato a partire da un solo prompt, un primo fotogramma da animare, un primo e un ultimo fotogramma tra cui creare il movimento oppure fino a 10 fotogrammi chiave posizionati lungo la timeline. FLUX 2 e Flux Kontext restano i modelli FLUX dedicati alle immagini.
FLUX, FLUX.2 e FLUX 3 sono marchi di Black Forest Labs Inc. YouArt non è affiliato a Black Forest Labs né gode del suo sostegno ufficiale.
Ogni passaggio da uno strumento all'altro rischia di alterare lo stile visivo. FLUX 3 riunisce questi passaggi in un unico modello, così ciò che hai approvato nel primo fotogramma resta anche nell'ultimo. Per un team creativo significa meno trasferimenti tra modelli, meno riscritture dei prompt e un risultato più coerente, dall'immagine al movimento fino al suono.
FLUX 3 riunisce generazione e modifica di immagini, conversione da testo a video, video e suono in un unico modello, anziché in una catena di modelli specializzati. Così ciò che definisci in un'immagine si mantiene nel movimento e nel mix audio. La comprensione multimodale del modello collega la direzione visiva e quella sonora prima ancora che inizi la generazione.
Fino a 20 secondi di video con audio in un solo passaggio: abbastanza per raccontare un momento completo. Per i contenuti più lunghi, le clip si uniscono in sequenze con più inquadrature, così costruisci la storia attraverso riprese pensate con cura, senza allungare una singola generazione oltre la durata in cui rende al meglio.
L'audio nativo nasce insieme al video, dialoghi multilingue inclusi, senza doverlo aggiungere e sincronizzare in seguito. Le versioni linguistiche diventano così una scelta creativa già nel prompt, senza un flusso di lavoro separato per sostituire l'audio.
La creazione e la modifica delle immagini condividono lo stesso modello del video: l'immagine che perfezioni e il fotogramma che animi provengono da un unico sistema, anziché da due sistemi solo parzialmente allineati. Per chi lavora con accessi anticipati o anteprime dei modelli, questo può ridurre la necessità di trasferire risorse tra strumenti incompleti mentre le funzionalità definitive sono ancora in evoluzione.
Un unico modello addestrato su tutte le modalità. Uno stile coerente dall'immagine al movimento fino al suono
Fino a 20 secondi in un'unica generazione. Un momento completo, non un frammento
Audio nativo durante la generazione. Dialoghi già integrati nelle immagini
Dialoghi multilingue. Un'unica ripresa, versioni in più lingue
Team stanchi di collegare un modello per immagini a uno per video e a uno strumento audio, che cercano un sistema coerente dall'inizio alla fine.
Una scena già creata con FLUX 2 su YouArt, da animare e arricchire con dialoghi: è proprio questo passaggio che FLUX 3 è progettato per eliminare. Usa un prompt per generare un video da testo se parti da un'idea, oppure un'immagine e dei fotogrammi chiave se hai già definito l'inquadratura e il peso visivo degli elementi.
Singole immagini da creare al volo, per cui FLUX 2 offre già risultati più rapidi.
Un unico modello addestrato congiuntamente mantiene il personaggio, la palette e l'illuminazione dell'immagine anche quando la scena si mette in movimento.
Abbastanza per una battuta e una reazione, anziché un frammento a cui adattare tutto il montaggio.
La generazione audio nativa elimina il passaggio di sincronizzazione che di solito separa un rendering finito da una scena completa.
Con i dialoghi multilingue, per una versione in un'altra lingua basta una nuova generazione, senza rifare le riprese.
I direttori creativi mantengono un'unica idea visiva tra immagine, ripresa in movimento e colonna sonora, senza doverla ricostruire in ogni strumento.
Gli specialisti di performance marketing creano varianti e versioni in più lingue mantenendo lo stesso stile, senza nuove riprese per ciascuna.
I registi previsualizzano scene con i dialoghi già inseriti, per valutarne il ritmo anziché immaginarlo.
I creator per i social passano da un'idea a un breve video già completo di audio, senza dover combinare più strumenti.