Una dirección visual
El entrenamiento conjunto en imagen, vídeo y audio mantiene el personaje, la paleta y la luz al pasar de una imagen a una escena en movimiento.
FLUX 3 de Black Forest Labs genera vídeo con audio nativo y diálogo multilingüe. Convierte texto, una imagen o fotogramas clave en una escena con una dirección visual coherente.
El entrenamiento conjunto en imagen, vídeo y audio mantiene el personaje, la paleta y la luz al pasar de una imagen a una escena en movimiento.
Da espacio al diálogo, las reacciones y el movimiento de cámara con hasta 20 segundos de vídeo y audio por generación.
Encadena clips en escenas más largas. Define el sujeto, la luz y la cámara en cada prompt para conectar los planos.
Define el personaje, la paleta y el encuadre con una imagen de referencia, o empieza con un prompt de texto a vídeo.
Describe la acción y el movimiento de cámara. Guía el plano con un primer fotograma, uno final o fotogramas clave.
Incluye el diálogo, el idioma y el sonido ambiente en el prompt. El audio nativo se genera con la imagen.
| Aspecto | FLUX 2 | FLUX 3 |
|---|---|---|
| Modalidades | Imágenes: texto a imagen y edición de imágenes en un solo modelo. | Imagen, video, audio y predicción de acciones en un solo modelo. |
| Video | No es un modelo de video. | Hasta 20 segundos con audio en una sola generación. |
| Audio | No disponible. | Generación de audio nativo con diálogos multilingües. |
| Arquitectura | Ajuste de flujo latente que combina un modelo de visión y lenguaje de 24B con un transformador de flujo rectificado. | Basado en Self-Flow y entrenado conjuntamente con imágenes, video y audio. |
| Disponibilidad | Ya disponible en YouArt, con modos de creación y edición. | Ya disponible en YouArt. |
YouArt ofrece FLUX 3 Video a 720p o 1080p con audio sincronizado. Para generar y editar imágenes, usa FLUX 2 o Flux Kontext.
Convierte la imagen de campaña en un anuncio de veinte segundos y crea versiones en otros idiomas con producto, paleta y mensaje coherentes.
Anima imágenes de producto con sonido, conservando la forma, el color y la textura que los compradores deben reconocer.
Previsualiza escenas con diálogo, movimiento de cámara y sonido para que el equipo pueda evaluar el ritmo.
Mantén al presentador consistente entre módulos de formación y genera versiones en otros idiomas con la misma dirección.
Un saldo de créditos para FLUX 3 Video, FLUX 2, Flux Kontext y más.
Para aficionados y exploradores
Para creadores y usuarios profesionales
Para usuarios avanzados y equipos
Para equipos y estudios
FLUX 3 es el modelo multimodal de Black Forest Labs, anunciado el 23 de julio de 2026. Integra imagen, video, audio y predicción de acciones en un único modelo entrenado conjuntamente en todas esas modalidades, en lugar de estar compuesto por sistemas independientes. Como ocurre con cualquier lanzamiento de acceso anticipado, la disponibilidad y los modos compatibles pueden cambiar; actualmente, YouArt ofrece FLUX 3 Video para generar contenido directamente.
Sí, con FLUX 2 y Flux Kontext, ambos disponibles actualmente en YouArt. FLUX 2 ofrece generación de texto a imagen y edición guiada por referencias en los modos de creación y edición, mientras que Flux Kontext permite editar mediante instrucciones a partir de una sola imagen de referencia y rellenar zonas con máscaras. No necesitas gestionar pesos de modelos por separado para usar estos flujos de trabajo en YouArt.
FLUX 2 es un modelo de imagen que combina generación de texto a imagen y edición con una o varias referencias en un único checkpoint. FLUX 3 amplía estas funciones para incluir texto a video, video, audio y predicción de acciones en un único modelo entrenado conjuntamente, y genera hasta 20 segundos de video con audio en una sola pasada.
Sí: hasta 20 segundos de video con audio en una sola generación, incluidos diálogos multilingües, además de la continuación de un video de entrada y su audio. Para crear piezas más largas, se encadenan clips en secuencias de varias tomas en lugar de alargar una sola generación.
Hasta 20 segundos en una sola generación. Para crear secuencias más largas, se encadenan clips individuales en escenas de varias tomas en lugar de prolongar una sola generación.
Todos los modelos de YouArt utilizan un sistema de créditos. FLUX 3 Video se factura según la duración, a 55 créditos por segundo. Puedes consultar los planes y el precio de cada modelo en la página de precios. Para planificar el uso de la API, compara la duración del renderizado, la resolución, las iteraciones del prompt y los requisitos del flujo de producción antes de calcular el costo por proyecto.
En las pruebas de preferencia de Black Forest Labs —resultados preliminares de un checkpoint de entrenamiento intermedio con clips de 10 segundos a 720p y con audio—, FLUX 3 fue el preferido frente a Luma Ray 3.2 en el 93 % de las comparaciones y frente a Runway Gen-4.5 en el 77 %, con márgenes más estrechos ante los competidores más potentes. Kling y FLUX 3 pueden adaptarse a distintas necesidades de generación de video, así que compara la calidad del resultado, el control mediante prompts, el movimiento, el audio y el flujo de trabajo de la API disponibles para tu proyecto. Las pruebas independientes siguen siendo limitadas.
Sí. FLUX 3 está disponible en YouArt como FLUX 3 Video: genera video a 720p o 1080p con audio nativo sincronizado a partir de un prompt, un primer fotograma para animar, un primer y último fotograma para crear el movimiento entre ambos, o hasta 10 fotogramas clave fijados en la línea de tiempo. FLUX 2 y Flux Kontext siguen siendo los modelos FLUX para imágenes.
FLUX, FLUX.2 y FLUX 3 son marcas comerciales de Black Forest Labs Inc. YouArt no está afiliado a Black Forest Labs ni cuenta con su respaldo.
Cada transferencia entre herramientas puede alterar tu estilo visual. FLUX 3 elimina esas transferencias al reunirlo todo en un solo modelo, para que lo que aprobaste en el primer fotograma siga presente en el último. Para un equipo creativo, esto implica menos cambios entre modelos, menos prompts que reescribir y un resultado más uniforme desde la imagen hasta el movimiento y el sonido.
FLUX 3 integra la generación y edición de imágenes, la conversión de texto a video, el video y el sonido en un solo modelo, en lugar de encadenar varios especialistas. Así, lo que defines en una imagen fija se mantiene en el movimiento y la mezcla de audio. La comprensión multimodal del modelo conecta la dirección visual con la sonora antes de iniciar la generación.
Hasta 20 segundos de video con audio en una sola pasada: suficiente para desarrollar una escena completa. Para piezas más largas, puedes encadenar clips en secuencias con varios planos y construir la historia mediante tomas deliberadas, en lugar de alargar una generación más allá de su duración útil.
El audio nativo se genera junto con el video, incluido el diálogo multilingüe, en lugar de añadirse después y ajustarse manualmente para sincronizarlo. Así, elegir versiones en distintos idiomas se convierte en una decisión creativa desde el prompt, no en un proceso separado de sustitución del audio.
La generación y la edición de imágenes forman parte del mismo modelo que el video, por lo que la imagen fija que perfeccionas y el fotograma que animas proceden de un único sistema, no de dos que solo coinciden parcialmente. Para quienes trabajan con acceso anticipado o versiones preliminares del modelo, esto puede reducir la necesidad de transferir recursos entre herramientas incompletas mientras evoluciona el conjunto definitivo de funciones.
Un único modelo entrenado conjuntamente. Un estilo uniforme desde la imagen fija hasta el movimiento y el sonido
Hasta 20 segundos en una sola generación. Un momento completo, no un fragmento
Audio nativo incluido en la generación. Diálogo ya integrado en la imagen
Diálogo multilingüe. Una grabación, varias versiones en distintos idiomas
Equipos cansados de conectar un modelo de imagen con uno de video y una herramienta de audio, y que buscan un sistema único y uniforme de principio a fin.
Convierte en movimiento y diálogo una escena ya creada con FLUX 2 en YouArt: FLUX 3 está diseñado precisamente para eliminar esa transferencia. Usa prompts de texto a video si partes de una idea, o una imagen fija y fotogramas clave si el encuadre y el peso visual ya están definidos.
Imágenes fijas sencillas que FLUX 2 ya puede generar con mayor rapidez.
Un único modelo entrenado conjuntamente permite conservar el personaje, la paleta y la iluminación definidos en una imagen fija cuando el plano empieza a moverse.
Tiempo suficiente para una frase y una reacción, en lugar de un fragmento que tengas que encajar durante la edición.
La generación de audio nativo elimina la fase de sincronización que normalmente separa un render terminado de una escena completa.
Gracias a los diálogos multilingües, puedes generar una versión en otro idioma sin repetir la grabación.
Los directores creativos mantienen una misma idea visual en una imagen fija, un plano en movimiento y una banda sonora, sin tener que recrearla en cada herramienta.
Los especialistas en marketing de rendimiento crean variantes y versiones en distintos idiomas con la misma estética, sin tener que volver a grabar cada una.
Los cineastas previsualizan escenas con el diálogo ya incorporado para poder evaluar el ritmo en lugar de imaginarlo.
Los creadores de contenido para redes sociales pasan de una idea a una pieza breve con sonido incluido, sin tener que combinar varias herramientas.