ya disponible

FLUX 3

Una sola generaciónHasta 20 s · con audio

Deja de construir tu flujo de trabajo con cuatro modelos diferentes. FLUX 3 es la respuesta de Black Forest Labs a un proceso en el que la herramienta de imagen no sabe qué hace la de video y ninguna puede oír el audio: un único modelo, entrenado conjuntamente con imágenes, video y sonido desde el primer paso. Una imagen fija o un prompt de texto a video se convierte en veinte segundos de movimiento con el diálogo ya sincronizado, manteniendo la misma coherencia visual de principio a fin.

Esa comprensión compartida es importante cuando necesitas que una escena transmita una sola idea en su aspecto, movimiento y sonido. Parte de un prompt claro, una imagen fija, un fotograma inicial y otro final, o una secuencia de fotogramas clave; después, deja que el modelo traslade la paleta, el personaje, la composición y la intención sonora a la generación final.

Qué cambia

Tres cambios que transforman tu forma de crear

Un solo modelo

Imagen, video y audio juntos

FLUX 3 integra la generación y edición de imágenes, la conversión de texto a video, el video y el sonido en un solo modelo, en lugar de encadenar varios especialistas. Así, lo que defines en una imagen fija se mantiene en el movimiento y la mezcla de audio. La comprensión multimodal del modelo conecta la dirección visual con la sonora antes de iniciar la generación.

Duración nativa

20 segundos en una sola generación

Hasta 20 segundos de video con audio en una sola pasada: suficiente para desarrollar una escena completa. Para piezas más largas, puedes encadenar clips en secuencias con varios planos y construir la historia mediante tomas deliberadas, en lugar de alargar una generación más allá de su duración útil.

Sonido bien integrado

Diálogo en varios idiomas

El audio nativo se genera junto con el video, incluido el diálogo multilingüe, en lugar de añadirse después y ajustarse manualmente para sincronizarlo. Así, elegir versiones en distintos idiomas se convierte en una decisión creativa desde el prompt, no en un proceso separado de sustitución del audio.

Creado para producciones reales

Por qué importa tener un único modelo multimodal

Cada transferencia entre herramientas puede alterar tu estilo visual. FLUX 3 elimina esas transferencias al reunirlo todo en un solo modelo, para que lo que aprobaste en el primer fotograma siga presente en el último. Para un equipo creativo, esto implica menos cambios entre modelos, menos prompts que reescribir y un resultado más uniforme desde la imagen hasta el movimiento y el sonido.

Desafío de producciónUn modelo diferente para cada modalidad
La ventaja de FLUX 3Un único modelo entrenado conjuntamente
Resultado concretoUn estilo uniforme desde la imagen fija hasta el movimiento y el sonido
Desafío de producciónClips demasiado cortos para desarrollar una escena
La ventaja de FLUX 3Hasta 20 segundos en una sola generación
Resultado concretoUn momento completo, no un fragmento
Desafío de producciónSonido añadido en posproducción
La ventaja de FLUX 3Audio nativo incluido en la generación
Resultado concretoDiálogo ya integrado en la imagen
Desafío de producciónCrear una nueva versión para cada mercado
La ventaja de FLUX 3Diálogo multilingüe
Resultado concretoUna grabación, varias versiones en distintos idiomas

Comprueba rápidamente si encaja contigo

Ideal para

Equipos cansados de conectar un modelo de imagen con uno de video y una herramienta de audio, y que buscan un sistema único y uniforme de principio a fin.

Por dónde empezar

Convierte en movimiento y diálogo una escena ya creada con FLUX 2 en YouArt: FLUX 3 está diseñado precisamente para eliminar esa transferencia. Usa prompts de texto a video si partes de una idea, o una imagen fija y fotogramas clave si el encuadre y el peso visual ya están definidos.

No es ideal para

Imágenes fijas sencillas que FLUX 2 ya puede generar con mayor rapidez.

Cómo funciona

Qué hace que un único modelo funcione como tal

Unir modalidades después de generarlas crea un flujo de trabajo. Entrenarlas juntas desde el principio crea un modelo que comprende como un todo el aspecto, el movimiento y el sonido de una escena. El entrenamiento conjunto de FLUX 3 permite que una decisión visual tomada durante la fase de imagen se mantenga en la acción, el ritmo, el diálogo y el sonido.

Entrenamiento conjunto

Entrenado simultáneamente con imágenes, video y audio

Un único modelo, entrenado conjuntamente con imágenes, video y audio desde el principio, no varios sistemas conectados después. Por eso un personaje definido en una imagen fija se mantiene durante el movimiento y el sonido coincide con la acción, en lugar de quedar desfasado. Su valor no reside solo en ofrecer más funciones, sino en comprender la escena de forma unificada en todas las modalidades.

Veinte segundos, una sola pasada

Duración suficiente para ser un plano de verdad

Veinte segundos de video con audio en una sola generación. Es la diferencia entre un fragmento que debes recortar y un momento capaz de incluir una línea de diálogo, una reacción y un movimiento de cámara sin cortes intermedios.

Secuencias más largas

Encadena clips en escenas con varios planos

Para piezas que superan la duración de una sola generación, puedes encadenar clips en secuencias más largas con varios planos. Así, amplías la escala organizando tomas, no forzando una generación más allá de lo conveniente. Describe con precisión el sujeto, la acción, el movimiento de cámara, la iluminación y el ritmo visual deseado para facilitar la conexión entre tomas.

Flujo de trabajo

De una imagen fija a una escena terminada

La ventaja de usar un único modelo multimodal es que cada paso parte del anterior, en lugar de empezar de nuevo con un prompt de texto. Defines la idea visual una sola vez y luego haces que se mueva y hable sin tener que reconstruir la escena en la herramienta de otra empresa ni en otro modelo independiente.

1

Todo empieza con una imagen fija

El paso que ofrece más control va primero. El personaje, la paleta, la composición, el peso visual y el encuadre se definen en un único fotograma antes de que nada empiece a moverse. Una imagen creada con cuidado proporciona a la siguiente generación una referencia visual más sólida que un prompt impreciso.

2

El fotograma cobra movimiento

Ese mismo fotograma se convierte en un video de hasta 20 segundos. Como un único modelo se encarga de ambos formatos, el estilo aprobado es el que cobra movimiento. Usa texto a video si quieres empezar sin una imagen, o parte de un fotograma inicial, uno inicial y otro final, o varios fotogramas clave si necesitas controlar mejor el movimiento.

3

Y también habla

El audio nativo y los diálogos multilingües se generan al mismo tiempo, por lo que la escena ya incluye sonido y no requiere una fase posterior de sincronización. Añade a tus prompts lo que debe decirse, el tono emocional y el entorno sonoro para que el audio forme parte de la imagen desde el principio.

Del prompt a la escena terminada

Todo lo que necesita el proceso creativo

Una pieza terminada requiere más que una primera generación: necesitas poder seguir avanzando sin perder lo que ya habías creado. FLUX 3 proporciona al proceso creativo una base común para imagen, video y audio, de modo que cada nueva acción pueda conservar la idea visual establecida anteriormente.

Continuación de video y audio

FLUX 3 puede continuar a partir de un video de entrada y su audio, prolongando el plano para mantener la coherencia del ritmo y el sonido cuando una escena necesita más tiempo del que ofreció la primera generación.

Generación y edición de imágenes

La generación y la edición de imágenes forman parte del mismo modelo que el video, por lo que la imagen fija que perfeccionas y el fotograma que animas proceden de un único sistema, no de dos que solo coinciden parcialmente. Para quienes trabajan con acceso anticipado o versiones preliminares del modelo, esto puede reducir la necesidad de transferir recursos entre herramientas incompletas mientras evoluciona el conjunto definitivo de funciones.

Creado para producción

Creado para las necesidades reales de producción

FLUX 3 se centra en los aspectos que suelen consumir más tiempo: mantener un estilo uniforme entre modalidades, obtener clips lo bastante largos para usarlos, integrar el sonido sin una fase separada y trabajar en más de un idioma.

El estilo se mantiene durante todo el proceso

Un único modelo entrenado conjuntamente permite conservar el personaje, la paleta y la iluminación definidos en una imagen fija cuando el plano empieza a moverse.

Veinte segundos dan para un plano útil

Tiempo suficiente para una frase y una reacción, en lugar de un fragmento que tengas que encajar durante la edición.

El sonido llega con la imagen

La generación de audio nativo elimina la fase de sincronización que normalmente separa un render terminado de una escena completa.

Más de un mercado

Gracias a los diálogos multilingües, puedes generar una versión en otro idioma sin repetir la grabación.

Comparación con FLUX 2

Novedades respecto a FLUX 2

Modalidades
FLUX 2Imágenes: texto a imagen y edición de imágenes en un solo modelo.
FLUX 3Imagen, video, audio y predicción de acciones en un solo modelo.
Video
FLUX 2No es un modelo de video.
FLUX 3Hasta 20 segundos con audio en una sola generación.
Audio
FLUX 2No disponible.
FLUX 3Generación de audio nativo con diálogos multilingües.
Arquitectura
FLUX 2Ajuste de flujo latente que combina un modelo de visión y lenguaje de 24B con un transformador de flujo rectificado.
FLUX 3Basado en Self-Flow y entrenado conjuntamente con imágenes, video y audio.
Disponibilidad
FLUX 2Ya disponible en YouArt, con modos de creación y edición.
FLUX 3Ya disponible en YouArt.

El video llegó primero: FLUX 3 Video ya está disponible en YouArt, a 720p o 1080p y con audio sincronizado. El costo en créditos por segundo y todas sus especificaciones están en la página del modelo. El modelo de imagen llegará después.

En distintos sectores

FLUX 3 en distintos sectores

Un único modelo que abarca imagen, video y audio transforma el trabajo de distintas maneras según lo que crees.

Publicidad digital

Las agencias crean la imagen principal de una campaña, la convierten en un anuncio de veinte segundos y lo entregan en varios idiomas sin perder la coherencia visual entre la pieza clave y las versiones cortas. Los prompts claros permiten conservar el producto, la paleta, la acción y el mensaje en distintas variantes creativas.

Comercio minorista y electrónico

Los comercios convierten una imagen fija de un producto en un video breve con sonido, manteniendo exactamente la forma y el color establecidos en la imagen. Un fotograma inicial mejor definido aporta al modelo más contexto sobre la textura, el peso visual del producto y los detalles que los compradores necesitan reconocer.

Entretenimiento y cine

Los estudios previsualizan una escena con el diálogo ya incorporado, convirtiendo el storyboard en algo que realmente puede verse y cronometrarse. FLUX 3 ayuda a los equipos de cine a probar cómo funcionan en conjunto un personaje, un movimiento de cámara, una frase y un efecto sonoro antes de iniciar una producción mayor.

Comunicación corporativa

Los equipos producen videos internos y de capacitación en los que el portavoz mantiene la misma apariencia en todos los módulos, y adaptar el contenido a otro mercado solo requiere una generación más.

Para quién es

Para quién está diseñado FLUX 3

Un único modelo para distintas modalidades resulta especialmente valioso para quienes hoy soportan la carga de trabajar con tres modelos diferentes.

Directores creativos

Los directores creativos mantienen una misma idea visual en una imagen fija, un plano en movimiento y una banda sonora, sin tener que recrearla en cada herramienta.

Especialistas en marketing de rendimiento

Los especialistas en marketing de rendimiento crean variantes y versiones en distintos idiomas con la misma estética, sin tener que volver a grabar cada una.

Cineastas

Los cineastas previsualizan escenas con el diálogo ya incorporado para poder evaluar el ritmo en lugar de imaginarlo.

Creadores de contenido para redes sociales

Los creadores de contenido para redes sociales pasan de una idea a una pieza breve con sonido incluido, sin tener que combinar varias herramientas.

Planes y precios

Genera con FLUX 2, Flux Kontext y todos los demás modelos de YouArt usando un único saldo de créditos.

Básico

Para aficionados y exploradores

$9.99/mes
Elegir plan
  • 1000 créditos
  • Hasta ~200 imágenes/mes
  • Al menos ~1000 s de video/mes
  • Agente creativo inteligente
  • Editor de video
  • Los modelos de imagen más recientes, incluidos GPT Image 2 y Nano Banana Pro
  • Los modelos de video más recientes, incluido Seedance 2
  • Carga de rostros realistas
  • Generación de voz con ElevenLabs
  • Sin marca de agua
  • Acceso ilimitado a plantillas

Pro

El más popular

Para creadores y usuarios profesionales

$29.99/mes
Elegir plan
  • 3300 créditos
  • Hasta ~1000 imágenes/mes
  • Al menos ~3300 s de video/mes
  • Agente creativo inteligente
  • Editor de video
  • Los modelos de imagen más recientes, incluidos GPT Image 2 y Nano Banana Pro
  • Los modelos de video más recientes, incluido Seedance 2
  • Carga de rostros realistas
  • Generación de voz con ElevenLabs
  • Sin marca de agua
  • Acceso ilimitado a plantillas

Max

Para usuarios avanzados y equipos

$149.99/mes
Elegir plan
  • 18000 créditos
  • Hasta ~6000 imágenes/mes
  • Al menos ~18000 s de video/mes
  • Agente creativo inteligente
  • Editor de video
  • Los modelos de imagen más recientes, incluidos GPT Image 2 y Nano Banana Pro
  • Los modelos de video más recientes, incluido Seedance 2
  • Carga de rostros realistas
  • Generación de voz con ElevenLabs
  • Sin marca de agua
  • Acceso ilimitado a plantillas

Equipo

Para equipos y estudios

$329.99/mes
Elegir plan
  • 36300 créditos
  • Hasta ~12000 imágenes/mes
  • Al menos ~36300 s de video/mes
  • Carga de rostros realistas
  • Comparte lienzos, flujos de trabajo y recursos con tu equipo
  • Hasta 10 miembros por equipo
  • Hasta 5 equipos
  • Gestión basada en roles
  • Gestión de créditos del equipo y límites de gasto
  • Seguimiento del uso por miembro

Preguntas frecuentes

Preguntas sobre FLUX 3

¿Qué es FLUX 3?
FLUX 3 es el modelo multimodal de Black Forest Labs, anunciado el 23 de julio de 2026. Integra imagen, video, audio y predicción de acciones en un único modelo entrenado conjuntamente en todas esas modalidades, en lugar de estar compuesto por sistemas independientes. Como ocurre con cualquier lanzamiento de acceso anticipado, la disponibilidad y los modos compatibles pueden cambiar; actualmente, YouArt ofrece FLUX 3 Video para generar contenido directamente.
¿Puedo generar imágenes con FLUX en YouArt ahora mismo?
Sí, con FLUX 2 y Flux Kontext, ambos disponibles actualmente en YouArt. FLUX 2 ofrece generación de texto a imagen y edición guiada por referencias en los modos de creación y edición, mientras que Flux Kontext permite editar mediante instrucciones a partir de una sola imagen de referencia y rellenar zonas con máscaras. No necesitas gestionar pesos de modelos por separado para usar estos flujos de trabajo en YouArt.
¿En qué se diferencia FLUX 3 de FLUX 2?
FLUX 2 es un modelo de imagen que combina generación de texto a imagen y edición con una o varias referencias en un único checkpoint. FLUX 3 amplía estas funciones para incluir texto a video, video, audio y predicción de acciones en un único modelo entrenado conjuntamente, y genera hasta 20 segundos de video con audio en una sola pasada.
¿FLUX 3 genera video con sonido?
Sí: hasta 20 segundos de video con audio en una sola generación, incluidos diálogos multilingües, además de la continuación de un video de entrada y su audio. Para crear piezas más largas, se encadenan clips en secuencias de varias tomas en lugar de alargar una sola generación.
¿Qué duración puede tener un video de FLUX 3?
Hasta 20 segundos en una sola generación. Para crear secuencias más largas, se encadenan clips individuales en escenas de varias tomas en lugar de prolongar una sola generación.
¿Cuánto costará FLUX 3 en YouArt?
Todos los modelos de YouArt utilizan un sistema de créditos. FLUX 3 Video se factura según la duración, a 55 créditos por segundo. Puedes consultar los planes y el precio de cada modelo en la página de precios. Para planificar el uso de la API, compara la duración del renderizado, la resolución, las iteraciones del prompt y los requisitos del flujo de producción antes de calcular el costo por proyecto.
¿Qué tan bueno es FLUX 3 en comparación con Kling?
En las pruebas de preferencia de Black Forest Labs —resultados preliminares de un checkpoint de entrenamiento intermedio con clips de 10 segundos a 720p y con audio—, FLUX 3 fue el preferido frente a Luma Ray 3.2 en el 93 % de las comparaciones y frente a Runway Gen-4.5 en el 77 %, con márgenes más estrechos ante los competidores más potentes. Kling y FLUX 3 pueden adaptarse a distintas necesidades de generación de video, así que compara la calidad del resultado, el control mediante prompts, el movimiento, el audio y el flujo de trabajo de la API disponibles para tu proyecto. Las pruebas independientes siguen siendo limitadas.
¿FLUX 3 está disponible en YouArt?
Sí. FLUX 3 está disponible en YouArt como FLUX 3 Video: genera video a 720p o 1080p con audio nativo sincronizado a partir de un prompt, un primer fotograma para animar, un primer y último fotograma para crear el movimiento entre ambos, o hasta 10 fotogramas clave fijados en la línea de tiempo. FLUX 2 y Flux Kontext siguen siendo los modelos FLUX para imágenes.

Disponible ahora

Crea con FLUX 3 en YouArt

Imagen, video y sonido en un único modelo: FLUX 3 ya está disponible en YouArt junto con FLUX 2 y Flux Kontext. Crea una escena a partir de un prompt o una imagen fija, anímala manteniendo la coherencia visual y genera el sonido y el diálogo en el mismo proceso creativo.

FLUX, FLUX.2 y FLUX 3 son marcas comerciales de Black Forest Labs Inc. YouArt no está afiliado a Black Forest Labs ni cuenta con su respaldo.