Uma direção visual
O treinamento conjunto em imagem, vídeo e áudio mantém personagem, paleta e iluminação quando uma imagem se transforma em cena.
O FLUX 3 da Black Forest Labs gera vídeo com áudio nativo e diálogo multilíngue. Transforme texto, uma imagem ou quadros-chave em uma cena com direção visual consistente.
O treinamento conjunto em imagem, vídeo e áudio mantém personagem, paleta e iluminação quando uma imagem se transforma em cena.
Dê espaço ao diálogo, às reações e ao movimento de câmera com até 20 segundos de vídeo e áudio por geração.
Conecte clipes em cenas mais longas. Defina sujeito, iluminação e câmera em cada prompt para dar continuidade aos planos.
Defina personagem, paleta e enquadramento em uma imagem de referência ou comece com um prompt de texto para vídeo.
Descreva a ação e o movimento de câmera. Use o primeiro quadro, o último ou quadros-chave para guiar o plano.
Inclua diálogo, idioma e som ambiente no prompt. O áudio nativo é gerado junto com a imagem.
| Aspecto | FLUX 2 | FLUX 3 |
|---|---|---|
| Modalidades | Imagens — texto para imagem e edição de imagens em um único modelo. | Imagem, vídeo, áudio e previsão de ações em um único modelo. |
| Vídeo | Não é um modelo de vídeo. | Até 20 segundos com áudio em uma única geração. |
| Áudio | Nenhum. | Geração de áudio nativo com diálogos multilíngues. |
| Arquitetura | Correspondência de fluxo latente, combinando um modelo de visão e linguagem de 24B com um transformador de fluxo retificado. | Desenvolvido com Self-Flow e treinado em conjunto com imagens, vídeo e áudio. |
| Disponibilidade | Disponível hoje no YouArt, com modos de criação e edição. | Disponível hoje no YouArt. |
O YouArt oferece FLUX 3 Video em 720p ou 1080p com áudio sincronizado. Para gerar e editar imagens, use FLUX 2 ou Flux Kontext.
Transforme a imagem da campanha em um anúncio de vinte segundos e crie versões em outros idiomas com produto, paleta e mensagem consistentes.
Anime fotos de produtos com som, preservando a forma, a cor e a textura que os compradores precisam reconhecer.
Pré-visualize cenas com diálogo, movimento de câmera e som para a equipe avaliar o ritmo.
Mantenha o apresentador consistente nos módulos de treinamento e gere versões em outros idiomas com a mesma direção.
Um saldo de créditos para FLUX 3 Video, FLUX 2, Flux Kontext e mais.
Para entusiastas e exploradores
Para criadores e usuários profissionais
Para usuários avançados e equipes
Para equipes e estúdios
O FLUX 3 é o modelo multimodal da Black Forest Labs, anunciado em 23 de julho de 2026. Ele reúne imagem, vídeo, áudio e previsão de ações em um único modelo treinado conjuntamente nessas modalidades, em vez de combinar sistemas separados. Como em qualquer lançamento de acesso antecipado, a disponibilidade e os modos compatíveis podem mudar. Hoje, o YouArt oferece o FLUX 3 Video para gerar e testar na prática.
Sim — com FLUX 2 e Flux Kontext, ambos disponíveis hoje no YouArt. O FLUX 2 oferece texto para imagem e edição guiada por referência nos modos de criação e edição. O Flux Kontext faz edições baseadas em instruções a partir de uma única imagem de referência, com preenchimento por máscara. Você não precisa gerenciar pesos de modelos separados para usar esses fluxos de trabalho no YouArt.
O FLUX 2 é um modelo de imagem — texto para imagem e edição com uma ou várias referências em um único checkpoint. O FLUX 3 amplia isso para texto para vídeo, vídeo, áudio e previsão de ações em um único modelo treinado em conjunto, além de gerar até 20 segundos de vídeo com áudio em uma única etapa.
Sim — até 20 segundos de vídeo com áudio em uma única geração, incluindo diálogos multilíngues, além de continuação a partir de um vídeo e seu áudio. Para peças mais longas, os clipes são encadeados em sequências com várias tomadas, em vez de estender uma única geração.
Até 20 segundos em uma única geração. Sequências mais longas encadeiam clipes individuais em cenas com várias tomadas, em vez de estender ainda mais uma única geração.
Os preços usam um sistema de créditos válido para todos os modelos do YouArt. O FLUX 3 Video é cobrado por duração, a 55 créditos por segundo. Consulte os planos e preços de cada modelo na página de preços. Para planejar o uso da API, compare a duração da renderização, a resolução, as iterações de prompt e os requisitos do fluxo de produção antes de estimar o custo por projeto.
Nos testes de preferência da própria Black Forest Labs — resultados preliminares de um checkpoint intermediário, com clipes de 10 segundos em 720p e áudio — o FLUX 3 foi preferido ao Luma Ray 3.2 em 93% das comparações e ao Runway Gen-4.5 em 77%, com margens menores diante dos concorrentes mais fortes. Kling e FLUX 3 podem atender a necessidades diferentes de geração de vídeo. Compare a qualidade do resultado, o controle por prompt, o movimento, o áudio e o fluxo de API disponível para o seu projeto. Os testes independentes ainda são limitados.
Sim. O FLUX 3 está disponível no YouArt como FLUX 3 Video: vídeos em 720p ou 1080p com áudio nativo sincronizado, criados apenas com um prompt, a partir de um primeiro quadro para animar, do primeiro e do último quadros para preencher o movimento entre eles ou de até 10 quadros-chave fixados na linha do tempo. FLUX 2 e Flux Kontext continuam sendo os modelos FLUX para imagens.
FLUX, FLUX.2 e FLUX 3 são marcas comerciais da Black Forest Labs Inc. O YouArt não é afiliado à Black Forest Labs nem é endossado por ela.
Cada troca de ferramenta abre espaço para o visual perder consistência. O FLUX 3 reúne essas etapas em um único modelo, preservando no último quadro o que foi aprovado no primeiro. Para equipes criativas, isso significa menos transferências entre modelos, menos prompts reescritos e resultados mais consistentes da imagem ao movimento e ao som.
O FLUX 3 reúne geração e edição de imagens, texto para vídeo, vídeo e som em um único modelo, em vez de usar uma cadeia de especialistas. Assim, o que você estabelece em uma imagem estática se mantém no movimento e na mixagem. A compreensão multimodal do modelo conecta a direção visual à sonora antes mesmo de a geração começar.
Até 20 segundos de vídeo com áudio em uma única geração — tempo suficiente para desenvolver uma cena completa. Para produções mais longas, combine clipes em sequências com várias tomadas e construa a história de forma intencional, sem estender uma geração além de seu limite ideal.
O áudio nativo é gerado junto com o vídeo — incluindo diálogos em vários idiomas — em vez de ser adicionado depois e ajustado para sincronizar. Assim, criar versões em outros idiomas vira uma decisão criativa na etapa do prompt, não um fluxo separado de substituição de áudio.
A síntese e a edição de imagens ficam no mesmo modelo que o vídeo. Assim, a imagem estática que você refina e o quadro que anima vêm de um único sistema, em vez de dois sistemas com resultados apenas aproximados. Para quem usa acesso antecipado ou fluxos de prévia de modelos, isso reduz a necessidade de transferir arquivos entre ferramentas incompletas enquanto o conjunto final de recursos evolui.
Um único modelo treinado em conjunto. Visual consistente da imagem ao movimento e ao som
Até 20 segundos em uma única geração. Um momento completo, não um fragmento
Áudio nativo junto com a geração. Diálogo já integrado à imagem
Diálogos em vários idiomas. Uma produção, várias versões em outros idiomas
Equipes cansadas de conectar um modelo de imagem a um modelo de vídeo e depois a uma ferramenta de áudio, e que querem um sistema único e consistente do início ao fim.
Pegue uma cena já criada com o FLUX 2 no YouArt e dê movimento e diálogo a ela — o FLUX 3 foi criado justamente para eliminar essa troca. Use prompts de texto para vídeo ao partir de uma ideia, ou uma imagem estática e quadros-chave quando o enquadramento e o peso visual já estiverem definidos.
Imagens estáticas simples que o FLUX 2 já cria mais rapidamente.
Com um único modelo treinado em conjunto, o personagem, a paleta e a iluminação definidos na imagem estática permanecem quando a tomada ganha movimento.
Tempo suficiente para uma fala e uma reação, em vez de um fragmento que exige cortes.
A geração de áudio nativo elimina a etapa de sincronização que normalmente separa uma renderização pronta de uma cena finalizada.
Com diálogos multilíngues, criar uma versão em outro idioma exige apenas uma nova geração, não uma nova gravação.
Diretores de criação mantêm uma única ideia visual entre uma imagem estática, uma tomada em movimento e uma trilha sonora, sem precisar recriá-la em cada ferramenta.
Profissionais de marketing de performance criam variações e versões em outros idiomas com o mesmo visual, sem precisar de uma nova gravação para cada uma.
Cineastas pré-visualizam cenas com os diálogos já incluídos, permitindo avaliar o ritmo em vez de apenas imaginá-lo.
Criadores de conteúdo para redes sociais transformam uma ideia em um vídeo curto que já vem com som, sem precisar montar uma cadeia de ferramentas.