já disponível

FLUX 3

Uma única geraçãoAté 20 s · com áudio

Pare de montar seu pipeline com quatro modelos diferentes. O FLUX 3 é a resposta da Black Forest Labs para um fluxo de trabalho em que a ferramenta de Imagem não sabe o que a ferramenta de Vídeo está fazendo, e nenhuma delas ouve o áudio: um único modelo, treinado em conjunto com imagens, vídeos e sons desde o primeiro passo. Uma Imagem estática ou um prompt de texto para vídeo se transforma em vinte segundos de movimento com o diálogo já sincronizado, mantendo a mesma lógica visual do início ao fim.

Essa compreensão compartilhada faz diferença quando uma cena precisa ter aparência, movimento e som de uma única ideia. Comece com um prompt claro, uma Imagem estática, quadros inicial e final ou uma sequência de quadros-chave; depois, use o modelo para levar a paleta, o personagem, a composição e a intenção sonora até a geração final.

O que muda

Três mudanças que transformam seu jeito de criar

Um único modelo

Imagem, vídeo e áudio juntos

O FLUX 3 reúne geração e edição de imagens, texto para vídeo, vídeo e som em um único modelo, em vez de usar uma cadeia de especialistas. Assim, o que você estabelece em uma imagem estática se mantém no movimento e na mixagem. A compreensão multimodal do modelo conecta a direção visual à sonora antes mesmo de a geração começar.

Duração nativa

20 segundos em uma única geração

Até 20 segundos de vídeo com áudio em uma única geração — tempo suficiente para desenvolver uma cena completa. Para produções mais longas, combine clipes em sequências com várias tomadas e construa a história de forma intencional, sem estender uma geração além de seu limite ideal.

Som que faz parte da cena

Diálogos em vários idiomas

O áudio nativo é gerado junto com o vídeo — incluindo diálogos em vários idiomas — em vez de ser adicionado depois e ajustado para sincronizar. Assim, criar versões em outros idiomas vira uma decisão criativa na etapa do prompt, não um fluxo separado de substituição de áudio.

Feito para produções reais

Por que um único modelo multimodal faz diferença

Cada troca de ferramenta abre espaço para o visual perder consistência. O FLUX 3 reúne essas etapas em um único modelo, preservando no último quadro o que foi aprovado no primeiro. Para equipes criativas, isso significa menos transferências entre modelos, menos prompts reescritos e resultados mais consistentes da imagem ao movimento e ao som.

Desafio da produçãoUm modelo diferente para cada modalidade
Vantagem do FLUX 3Um único modelo treinado em conjunto
Resultado concretoVisual consistente da imagem ao movimento e ao som
Desafio da produçãoClipes curtos demais para desenvolver uma cena
Vantagem do FLUX 3Até 20 segundos em uma única geração
Resultado concretoUm momento completo, não um fragmento
Desafio da produçãoSom acrescentado apenas na pós-produção
Vantagem do FLUX 3Áudio nativo junto com a geração
Resultado concretoDiálogo já integrado à imagem
Desafio da produçãoUma nova versão para cada mercado
Vantagem do FLUX 3Diálogos em vários idiomas
Resultado concretoUma produção, várias versões em outros idiomas

Veja se é ideal para você

Ideal para

Equipes cansadas de conectar um modelo de imagem a um modelo de vídeo e depois a uma ferramenta de áudio, e que querem um sistema único e consistente do início ao fim.

Por onde começar

Pegue uma cena já criada com o FLUX 2 no YouArt e dê movimento e diálogo a ela — o FLUX 3 foi criado justamente para eliminar essa troca. Use prompts de texto para vídeo ao partir de uma ideia, ou uma imagem estática e quadros-chave quando o enquadramento e o peso visual já estiverem definidos.

Não é ideal para

Imagens estáticas simples que o FLUX 2 já cria mais rapidamente.

Como funciona

O que faz um único modelo funcionar como um só

Conectar modalidades só depois da geração cria um pipeline. Treiná-las juntas desde o início cria um modelo que entende a aparência, o movimento e o som de uma cena como uma única coisa. É o treinamento conjunto do FLUX 3 que permite levar uma escolha visual feita na etapa de imagem para a ação, o ritmo, o diálogo e o som.

Treinamento conjunto

Treinado simultaneamente com imagens, vídeo e áudio

Um único modelo, treinado em conjunto com imagens, vídeo e áudio desde o início — não sistemas separados conectados posteriormente. Por isso, um personagem definido em uma imagem estática permanece consistente durante o movimento, e o som acompanha exatamente a ação. O valor não está apenas em oferecer mais recursos, mas em compartilhar uma mesma compreensão da cena entre todas as modalidades.

Vinte segundos, uma única geração

Duração suficiente para uma tomada de verdade

Vinte segundos de vídeo com áudio em uma única geração. É a diferença entre um fragmento que exige cortes e um momento capaz de incluir uma fala, uma reação e um movimento de câmera sem cortes no meio.

Sequências mais longas

Encadeie clipes em cenas com várias tomadas

Para peças que ultrapassam uma única geração, encadeie clipes em sequências mais longas com várias tomadas. Assim, você ganha escala organizando tomadas, sem tentar estender uma geração além do ideal. Especifique nos prompts o tema, a ação, o movimento de câmera, a iluminação e o ritmo visual desejado para facilitar a conexão entre as tomadas.

Fluxo de trabalho

Da imagem estática à cena final

A vantagem de um único modelo multimodal é que cada etapa aproveita a anterior, sem recomeçar com um prompt de texto. Você define a ideia visual uma vez e depois adiciona movimento e fala sem reconstruir a cena na ferramenta de outra empresa ou em outro modelo desconectado.

1

Tudo começa com uma imagem estática

A etapa com mais controle vem primeiro. Personagem, paleta, composição, peso visual e enquadramento são definidos em um único quadro antes de qualquer movimento. Uma imagem bem elaborada oferece à geração seguinte uma referência visual mais sólida do que apenas um prompt vago.

2

O quadro ganha movimento

Esse mesmo quadro se transforma em até 20 segundos de vídeo. Como um único modelo cuida das duas etapas, o visual aprovado é o mesmo que ganha movimento. Use texto para vídeo quando quiser começar sem uma imagem, ou parta de um primeiro quadro, do primeiro e do último quadros ou de quadros-chave quando precisar de mais controle sobre o movimento.

3

E ganha voz

O áudio nativo e os diálogos multilíngues são gerados junto com o vídeo, então a cena já vem com som e dispensa uma etapa de sincronização. Inclua nos prompts a fala, a emoção e o ambiente sonoro para que o áudio faça parte da imagem desde o início.

Do prompt à cena final

Tudo o que o processo criativo precisa

Uma peça finalizada exige mais do que a primeira geração — é preciso continuar sem perder o que já foi criado. O FLUX 3 oferece ao processo criativo uma base compartilhada de imagem, vídeo e áudio, permitindo que cada nova ação preserve a ideia visual definida anteriormente.

Continuação de vídeo e áudio

O FLUX 3 pode continuar a partir de um vídeo e seu áudio, prolongando a tomada para manter o ritmo e o som coerentes quando a cena precisa de mais tempo do que a primeira geração ofereceu.

Geração e edição de imagens

A síntese e a edição de imagens ficam no mesmo modelo que o vídeo. Assim, a imagem estática que você refina e o quadro que anima vêm de um único sistema, em vez de dois sistemas com resultados apenas aproximados. Para quem usa acesso antecipado ou fluxos de prévia de modelos, isso reduz a necessidade de transferir arquivos entre ferramentas incompletas enquanto o conjunto final de recursos evolui.

Feito para produção

Feito para o que a produção realmente precisa

O FLUX 3 foi criado pensando nas partes do trabalho que mais consomem tempo: manter o visual consistente entre modalidades, gerar clipes longos o bastante para usar, integrar o som sem uma etapa separada e atender a mais de um idioma.

O visual permanece consistente entre etapas

Com um único modelo treinado em conjunto, o personagem, a paleta e a iluminação definidos na imagem estática permanecem quando a tomada ganha movimento.

Vinte segundos formam uma tomada aproveitável

Tempo suficiente para uma fala e uma reação, em vez de um fragmento que exige cortes.

O som chega junto com a imagem

A geração de áudio nativo elimina a etapa de sincronização que normalmente separa uma renderização pronta de uma cena finalizada.

Mais de um mercado

Com diálogos multilíngues, criar uma versão em outro idioma exige apenas uma nova geração, não uma nova gravação.

Em comparação com o FLUX 2

O que mudou em relação ao FLUX 2

Modalidades
FLUX 2Imagens — texto para imagem e edição de imagens em um único modelo.
FLUX 3Imagem, vídeo, áudio e previsão de ações em um único modelo.
Vídeo
FLUX 2Não é um modelo de vídeo.
FLUX 3Até 20 segundos com áudio em uma única geração.
Áudio
FLUX 2Nenhum.
FLUX 3Geração de áudio nativo com diálogos multilíngues.
Arquitetura
FLUX 2Correspondência de fluxo latente, combinando um modelo de visão e linguagem de 24B com um transformador de fluxo retificado.
FLUX 3Desenvolvido com Self-Flow e treinado em conjunto com imagens, vídeo e áudio.
Disponibilidade
FLUX 2Disponível hoje no YouArt, com modos de criação e edição.
FLUX 3Disponível hoje no YouArt.

O vídeo chegou primeiro: o FLUX 3 Video já está no YouArt, em 720p ou 1080p e com áudio sincronizado. O custo em créditos por segundo e todas as especificações estão na página do modelo. O modelo de imagem vem depois.

Em vários setores

FLUX 3 em vários setores

Um único modelo que reúne imagem, vídeo e áudio transforma o trabalho de maneiras diferentes, dependendo do que você cria.

Publicidade digital

Agências criam o quadro de uma campanha, transformam-no em um anúncio de vinte segundos e entregam versões em vários idiomas, sem perder a consistência entre a imagem principal e as versões reduzidas. Prompts claros ajudam a preservar o produto, a paleta, a ação e a mensagem em diferentes variações criativas.

Varejo e e-commerce

Varejistas transformam uma imagem estática de produto em um vídeo curto com som, preservando exatamente a forma e a cor definidas na imagem. Um quadro inicial mais bem definido oferece ao modelo mais contexto sobre textura, peso visual do produto e os detalhes que os consumidores precisam reconhecer.

Entretenimento e cinema

Estúdios pré-visualizam uma cena com os diálogos já incluídos, transformando um storyboard em algo que pode ser assistido e cronometrado. O FLUX 3 ajuda equipes de cinema a testar como personagem, movimento de câmera, fala e efeito sonoro funcionam juntos antes do início de uma produção maior.

Comunicação corporativa

Equipes produzem vídeos de treinamento e comunicação interna mantendo a mesma pessoa em todos os módulos, e criar uma versão para outro mercado exige apenas mais uma geração.

Para quem é

Para quem o FLUX 3 foi criado

Um único modelo para várias modalidades faz mais diferença para quem hoje perde tempo alternando entre três ferramentas.

Diretores de criação

Diretores de criação mantêm uma única ideia visual entre uma imagem estática, uma tomada em movimento e uma trilha sonora, sem precisar recriá-la em cada ferramenta.

Profissionais de marketing de performance

Profissionais de marketing de performance criam variações e versões em outros idiomas com o mesmo visual, sem precisar de uma nova gravação para cada uma.

Cineastas

Cineastas pré-visualizam cenas com os diálogos já incluídos, permitindo avaliar o ritmo em vez de apenas imaginá-lo.

Criadores de conteúdo para redes sociais

Criadores de conteúdo para redes sociais transformam uma ideia em um vídeo curto que já vem com som, sem precisar montar uma cadeia de ferramentas.

Planos e preços

Gere com FLUX 2, Flux Kontext e todos os outros modelos do YouArt usando um único saldo de créditos.

Básico

Para entusiastas e exploradores

$9.99/mês
Selecionar plano
  • 1000 Créditos
  • Até ~200 imagens/mês
  • Pelo menos ~1000s de vídeo/mês
  • Agente criativo inteligente
  • Editor de vídeo
  • Modelos de imagem mais recentes, incluindo GPT Image 2 e Nano Banana Pro
  • Modelos de vídeo mais recentes, incluindo Seedance 2
  • Envio de fotos de rostos reais
  • Geração de voz com ElevenLabs
  • Sem marca-d'água
  • Acesso ilimitado a modelos

Pro

Mais popular

Para criadores e usuários profissionais

$29.99/mês
Selecionar plano
  • 3300 Créditos
  • Até ~1000 imagens/mês
  • Pelo menos ~3300s de vídeo/mês
  • Agente criativo inteligente
  • Editor de vídeo
  • Modelos de imagem mais recentes, incluindo GPT Image 2 e Nano Banana Pro
  • Modelos de vídeo mais recentes, incluindo Seedance 2
  • Envio de fotos de rostos reais
  • Geração de voz com ElevenLabs
  • Sem marca-d'água
  • Acesso ilimitado a modelos

Max

Para usuários avançados e equipes

$149.99/mês
Selecionar plano
  • 18000 Créditos
  • Até ~6000 imagens/mês
  • Pelo menos ~18000s de vídeo/mês
  • Agente criativo inteligente
  • Editor de vídeo
  • Modelos de imagem mais recentes, incluindo GPT Image 2 e Nano Banana Pro
  • Modelos de vídeo mais recentes, incluindo Seedance 2
  • Envio de fotos de rostos reais
  • Geração de voz com ElevenLabs
  • Sem marca-d'água
  • Acesso ilimitado a modelos

Equipe

Para equipes e estúdios

$329.99/mês
Selecionar plano
  • 36300 Créditos
  • Até ~12000 imagens/mês
  • Pelo menos ~36300s de vídeo/mês
  • Envio de fotos de rostos reais
  • Compartilhe canvas, fluxos de trabalho e recursos com sua equipe
  • Até 10 membros por equipe
  • Até 5 equipes
  • Gerenciamento por função
  • Gerenciamento de Créditos da equipe e limites de gastos
  • Monitoramento de uso por membro

Perguntas frequentes

Dúvidas sobre o FLUX 3

O que é o FLUX 3?
O FLUX 3 é o modelo multimodal da Black Forest Labs, anunciado em 23 de julho de 2026. Ele reúne imagem, vídeo, áudio e previsão de ações em um único modelo treinado conjuntamente nessas modalidades, em vez de combinar sistemas separados. Como em qualquer lançamento de acesso antecipado, a disponibilidade e os modos compatíveis podem mudar. Hoje, o YouArt oferece o FLUX 3 Video para gerar e testar na prática.
Posso gerar imagens FLUX no YouArt agora?
Sim — com FLUX 2 e Flux Kontext, ambos disponíveis hoje no YouArt. O FLUX 2 oferece texto para imagem e edição guiada por referência nos modos de criação e edição. O Flux Kontext faz edições baseadas em instruções a partir de uma única imagem de referência, com preenchimento por máscara. Você não precisa gerenciar pesos de modelos separados para usar esses fluxos de trabalho no YouArt.
Qual é a diferença entre o FLUX 3 e o FLUX 2?
O FLUX 2 é um modelo de imagem — texto para imagem e edição com uma ou várias referências em um único checkpoint. O FLUX 3 amplia isso para texto para vídeo, vídeo, áudio e previsão de ações em um único modelo treinado em conjunto, além de gerar até 20 segundos de vídeo com áudio em uma única etapa.
O FLUX 3 gera vídeos com som?
Sim — até 20 segundos de vídeo com áudio em uma única geração, incluindo diálogos multilíngues, além de continuação a partir de um vídeo e seu áudio. Para peças mais longas, os clipes são encadeados em sequências com várias tomadas, em vez de estender uma única geração.
Qual pode ser a duração de um vídeo do FLUX 3?
Até 20 segundos em uma única geração. Sequências mais longas encadeiam clipes individuais em cenas com várias tomadas, em vez de estender ainda mais uma única geração.
Quanto custa o FLUX 3 no YouArt?
Os preços usam um sistema de créditos válido para todos os modelos do YouArt. O FLUX 3 Video é cobrado por duração, a 55 créditos por segundo. Consulte os planos e preços de cada modelo na página de preços. Para planejar o uso da API, compare a duração da renderização, a resolução, as iterações de prompt e os requisitos do fluxo de produção antes de estimar o custo por projeto.
Qual é a qualidade do FLUX 3 em comparação com o Kling?
Nos testes de preferência da própria Black Forest Labs — resultados preliminares de um checkpoint intermediário, com clipes de 10 segundos em 720p e áudio — o FLUX 3 foi preferido ao Luma Ray 3.2 em 93% das comparações e ao Runway Gen-4.5 em 77%, com margens menores diante dos concorrentes mais fortes. Kling e FLUX 3 podem atender a necessidades diferentes de geração de vídeo. Compare a qualidade do resultado, o controle por prompt, o movimento, o áudio e o fluxo de API disponível para o seu projeto. Os testes independentes ainda são limitados.
O FLUX 3 está disponível no YouArt?
Sim. O FLUX 3 está disponível no YouArt como FLUX 3 Video: vídeos em 720p ou 1080p com áudio nativo sincronizado, criados apenas com um prompt, a partir de um primeiro quadro para animar, do primeiro e do último quadros para preencher o movimento entre eles ou de até 10 quadros-chave fixados na linha do tempo. FLUX 2 e Flux Kontext continuam sendo os modelos FLUX para imagens.

Disponível agora

Crie com FLUX 3 no YouArt

Imagem, vídeo e som em um único modelo — o FLUX 3 já está no YouArt, junto com FLUX 2 e Flux Kontext. Crie uma cena a partir de um prompt ou de uma imagem estática, dê movimento a ela mantendo a consistência visual e gere o som e os diálogos na mesma etapa criativa.

FLUX, FLUX.2 e FLUX 3 são marcas comerciais da Black Forest Labs Inc. O YouArt não é afiliado à Black Forest Labs nem é endossado por ela.