하나로 이어지는 시각적 콘셉트
이미지, 동영상, 오디오를 함께 학습해 정지 이미지가 움직이는 장면으로 바뀌어도 캐릭터, 색감, 조명의 일관성을 유지합니다.
Black Forest Labs의 FLUX 3는 자체 생성 오디오와 다국어 대사가 포함된 AI 동영상을 생성합니다. 동영상 생성용 텍스트 프롬프트, 이미지, 키프레임을 하나의 시각적 콘셉트가 담긴 장면으로 완성하세요.
이미지, 동영상, 오디오를 함께 학습해 정지 이미지가 움직이는 장면으로 바뀌어도 캐릭터, 색감, 조명의 일관성을 유지합니다.
한 번에 최대 20초 분량의 동영상과 오디오를 생성해 대사 한마디와 그에 대한 반응, 카메라 움직임을 여유 있게 담아 보세요.
클립을 연결해 여러 숏으로 구성된 긴 장면을 만드세요. 각 프롬프트에 피사체, 조명, 카메라 방향을 구체적으로 지정하면 숏들이 자연스럽게 이어집니다.
참고 이미지로 캐릭터, 색감, 구도를 설정하거나 동영상 생성용 텍스트 프롬프트로 바로 시작하세요.
동작과 카메라 움직임을 설명하세요. 첫 프레임, 마지막 프레임, 키프레임으로 장면의 흐름을 지정할 수 있습니다.
프롬프트에 대사, 언어, 주변 소리를 포함하세요. 화면과 함께 오디오가 자체 생성됩니다.
| 비교 항목 | FLUX 2 | FLUX 3 |
|---|---|---|
| 지원 모달리티 | 이미지 — 하나의 모델에서 텍스트 기반 이미지 생성과 이미지 편집을 지원합니다. | 하나의 모델에서 이미지, 동영상, 오디오, 행동 예측을 지원합니다. |
| 동영상 | 동영상 모델이 아닙니다. | 한 번에 오디오가 포함된 최대 20초 분량의 동영상을 생성합니다. |
| 오디오 | 지원하지 않습니다. | 다국어 대사를 포함한 오디오 자체 생성을 지원합니다. |
| 아키텍처 | 잠재 공간 플로 매칭 방식으로, 240억 매개변수의 비전 언어 모델과 정류 플로 트랜스포머를 결합합니다. | Self-Flow를 기반으로 이미지, 동영상, 오디오를 함께 학습했습니다. |
| 이용 가능 여부 | 현재 YouArt에서 생성 모드와 편집 모드를 사용할 수 있습니다. | 현재 YouArt에서 사용할 수 있습니다. |
YouArt는 화면과 동기화된 오디오가 포함된 720p 또는 1080p 동영상을 생성하는 FLUX 3 Video를 제공합니다. 이미지 생성과 편집에는 FLUX 2 또는 Flux Kontext를 사용하세요.
캠페인 이미지를 20초 광고로 만들고, 제품의 모습과 색감, 메시지를 일관되게 유지하며 언어별 버전을 제작하세요.
고객이 제품을 알아보는 데 필요한 형태, 색상, 질감을 유지하면서 제품 이미지에 움직임과 사운드를 더하세요.
대사, 카메라 움직임, 사운드 타이밍까지 포함한 장면을 미리 시각화해 팀에서 전개 속도와 호흡을 확인할 수 있습니다.
여러 교육 모듈에서 발표자의 모습을 일관되게 유지하고, 같은 연출을 바탕으로 다른 언어 버전도 생성하세요.
보유한 크레딧을 FLUX 3 Video, FLUX 2, Flux Kontext 등 다양한 모델에서 공통으로 사용할 수 있습니다.
취미로 창작하거나 다양하게 시도하는 분께
크리에이터와 전문가에게
사용량이 많은 사용자와 팀에게
팀과 스튜디오에
FLUX 3는 2026년 7월 23일에 발표된 Black Forest Labs의 멀티모달 모델입니다. 별도 시스템을 조합한 것이 아니라, 이미지, 동영상, 오디오, 행동 예측을 함께 학습해 지원하는 단일 모델입니다. 얼리 액세스 출시 특성상 이용 가능 여부와 지원 모드는 달라질 수 있습니다. 현재 YouArt에서는 FLUX 3 Video로 직접 동영상을 생성할 수 있습니다.
네. 현재 YouArt에서 제공하는 FLUX 2와 Flux Kontext로 생성할 수 있습니다. FLUX 2는 생성 모드와 편집 모드에서 텍스트 기반 이미지 생성과 참고 이미지 기반 편집을 지원합니다. Flux Kontext는 참고 이미지 한 장을 바탕으로 지시에 따라 이미지를 편집하며 마스크 기반 인페인팅을 지원합니다. YouArt에서 이러한 워크플로를 사용하기 위해 모델 가중치를 별도로 관리할 필요는 없습니다.
FLUX 2는 하나의 체크포인트에서 텍스트 기반 이미지 생성과 단일·다중 참고 이미지 편집을 지원하는 이미지 모델입니다. FLUX 3는 지원 범위를 텍스트 기반 동영상 생성, 동영상, 오디오, 행동 예측으로 확장하고, 이를 하나의 모델에서 함께 학습했습니다. 한 번에 오디오가 포함된 최대 20초 분량의 동영상을 생성합니다.
네. 다국어 대사를 비롯한 오디오가 포함된 동영상을 한 번에 최대 20초까지 생성하며, 입력한 동영상과 오디오를 이어서 생성할 수도 있습니다. 더 긴 작품을 만들려면 한 번에 더 길게 생성하는 대신 여러 클립을 연결해 여러 숏으로 구성된 시퀀스를 만듭니다.
한 번에 최대 20초까지 생성할 수 있습니다. 더 긴 시퀀스를 만들려면 한 번에 더 길게 생성하는 대신 개별 클립을 연결해 여러 숏으로 구성된 장면을 만듭니다.
YouArt의 모든 모델은 크레딧 기반으로 요금이 부과됩니다. FLUX 3 Video는 동영상 길이에 따라 초당 55크레딧이 부과되며, 요금제 페이지에서 요금제와 모델별 가격을 확인할 수 있습니다. API 사용을 계획한다면 프로젝트별 비용을 추산하기 전에 렌더링할 동영상의 길이, 해상도, 프롬프트 수정 횟수, 제작 워크플로 요구 사항을 비교하세요.
Black Forest Labs가 학습 중간 체크포인트에서 오디오가 포함된 10초 길이의 720p 클립으로 진행한 자체 선호도 테스트의 예비 결과에 따르면, FLUX 3는 Luma Ray 3.2와의 비교에서 93%, Runway Gen-4.5와의 비교에서 77%의 선호도를 기록했습니다. 최상위 경쟁 모델과의 격차는 더 작았습니다. Kling과 FLUX 3는 서로 다른 동영상 생성 요구에 적합할 수 있으므로 프로젝트에 맞는 결과물 품질, 프롬프트 제어, 움직임, 오디오, 이용 가능한 API 워크플로를 비교하세요. 독립적인 테스트 결과는 아직 제한적입니다.
네. YouArt에서는 FLUX 3 Video로 제공되며, 화면에 맞는 자체 생성 오디오가 포함된 720p 또는 1080p 동영상을 생성합니다. 프롬프트만으로 시작하거나, 첫 프레임에 움직임을 더하거나, 첫 프레임과 마지막 프레임 사이의 움직임을 채우거나, 타임라인의 지정 위치에 최대 10개의 키프레임을 배치할 수 있습니다. 이미지 작업용 FLUX 모델로는 FLUX 2와 Flux Kontext를 계속 제공합니다.
FLUX, FLUX.2, FLUX 3는 Black Forest Labs Inc.의 상표입니다. YouArt는 Black Forest Labs와 제휴 관계가 없으며 해당 회사의 보증을 받지 않습니다.
도구를 옮길 때마다 시각적 스타일이 달라질 수 있습니다. FLUX 3는 이 과정을 하나의 모델로 통합해 첫 프레임에서 확정한 모습을 마지막 프레임까지 유지합니다. 제작 팀은 모델 간 이동과 프롬프트 재작성을 줄이고, 이미지부터 움직임, 사운드까지 더욱 일관된 결과를 얻을 수 있습니다.
FLUX 3는 여러 전문 모델을 연결하는 대신 이미지 생성과 편집, 텍스트 기반 동영상 생성, 동영상, 사운드를 하나의 모델에서 처리합니다. 정지 이미지에서 정한 표현이 움직임과 사운드 믹싱까지 이어집니다. 모델의 멀티모달 이해 능력이 생성 시작 전부터 시각적 연출과 오디오 연출을 연결합니다.
오디오가 포함된 동영상을 한 번에 최대 20초까지 생성해 하나의 이야기 흐름을 충분히 담습니다. 더 긴 작품은 클립을 연결해 여러 장면의 시퀀스로 구성합니다. 한 번의 생성 결과를 무리하게 늘리는 대신, 의도한 장면들을 조합해 이야기를 만들 수 있습니다.
다국어 대사를 포함한 오디오가 동영상과 함께 생성됩니다. 나중에 소리를 덧입히고 타이밍을 맞출 필요가 없습니다. 따라서 언어별 버전은 별도의 오디오 교체 워크플로 없이 프롬프트 단계에서 창작 방향에 맞춰 결정할 수 있습니다.
이미지 합성과 편집을 동영상과 같은 모델에서 처리합니다. 결과가 정확히 일치하지 않는 두 시스템을 오갈 필요 없이, 정지 이미지를 다듬고 그 프레임에 움직임을 더하는 작업을 하나의 시스템에서 진행합니다. 얼리 액세스나 모델 미리 보기 워크플로를 사용하는 경우에도, 최종 기능이 갖춰지는 동안 아직 완성되지 않은 도구들 사이에서 에셋을 옮기는 수고를 줄일 수 있습니다.
여러 모달리티를 함께 학습한 단일 모델로 정지 이미지부터 움직임, 사운드까지 일관된 표현
한 번에 최대 20초 생성. 짧은 조각을 넘어 온전한 순간까지
생성과 동시에 완성되는 오디오. 화면에 이미 맞춰진 대사
다국어 대사. 한 번 촬영해 여러 언어 버전으로 제작합니다
이미지 모델, 동영상 모델, 오디오 도구를 일일이 연결하는 번거로움 없이 처음부터 끝까지 일관된 시스템으로 작업하고 싶은 팀에 적합합니다.
YouArt에서 FLUX 2로 만든 장면에 움직임과 대사를 더하려면 도구를 전환해야 합니다. FLUX 3는 바로 이 단계를 없애도록 설계되었습니다. 아이디어에서 시작한다면 텍스트로 동영상을 생성하는 프롬프트를, 구도와 시각적 무게감이 이미 정해졌다면 정지 이미지와 키프레임을 사용하세요.
정지 이미지 한 장을 빠르게 만들려는 경우에는 FLUX 2로 더 빠르게 원하는 결과를 얻을 수 있습니다.
하나의 공동 학습 모델을 사용하므로 정지 이미지에서 설정한 캐릭터, 색감, 조명이 장면에 움직임이 생긴 뒤에도 그대로 유지됩니다.
짧은 영상 조각에 맞춰 편집할 필요 없이, 대사 한마디와 그에 대한 반응을 충분히 담을 수 있는 길이입니다.
오디오를 자체 생성하므로 렌더링이 끝난 뒤 장면을 완성하기 위해 소리를 따로 맞추는 과정이 필요하지 않습니다.
다국어 대사를 지원하므로 다른 언어 버전도 다시 촬영할 필요 없이 생성할 수 있습니다.
도구마다 시각적 콘셉트를 다시 설정할 필요 없이 정지 이미지, 움직이는 장면, 사운드트랙 전반에 하나의 콘셉트를 유지할 수 있습니다.
버전마다 다시 촬영하지 않고도 같은 시각적 스타일을 바탕으로 다양한 변형과 언어별 버전을 제작할 수 있습니다.
대사까지 포함한 장면을 미리 시각화해 전개 속도와 호흡을 상상에 맡기지 않고 직접 확인할 수 있습니다.
여러 도구를 조합할 필요 없이 아이디어를 사운드가 포함된 짧은 콘텐츠로 완성할 수 있습니다.