一貫した映像の方向性
画像・動画・音声を同時に学習することで、静止画が動き出しても人物・色調・照明のつながりを保ちます。
Black Forest Labs の FLUX 3 は、ネイティブ音声と多言語の会話を備えた AI 動画を生成。テキスト・画像・キーフレームから、統一感のあるシーンを作れます。
画像・動画・音声を同時に学習することで、静止画が動き出しても人物・色調・照明のつながりを保ちます。
1 回の生成で最大 20 秒の映像と音声。会話、リアクション、カメラワークを一つの流れで描けます。
クリップをつないで長いシーンに。各プロンプトで被写体・照明・カメラを明確にし、ショットの連続性を保ちます。
参考画像で人物・色調・構図を決めるか、テキストから直接動画を作ります。
アクションとカメラの動きを記述。開始・終了フレームやキーフレームでショットを導けます。
会話・言語・環境音もプロンプトに。映像と一緒にネイティブ音声が生成されます。
| 比較項目 | FLUX 2 | FLUX 3 |
|---|---|---|
| モダリティ | 画像 — テキストからの画像生成と画像編集を一つのモデルで実行。 | 画像、動画、音声、動作予測を一つのモデルで実行。 |
| 動画 | 動画には非対応。 | 一度の生成で、音声付き動画を最大20秒生成。 |
| 音声 | 非対応。 | 多言語のセリフを含むネイティブ音声生成。 |
| アーキテクチャ | 240億パラメータの視覚言語モデルとRectified Flow Transformerを組み合わせたLatent Flow Matching。 | Self-Flowを基盤とし、画像・動画・音声を横断して共同学習。 |
| 提供状況 | YouArtで今すぐ利用可能。生成モードと編集モードに対応。 | YouArtで今すぐ利用可能。 |
YouArt の FLUX 3 Video は 720p・1080p と同期音声に対応。画像の生成・編集には FLUX 2 または Flux Kontext を使えます。
キャンペーンのキービジュアルを 20 秒の広告に。商品・色調・メッセージを保ちながら多言語版を作れます。
商品の形・色・質感を保ちながら、静止画を音付きの商品動画にできます。
会話・カメラワーク・効果音を含むシーンを可視化し、チームでテンポを確認できます。
研修動画の各章で登場人物を統一し、同じ演出から他言語版も生成できます。
FLUX 3 Video、FLUX 2、Flux Kontext などを共通のクレジットで。
趣味で楽しむ方や新しい表現を探求したい方に
クリエイターやプロユーザーに
ヘビーユーザーやチームに
チームやスタジオに
FLUX 3は、2026年7月23日に発表されたBlack Forest Labsのマルチモーダルモデルです。個別のシステムを組み合わせるのではなく、画像、動画、音声、動作予測を横断して共同学習した一つのモデルです。早期アクセス版のため、提供状況や対応モードは今後変更される可能性があります。現在、YouArtではFLUX 3 Videoを使って実際に生成できます。
はい。現在YouArtでは、FLUX 2とFlux Kontextを利用できます。FLUX 2は、生成モードと編集モードで、テキストからの画像生成と参照画像を使った編集に対応しています。Flux Kontextは、一枚の参照画像に指示を与える編集と、マスクを使ったインペインティングに対応しています。YouArtでは、これらのワークフローを利用するために個別のモデルウェイトを管理する必要はありません。
FLUX 2は、テキストからの画像生成と、単一・複数の参照画像を使った編集を一つのチェックポイントで扱う画像モデルです。FLUX 3は、テキストからの動画生成、動画、音声、動作予測までを共同学習した一つのモデルへと拡張し、一度の生成で音声付き動画を最長20秒まで作成できます。
はい。多言語のセリフを含む最長20秒の音声付き動画を一度に生成でき、入力動画とその音声の続きを作ることもできます。より長い作品では、一度の生成を引き延ばすのではなく、複数のクリップをつないでマルチショットのシーケンスを作成します。
一度の生成で最長20秒です。それより長いシーケンスは、一度の生成をさらに延長するのではなく、複数のクリップをつないでマルチショットのシーンに仕上げます。
YouArtのすべてのモデルはクレジット制です。FLUX 3 Videoは動画の長さに応じて、1秒あたり55クレジットがかかります。プランとモデル別の料金は料金ページで確認できます。APIの利用費を計画する際は、プロジェクトごとの費用を見積もる前に、レンダリング時間、解像度、プロンプトの試行回数、制作ワークフローの要件を比較してください。
Black Forest Labs独自の選好テストでは、学習途中のチェックポイントで生成した音声付き10秒・720pクリップの暫定結果として、FLUX 3はLuma Ray 3.2との比較で93%、Runway Gen-4.5との比較で77%の割合で選ばれました。最上位の競合モデルとの差は、これより小さくなっています。KlingとFLUX 3は、それぞれ異なる動画生成の用途に適している可能性があります。プロジェクトに合う出力品質、プロンプトの制御性、動き、音声、利用可能なAPIワークフローを比較してください。第三者による検証はまだ限られています。
はい。YouArtではFLUX 3 Videoとして利用でき、同期されたネイティブ音声付きの720pまたは1080p動画を生成できます。プロンプトのみ、アニメーション化する開始フレーム、動きを補間する開始・終了フレーム、またはタイムライン上に配置した最大10枚のキーフレームから生成できます。画像生成には引き続きFLUX 2とFlux Kontextを利用できます。
FLUX、FLUX.2、FLUX 3はBlack Forest Labs Inc.の商標です。YouArtはBlack Forest Labsと提携しておらず、同社による推奨や承認も受けていません。
ツール間で受け渡すたびに、狙ったルックは少しずつ変化します。FLUX 3は、その受け渡しを一つのモデルに統合するため、最初のフレームで承認した要素が最後まで保たれます。制作チームにとっては、モデル間の受け渡しやプロンプトの書き直しが減り、画像から動き、音声まで一貫した結果が得られます。
FLUX 3は、複数の専門モデルをつなぐのではなく、一つのモデルで画像の生成・編集、テキストからの動画生成、動画、音声を扱います。そのため、静止画で確立した表現を動きや音のミックスにも引き継げます。モデルのマルチモーダル理解により、生成前から映像と音声の演出が結び付きます。
一度の生成で、音声付き動画を最大20秒作成できます。一つの場面をしっかり描ける長さです。さらに長い作品では、クリップをつないで複数ショットのシーケンスを構築できます。一つの生成を無理に引き延ばすのではなく、意図を持ってショットを組み立てながらストーリーを作れます。
多言語のセリフを含む標準音声が動画と同時に生成されます。後から音声を重ねて同期を微調整する必要はありません。言語ごとのバージョン制作を、別工程での音声差し替えではなく、プロンプト作成時のクリエイティブな選択にできます。
画像の生成・編集と動画生成を同じモデルで行うため、調整した静止画と動画化するフレームに一貫性を持たせられます。早期アクセス版やモデルプレビュー版を使ったワークフローでも、機能が完成へ向けて進化する間、不完全なツール間で素材を移動する手間を減らせます。
共同学習された一つのモデル。静止画から動き、音声まで一貫した表現
一度の生成で最大20秒。断片ではなく、完結した一場面
生成時に標準音声も作成。映像に合ったセリフを最初から生成
多言語のセリフ。一度の制作で複数の言語版を展開
画像モデル、動画モデル、音声ツールをつなぎ合わせる作業から解放され、最初から最後まで一貫した一つのシステムを使いたいチームに最適です。
YouArtのFLUX 2で作成済みのシーンにセリフと動きを加える用途です。FLUX 3は、まさにこの受け渡しをなくすために設計されています。アイデアから始める場合はテキストから動画を生成するプロンプトを使い、構図や視覚的な重みが決まっている場合は静止画やキーフレームを使います。
FLUX 2のほうがすばやく作成できる、単発の簡単な静止画。
共同学習した一つのモデルにより、静止画で設定したキャラクター、配色、照明が、ショットが動き出しても維持されます。
編集で補う必要がある断片ではなく、セリフとリアクションまで収められる十分な長さです。
ネイティブ音声生成により、映像のレンダリング後に通常必要となる音声の位置合わせ工程を省けます。
多言語のセリフに対応しているため、別言語版も再撮影せず、生成するだけで制作できます。
ツールごとにビジュアルを作り直すことなく、静止画、動画、サウンドトラックを通して一貫した表現を保てます。
同じビジュアルからバリエーションや各言語版を展開でき、毎回撮影し直す必要がありません。
セリフ入りでシーンをプリビジュアライゼーションし、想像だけに頼らず実際のテンポを確認できます。
複数のツールを組み合わせることなく、アイデアから音付きの短編動画まで一気に制作できます。