一つのモデル
画像・動画・音声を一つに
FLUX 3は、複数の専門モデルをつなぐのではなく、一つのモデルで画像の生成・編集、テキストからの動画生成、動画、音声を扱います。そのため、静止画で確立した表現を動きや音のミックスにも引き継げます。モデルのマルチモーダル理解により、生成前から映像と音声の演出が結び付きます。
4つの異なるモデルを組み合わせて制作パイプラインを構築する必要はありません。画像ツールは動画ツールの処理を理解せず、どちらも音声を扱えない。FLUX 3は、そんなワークフローに対するBlack Forest Labsの答えです。最初の段階から画像・動画・音声を横断して共同学習した一つのモデルに統合しています。静止画やテキストから動画を生成するプロンプトが、同期済みのセリフを含む20秒の映像になり、最後まで一貫した映像表現が保たれます。
シーン全体の見た目、動き、音を一つのアイデアとしてまとめたいとき、この共通理解が重要です。明確なプロンプト、静止画、開始・終了フレーム、キーフレームのシーケンスから始めれば、モデルが配色、キャラクター、構図、音声の意図を最終的な生成結果まで引き継ぎます。
変わること
一つのモデル
FLUX 3は、複数の専門モデルをつなぐのではなく、一つのモデルで画像の生成・編集、テキストからの動画生成、動画、音声を扱います。そのため、静止画で確立した表現を動きや音のミックスにも引き継げます。モデルのマルチモーダル理解により、生成前から映像と音声の演出が結び付きます。
標準の生成時間
一度の生成で、音声付き動画を最大20秒作成できます。一つの場面をしっかり描ける長さです。さらに長い作品では、クリップをつないで複数ショットのシーケンスを構築できます。一つの生成を無理に引き延ばすのではなく、意図を持ってショットを組み立てながらストーリーを作れます。
映像になじむ音声
多言語のセリフを含む標準音声が動画と同時に生成されます。後から音声を重ねて同期を微調整する必要はありません。言語ごとのバージョン制作を、別工程での音声差し替えではなく、プロンプト作成時のクリエイティブな選択にできます。
本格的な制作に対応
ツール間で受け渡すたびに、狙ったルックは少しずつ変化します。FLUX 3は、その受け渡しを一つのモデルに統合するため、最初のフレームで承認した要素が最後まで保たれます。制作チームにとっては、モデル間の受け渡しやプロンプトの書き直しが減り、画像から動き、音声まで一貫した結果が得られます。
最適な用途
画像モデル、動画モデル、音声ツールをつなぎ合わせる作業から解放され、最初から最後まで一貫した一つのシステムを使いたいチームに最適です。
最初に試したい用途
YouArtのFLUX 2で作成済みのシーンにセリフと動きを加える用途です。FLUX 3は、まさにこの受け渡しをなくすために設計されています。アイデアから始める場合はテキストから動画を生成するプロンプトを使い、構図や視覚的な重みが決まっている場合は静止画やキーフレームを使います。
不向きな用途
FLUX 2のほうがすばやく作成できる、単発の簡単な静止画。
仕組み
後から複数のモダリティをつなぎ合わせれば、パイプラインは作れます。しかし、最初から一緒に学習することで、シーンの見た目、動き、音を一つのものとして理解するモデルになります。FLUX 3の共同学習により、画像段階で決めたビジュアルが、動き、テンポ、セリフ、音声まで引き継がれます。
共同学習
後から別々のシステムをつなぎ合わせたのではなく、最初から画像・動画・音声を横断して共同学習した一つのモデルです。そのため、静止画で確立したキャラクターが動きの中でも維持され、音も動作のタイミングに正確に合います。価値は単に機能が増えたことだけではありません。異なるモダリティを通じて、シーンを一貫して理解できることです。
一度の生成で20秒
一度の生成で、音声付き動画を20秒作成できます。編集でつなぎ合わせる必要がある断片ではなく、途中に継ぎ目を入れず、セリフ、リアクション、カメラワークまでを一つの場面として描けます。
より長いシーケンス
一度の生成に収まらない作品では、クリップをつないで、より長い複数ショットのシーケンスを作れます。一度の生成を無理に引き延ばすのではなく、ショットを組み合わせることで作品の規模を広げられます。各ショットをつなぎやすくするため、被写体、動き、カメラワーク、照明、求める映像のリズムをプロンプトで具体的に指定してください。
ワークフロー
一つのマルチモーダルモデルを使う意義は、工程ごとにテキストプロンプトからやり直すのではなく、前の工程をそのまま引き継げることです。ビジュアルの構想を一度設定すれば、別の会社のツールや切り離されたモデルでシーンを作り直すことなく、そのまま動きやセリフを加えられます。
最もコントロールしやすい工程を最初に行います。動き始める前に、キャラクター、配色、構図、視覚的なバランス、フレーミングを一枚の画像で固めます。丁寧に作り込んだ画像は、曖昧なプロンプトだけの場合よりも、次の生成に明確なビジュアルリファレンスを与えます。
そのフレームを最大20秒の動画へ引き継げます。一つのモデルが画像と動画の両方を扱うため、承認したビジュアルがそのまま動き出します。画像なしで始める場合はテキストから動画を生成し、動きをより細かく指定したい場合は、開始フレーム、開始・終了フレーム、キーフレームを使用できます。
ネイティブ音声と多言語のセリフが動画と同時に生成されるため、後から音声を合わせる必要がなく、最初から音のあるシーンを作れます。話す動作、感情の変化、周囲の音をプロンプトに加えることで、映像に自然になじむ音声を生成できます。
プロンプトから完成シーンまで
作品を完成させるには、最初の生成だけでは足りません。すでに作り上げたものを失わずに、制作を続けられる手段が必要です。FLUX 3は、画像・動画・音声に共通する基盤を制作工程に提供し、新たな動きを加えても、それまでに確立したビジュアルの構想を維持します。
FLUX 3は、入力した動画とその音声の続きを生成できます。最初の生成より長いシーンが必要な場合でも、テンポと音の一貫性を保ちながらショットを延長できます。
画像の生成・編集と動画生成を同じモデルで行うため、調整した静止画と動画化するフレームに一貫性を持たせられます。早期アクセス版やモデルプレビュー版を使ったワークフローでも、機能が完成へ向けて進化する間、不完全なツール間で素材を移動する手間を減らせます。
本格的な制作に対応
FLUX 3は、通常最も時間がかかる作業を重視して設計されています。異なるモダリティでもビジュアルを統一すること、実用的な長さのクリップを作ること、別工程なしで音声を合わせること、複数の言語に対応することです。
共同学習した一つのモデルにより、静止画で設定したキャラクター、配色、照明が、ショットが動き出しても維持されます。
編集で補う必要がある断片ではなく、セリフとリアクションまで収められる十分な長さです。
ネイティブ音声生成により、映像のレンダリング後に通常必要となる音声の位置合わせ工程を省けます。
多言語のセリフに対応しているため、別言語版も再撮影せず、生成するだけで制作できます。
FLUX 2との比較
動画機能が先行して登場しました。FLUX 3 VideoはYouArtで利用でき、同期音声付きの720pまたは1080p動画を生成できます。1秒あたりのクレジット消費量と詳しい仕様はモデルページで確認できます。画像モデルは後日提供予定です。
さまざまな業界で活躍
画像・動画・音声を扱う一つのモデルが、制作内容に応じて仕事の進め方を変えます。
広告代理店は、キャンペーンのキービジュアルを作成し、20秒の広告へ展開して、複数言語で納品できます。キービジュアルから短縮版まで、ビジュアルの一貫性も保てます。明確なプロンプトを使えば、複数のクリエイティブ案を通じて、商品、配色、動き、メッセージを一貫して維持できます。
商品画像を、元の形状や色を正確に保ったまま、音付きの短い動画にできます。質の高い開始フレームを使うことで、質感や商品の重量感、購入者が商品を識別するための細部をモデルがより的確に把握できます。
セリフ入りのシーンをプリビジュアライゼーションし、絵コンテを実際に再生してタイミングまで確認できる形に仕上げます。FLUX 3なら、本制作に入る前に、キャラクター、カメラワーク、セリフ、効果音が一つのシーンとしてどう機能するかを検証できます。
研修動画や社内向け動画で、各コンテンツを通して登場人物の外見を統一できます。別の市場向けのバージョンも、改めて撮影せず生成するだけで制作できます。
対象ユーザー
3つのツールを行き来する手間を抱えている方にこそ、複数のモダリティを一つのモデルで扱えることが大きな価値になります。
ツールごとにビジュアルを作り直すことなく、静止画、動画、サウンドトラックを通して一貫した表現を保てます。
同じビジュアルからバリエーションや各言語版を展開でき、毎回撮影し直す必要がありません。
セリフ入りでシーンをプリビジュアライゼーションし、想像だけに頼らず実際のテンポを確認できます。
複数のツールを組み合わせることなく、アイデアから音付きの短編動画まで一気に制作できます。
一つのクレジット残高で、FLUX 2、Flux Kontextをはじめ、YouArtのすべてのモデルを使って生成できます。
趣味で楽しむ方や新しい表現を探求したい方に
クリエイターやプロユーザーに
ヘビーユーザーやチームに
チームやスタジオに
よくある質問
提供中
画像、動画、音声を一つのモデルで。FLUX 3を、FLUX 2やFlux KontextとともにYouArtで利用できるようになりました。プロンプトや静止画からシーンを作り、一貫したビジュアルを保ちながら動かし、同じ制作工程で音声とセリフも生成できます。
FLUX、FLUX.2、FLUX 3はBlack Forest Labs Inc.の商標です。YouArtはBlack Forest Labsと提携しておらず、同社による推奨や承認も受けていません。