提供開始

FLUX 3

一度の生成最大20秒・音声付き

4つの異なるモデルを組み合わせて制作パイプラインを構築する必要はありません。画像ツールは動画ツールの処理を理解せず、どちらも音声を扱えない。FLUX 3は、そんなワークフローに対するBlack Forest Labsの答えです。最初の段階から画像・動画・音声を横断して共同学習した一つのモデルに統合しています。静止画やテキストから動画を生成するプロンプトが、同期済みのセリフを含む20秒の映像になり、最後まで一貫した映像表現が保たれます。

シーン全体の見た目、動き、音を一つのアイデアとしてまとめたいとき、この共通理解が重要です。明確なプロンプト、静止画、開始・終了フレーム、キーフレームのシーケンスから始めれば、モデルが配色、キャラクター、構図、音声の意図を最終的な生成結果まで引き継ぎます。

変わること

制作方法を変える3つの進化

一つのモデル

画像・動画・音声を一つに

FLUX 3は、複数の専門モデルをつなぐのではなく、一つのモデルで画像の生成・編集、テキストからの動画生成、動画、音声を扱います。そのため、静止画で確立した表現を動きや音のミックスにも引き継げます。モデルのマルチモーダル理解により、生成前から映像と音声の演出が結び付きます。

標準の生成時間

一度の生成で20秒

一度の生成で、音声付き動画を最大20秒作成できます。一つの場面をしっかり描ける長さです。さらに長い作品では、クリップをつないで複数ショットのシーケンスを構築できます。一つの生成を無理に引き延ばすのではなく、意図を持ってショットを組み立てながらストーリーを作れます。

映像になじむ音声

多言語のセリフ

多言語のセリフを含む標準音声が動画と同時に生成されます。後から音声を重ねて同期を微調整する必要はありません。言語ごとのバージョン制作を、別工程での音声差し替えではなく、プロンプト作成時のクリエイティブな選択にできます。

本格的な制作に対応

一つのマルチモーダルモデルが重要な理由

ツール間で受け渡すたびに、狙ったルックは少しずつ変化します。FLUX 3は、その受け渡しを一つのモデルに統合するため、最初のフレームで承認した要素が最後まで保たれます。制作チームにとっては、モデル間の受け渡しやプロンプトの書き直しが減り、画像から動き、音声まで一貫した結果が得られます。

制作上の課題モダリティごとに異なるモデルが必要
FLUX 3の強み共同学習された一つのモデル
得られる成果静止画から動き、音声まで一貫した表現
制作上の課題一つの場面を描くには短すぎるクリップ
FLUX 3の強み一度の生成で最大20秒
得られる成果断片ではなく、完結した一場面
制作上の課題ポストプロダクションで後付けする音声
FLUX 3の強み生成時に標準音声も作成
得られる成果映像に合ったセリフを最初から生成
制作上の課題市場ごとにバージョンを作り直し
FLUX 3の強み多言語のセリフ
得られる成果一度の制作で複数の言語版を展開

かんたん適性チェック

最適な用途

画像モデル、動画モデル、音声ツールをつなぎ合わせる作業から解放され、最初から最後まで一貫した一つのシステムを使いたいチームに最適です。

最初に試したい用途

YouArtのFLUX 2で作成済みのシーンにセリフと動きを加える用途です。FLUX 3は、まさにこの受け渡しをなくすために設計されています。アイデアから始める場合はテキストから動画を生成するプロンプトを使い、構図や視覚的な重みが決まっている場合は静止画やキーフレームを使います。

不向きな用途

FLUX 2のほうがすばやく作成できる、単発の簡単な静止画。

仕組み

一つのモデルとして機能する理由

後から複数のモダリティをつなぎ合わせれば、パイプラインは作れます。しかし、最初から一緒に学習することで、シーンの見た目、動き、音を一つのものとして理解するモデルになります。FLUX 3の共同学習により、画像段階で決めたビジュアルが、動き、テンポ、セリフ、音声まで引き継がれます。

共同学習

画像・動画・音声を同時に学習

後から別々のシステムをつなぎ合わせたのではなく、最初から画像・動画・音声を横断して共同学習した一つのモデルです。そのため、静止画で確立したキャラクターが動きの中でも維持され、音も動作のタイミングに正確に合います。価値は単に機能が増えたことだけではありません。異なるモダリティを通じて、シーンを一貫して理解できることです。

一度の生成で20秒

一つのショットとして使える長さ

一度の生成で、音声付き動画を20秒作成できます。編集でつなぎ合わせる必要がある断片ではなく、途中に継ぎ目を入れず、セリフ、リアクション、カメラワークまでを一つの場面として描けます。

より長いシーケンス

クリップをつないで複数ショットのシーンに

一度の生成に収まらない作品では、クリップをつないで、より長い複数ショットのシーケンスを作れます。一度の生成を無理に引き延ばすのではなく、ショットを組み合わせることで作品の規模を広げられます。各ショットをつなぎやすくするため、被写体、動き、カメラワーク、照明、求める映像のリズムをプロンプトで具体的に指定してください。

ワークフロー

静止画から完成シーンまで

一つのマルチモーダルモデルを使う意義は、工程ごとにテキストプロンプトからやり直すのではなく、前の工程をそのまま引き継げることです。ビジュアルの構想を一度設定すれば、別の会社のツールや切り離されたモデルでシーンを作り直すことなく、そのまま動きやセリフを加えられます。

1

静止画から始める

最もコントロールしやすい工程を最初に行います。動き始める前に、キャラクター、配色、構図、視覚的なバランス、フレーミングを一枚の画像で固めます。丁寧に作り込んだ画像は、曖昧なプロンプトだけの場合よりも、次の生成に明確なビジュアルリファレンスを与えます。

2

フレームが動き出す

そのフレームを最大20秒の動画へ引き継げます。一つのモデルが画像と動画の両方を扱うため、承認したビジュアルがそのまま動き出します。画像なしで始める場合はテキストから動画を生成し、動きをより細かく指定したい場合は、開始フレーム、開始・終了フレーム、キーフレームを使用できます。

3

さらに、言葉を話す

ネイティブ音声と多言語のセリフが動画と同時に生成されるため、後から音声を合わせる必要がなく、最初から音のあるシーンを作れます。話す動作、感情の変化、周囲の音をプロンプトに加えることで、映像に自然になじむ音声を生成できます。

プロンプトから完成シーンまで

クリエイティブ制作に必要なすべて

作品を完成させるには、最初の生成だけでは足りません。すでに作り上げたものを失わずに、制作を続けられる手段が必要です。FLUX 3は、画像・動画・音声に共通する基盤を制作工程に提供し、新たな動きを加えても、それまでに確立したビジュアルの構想を維持します。

動画と音声の続きを生成

FLUX 3は、入力した動画とその音声の続きを生成できます。最初の生成より長いシーンが必要な場合でも、テンポと音の一貫性を保ちながらショットを延長できます。

画像の生成と編集

画像の生成・編集と動画生成を同じモデルで行うため、調整した静止画と動画化するフレームに一貫性を持たせられます。早期アクセス版やモデルプレビュー版を使ったワークフローでも、機能が完成へ向けて進化する間、不完全なツール間で素材を移動する手間を減らせます。

本格的な制作に対応

実際の制作現場に必要な機能を搭載

FLUX 3は、通常最も時間がかかる作業を重視して設計されています。異なるモダリティでもビジュアルを統一すること、実用的な長さのクリップを作ること、別工程なしで音声を合わせること、複数の言語に対応することです。

工程が変わってもビジュアルを維持

共同学習した一つのモデルにより、静止画で設定したキャラクター、配色、照明が、ショットが動き出しても維持されます。

20秒だから実用的なショットに

編集で補う必要がある断片ではなく、セリフとリアクションまで収められる十分な長さです。

映像と同時に音声も生成

ネイティブ音声生成により、映像のレンダリング後に通常必要となる音声の位置合わせ工程を省けます。

複数の市場へ展開

多言語のセリフに対応しているため、別言語版も再撮影せず、生成するだけで制作できます。

FLUX 2との比較

FLUX 2から進化したポイント

モダリティ
FLUX 2画像 — テキストからの画像生成と画像編集を一つのモデルで実行。
FLUX 3画像、動画、音声、動作予測を一つのモデルで実行。
動画
FLUX 2動画には非対応。
FLUX 3一度の生成で、音声付き動画を最大20秒生成。
音声
FLUX 2非対応。
FLUX 3多言語のセリフを含むネイティブ音声生成。
アーキテクチャ
FLUX 2240億パラメータの視覚言語モデルとRectified Flow Transformerを組み合わせたLatent Flow Matching。
FLUX 3Self-Flowを基盤とし、画像・動画・音声を横断して共同学習。
提供状況
FLUX 2YouArtで今すぐ利用可能。生成モードと編集モードに対応。
FLUX 3YouArtで今すぐ利用可能。

動画機能が先行して登場しました。FLUX 3 VideoはYouArtで利用でき、同期音声付きの720pまたは1080p動画を生成できます。1秒あたりのクレジット消費量と詳しい仕様はモデルページで確認できます。画像モデルは後日提供予定です。

さまざまな業界で活躍

業界別に見るFLUX 3

画像・動画・音声を扱う一つのモデルが、制作内容に応じて仕事の進め方を変えます。

デジタル広告

広告代理店は、キャンペーンのキービジュアルを作成し、20秒の広告へ展開して、複数言語で納品できます。キービジュアルから短縮版まで、ビジュアルの一貫性も保てます。明確なプロンプトを使えば、複数のクリエイティブ案を通じて、商品、配色、動き、メッセージを一貫して維持できます。

小売・EC

商品画像を、元の形状や色を正確に保ったまま、音付きの短い動画にできます。質の高い開始フレームを使うことで、質感や商品の重量感、購入者が商品を識別するための細部をモデルがより的確に把握できます。

エンターテインメント・映画

セリフ入りのシーンをプリビジュアライゼーションし、絵コンテを実際に再生してタイミングまで確認できる形に仕上げます。FLUX 3なら、本制作に入る前に、キャラクター、カメラワーク、セリフ、効果音が一つのシーンとしてどう機能するかを検証できます。

企業コミュニケーション

研修動画や社内向け動画で、各コンテンツを通して登場人物の外見を統一できます。別の市場向けのバージョンも、改めて撮影せず生成するだけで制作できます。

対象ユーザー

FLUX 3はこんな方におすすめ

3つのツールを行き来する手間を抱えている方にこそ、複数のモダリティを一つのモデルで扱えることが大きな価値になります。

クリエイティブディレクター

ツールごとにビジュアルを作り直すことなく、静止画、動画、サウンドトラックを通して一貫した表現を保てます。

パフォーマンスマーケター

同じビジュアルからバリエーションや各言語版を展開でき、毎回撮影し直す必要がありません。

映像制作者

セリフ入りでシーンをプリビジュアライゼーションし、想像だけに頼らず実際のテンポを確認できます。

SNSクリエイター

複数のツールを組み合わせることなく、アイデアから音付きの短編動画まで一気に制作できます。

プランと料金

一つのクレジット残高で、FLUX 2、Flux Kontextをはじめ、YouArtのすべてのモデルを使って生成できます。

Basic

趣味で楽しむ方や新しい表現を探求したい方に

$9.99/月
プランを選択
  • 1000クレジット
  • 月に最大約200枚の画像
  • 月に約1000秒以上の動画
  • 高性能なクリエイティブエージェント
  • 動画エディター
  • GPT Image 2、Nano Banana Proなどの最新画像モデル
  • Seedance 2などの最新動画モデル
  • 実写の顔写真をアップロード可能
  • ElevenLabsによる音声生成
  • 透かしなし
  • テンプレートを無制限に利用

Pro

一番人気

クリエイターやプロユーザーに

$29.99/月
プランを選択
  • 3300クレジット
  • 月に最大約1000枚の画像
  • 月に約3300秒以上の動画
  • 高性能なクリエイティブエージェント
  • 動画エディター
  • GPT Image 2、Nano Banana Proなどの最新画像モデル
  • Seedance 2などの最新動画モデル
  • 実写の顔写真をアップロード可能
  • ElevenLabsによる音声生成
  • 透かしなし
  • テンプレートを無制限に利用

Max

ヘビーユーザーやチームに

$149.99/月
プランを選択
  • 18000クレジット
  • 月に最大約6000枚の画像
  • 月に約18000秒以上の動画
  • 高性能なクリエイティブエージェント
  • 動画エディター
  • GPT Image 2、Nano Banana Proなどの最新画像モデル
  • Seedance 2などの最新動画モデル
  • 実写の顔写真をアップロード可能
  • ElevenLabsによる音声生成
  • 透かしなし
  • テンプレートを無制限に利用

Team

チームやスタジオに

$329.99/月
プランを選択
  • 36300クレジット
  • 月に最大約12000枚の画像
  • 月に約36300秒以上の動画
  • 実写の顔写真をアップロード可能
  • キャンバス、ワークフロー、アセットをチームで共有
  • 1チームあたり最大10人
  • 最大5チーム
  • 役割に基づく管理
  • チームのクレジット管理と利用上限
  • メンバー別の利用状況を追跡

よくある質問

FLUX 3について

FLUX 3とは何ですか?
FLUX 3は、2026年7月23日に発表されたBlack Forest Labsのマルチモーダルモデルです。個別のシステムを組み合わせるのではなく、画像、動画、音声、動作予測を横断して共同学習した一つのモデルです。早期アクセス版のため、提供状況や対応モードは今後変更される可能性があります。現在、YouArtではFLUX 3 Videoを使って実際に生成できます。
YouArtですぐにFLUXの画像を生成できますか?
はい。現在YouArtでは、FLUX 2とFlux Kontextを利用できます。FLUX 2は、生成モードと編集モードで、テキストからの画像生成と参照画像を使った編集に対応しています。Flux Kontextは、一枚の参照画像に指示を与える編集と、マスクを使ったインペインティングに対応しています。YouArtでは、これらのワークフローを利用するために個別のモデルウェイトを管理する必要はありません。
FLUX 3とFLUX 2の違いは何ですか?
FLUX 2は、テキストからの画像生成と、単一・複数の参照画像を使った編集を一つのチェックポイントで扱う画像モデルです。FLUX 3は、テキストからの動画生成、動画、音声、動作予測までを共同学習した一つのモデルへと拡張し、一度の生成で音声付き動画を最長20秒まで作成できます。
FLUX 3は音声付き動画を生成できますか?
はい。多言語のセリフを含む最長20秒の音声付き動画を一度に生成でき、入力動画とその音声の続きを作ることもできます。より長い作品では、一度の生成を引き延ばすのではなく、複数のクリップをつないでマルチショットのシーケンスを作成します。
FLUX 3では最長何秒の動画を生成できますか?
一度の生成で最長20秒です。それより長いシーケンスは、一度の生成をさらに延長するのではなく、複数のクリップをつないでマルチショットのシーンに仕上げます。
YouArtでFLUX 3を使うといくらかかりますか?
YouArtのすべてのモデルはクレジット制です。FLUX 3 Videoは動画の長さに応じて、1秒あたり55クレジットがかかります。プランとモデル別の料金は料金ページで確認できます。APIの利用費を計画する際は、プロジェクトごとの費用を見積もる前に、レンダリング時間、解像度、プロンプトの試行回数、制作ワークフローの要件を比較してください。
FLUX 3の品質はKlingと比べてどうですか?
Black Forest Labs独自の選好テストでは、学習途中のチェックポイントで生成した音声付き10秒・720pクリップの暫定結果として、FLUX 3はLuma Ray 3.2との比較で93%、Runway Gen-4.5との比較で77%の割合で選ばれました。最上位の競合モデルとの差は、これより小さくなっています。KlingとFLUX 3は、それぞれ異なる動画生成の用途に適している可能性があります。プロジェクトに合う出力品質、プロンプトの制御性、動き、音声、利用可能なAPIワークフローを比較してください。第三者による検証はまだ限られています。
FLUX 3はYouArtで利用できますか?
はい。YouArtではFLUX 3 Videoとして利用でき、同期されたネイティブ音声付きの720pまたは1080p動画を生成できます。プロンプトのみ、アニメーション化する開始フレーム、動きを補間する開始・終了フレーム、またはタイムライン上に配置した最大10枚のキーフレームから生成できます。画像生成には引き続きFLUX 2とFlux Kontextを利用できます。

提供中

YouArtでFLUX 3を使って制作

画像、動画、音声を一つのモデルで。FLUX 3を、FLUX 2やFlux KontextとともにYouArtで利用できるようになりました。プロンプトや静止画からシーンを作り、一貫したビジュアルを保ちながら動かし、同じ制作工程で音声とセリフも生成できます。

FLUX、FLUX.2、FLUX 3はBlack Forest Labs Inc.の商標です。YouArtはBlack Forest Labsと提携しておらず、同社による推奨や承認も受けていません。