YouArt

AIトーキングフォト

AIで写真を喋らせる:音声に合わせてリップシンク

写真と、しゃべらせたい音声をアップロードしてください。顔が動き出してあなたの言葉を話し、動画は音声と同じ長さになります。既定のモデルなら、人物、ペット、アニメ調のキャラクターのどれにも対応しています。

写真

JPEG・PNG・WebP、はっきりした顔が1つ写っているもの

音声

MP3・WAV・M4A、1〜60秒、30MBまで

写真を、音声に合わせて話す動画に変えます。人物、動物、アニメ、スタイライズされたキャラクターに対応し、クリップの長さは音声トラックと同じです。

完成した動画の秒数に応じた料金で、端数は1秒に切り上げます。動画は音声と同じ長さになるので、音声を追加すると下に正確な合計金額が表示されます。

12 クレジット/秒

話す動画は、あとから戻れるセッションで開き、そのままダウンロードしたり別のツールで使ったりできます。

仕組み

3ステップで写真を喋らせる

  1. ステップ 1

    写真をアップロード

    はっきりした顔が1つ写った画像を追加します。人物のポートレート、ペット、イラストのキャラクターなどです。顔が明るく写っていて、隠れていないものを選んでください。

  2. ステップ 2

    音声を追加

    写真に話させたい音声を、1〜60秒の長さで追加します。自分の声、録音したメッセージ、AIで生成した音声などです。そのあとモデルを選びます。

  3. ステップ 3

    生成してダウンロード

    話す動画は音声と同じ長さになり、あなた専用のセッションで開きます。そのままダウンロードすることも、別の編集に持ち込むこともできます。

用途

AIで写真を喋らせてできること

1枚の写真からプレゼンターを

自分の顔写真を、短い解説動画やお知らせ、ウェルカムメッセージに変えられます。カメラを準備する必要はありません。

イラストやAIのキャラクター

マスコット、イラストのキャラクター、AIで生成したポートレートに声を与えて、ストーリーやレッスン、SNS投稿に使えます。

ペットや動物

愛犬や愛猫の写真に、メッセージを伝えてもらいましょう。動物には、既定のモデルを含む2つの Kling モデルが対応しています。

1枚の写真で、いくつものバージョンを

同じメッセージを複数の言語や複数の視聴者向けに録音し、どのバージョンにも同じ写真を使い回せます。

始める前に

トーキングフォトをきれいに仕上げるコツ

長さは音声と同じ

写真にはそれ自体の長さがないので、動画は音声の長さをそのまま引き継ぎます。1〜60秒の範囲で、秒単位まで同じです。支払う料金もこの長さで決まるため、先に音声の最初と最後の無音部分をカットしておきましょう。

適した写真を選ぶ

顔が1つで、カメラの方を向き、明るく写っていて、手や髪、サングラスで隠れていない写真が最適です。1枚に複数の顔があると結果が予測できないため、話させたい人物やキャラクターだけが写るようにトリミングしてください。

3つのモデルから選べる

Kling Avatar v2 Standard が既定のモデルで、人物、ペット、アニメ調やスタイライズされたキャラクターを最も低い料金で扱えます。Kling Avatar v2 Pro は1秒あたりの料金が高いぶん、細部がより鮮明で、口の形もはっきりします。Sync 3 Talking Photo は、はっきりした正面向きの顔が1つある写真やイラストに対応します。

月額ではなく、秒単位の支払い

トーキングフォトは完成した動画の秒数で課金されるので、短いメッセージは短いメッセージなりの料金です。どのプランにもクレジットが含まれ、YouArt の他のどのツールでも使えます。

Basic

趣味で楽しむ方や新しい表現を探求したい方に

$9.99/月
プランを選択
  • 1000クレジット
  • 月に最大約200枚の画像
  • 月に最大約332秒の動画
  • 高性能なクリエイティブエージェント
  • 動画エディター
  • GPT Image 2.5、GPT Image 2、Nano Banana Proなどの最新画像モデル
  • Seedance 2などの最新動画モデル
  • 実写の顔写真をアップロード可能
  • ElevenLabsによる音声生成
  • 透かしなし
  • テンプレートを無制限に利用

Pro

人気

クリエイターやプロユーザーに

$29.99/月
プランを選択
  • 3300クレジット
  • 月に最大約1000枚の画像
  • 月に最大約1100秒の動画
  • 高性能なクリエイティブエージェント
  • 動画エディター
  • GPT Image 2.5、GPT Image 2、Nano Banana Proなどの最新画像モデル
  • Seedance 2などの最新動画モデル
  • 実写の顔写真をアップロード可能
  • ElevenLabsによる音声生成
  • 透かしなし
  • テンプレートを無制限に利用

Max

最もお得

ヘビーユーザーやチームに

$149.99/月
プランを選択
  • 18000クレジット
  • 月に最大約6000枚の画像
  • 月に最大約6000秒の動画
  • 高性能なクリエイティブエージェント
  • 動画エディター
  • GPT Image 2.5、GPT Image 2、Nano Banana Proなどの最新画像モデル
  • Seedance 2などの最新動画モデル
  • 実写の顔写真をアップロード可能
  • ElevenLabsによる音声生成
  • 透かしなし
  • テンプレートを無制限に利用

Team

チームやスタジオに

$329.99/月
プランを選択
  • 36300クレジット
  • 月に最大約12000枚の画像
  • 月に最大約12100秒の動画
  • 実写の顔写真をアップロード可能
  • キャンバス、ワークフロー、アセットをチームで共有
  • 1チームあたり最大10人
  • 最大5チーム
  • 役割に基づく管理
  • チームのクレジット管理と利用上限
  • メンバー別の利用状況を追跡

よくある質問

AIトーキングフォトのよくある質問

1枚の静止画から作る動画です。写真と音声トラックを渡すと、AIが顔を動かして音声の言葉を話させ、口の動きが音に沿って生成されます。仕上がりは、顔がしゃべる短い動画で、長さは音声と同じです。

1枚の写真の先へ

トーキングフォトを何本も作りたいですか?

このページは1回に1ステップずつ実行します。ワークフローエディタを開けば、台本の作成から音声化までを同じワークフローで行ったり、生成したポートレートから始めたり、複数の写真をまとめて話す動画に変えたりできます。