YouArt

Photo parlante par IA

Photo parlante par IA : faire parler une photo avec votre audio

Importez une photo et l’audio qu’elle doit prononcer. Le visage s’anime et prononce vos mots sur toute la durée de l’audio. Personnes, animaux et personnages de dessin animé : tout fonctionne avec le modèle par défaut.

Photo

JPEG, PNG ou WebP avec un seul visage bien visible

Audio

MP3, WAV ou M4A, de 1 à 60 secondes, jusqu’à 30 Mo

Transformer une photo en vidéo parlante qui suit votre audio. Fonctionne avec des personnes, des animaux, des dessins animés et des personnages stylisés, et le clip dure aussi longtemps que la piste audio.

Facturation à la seconde de vidéo finale, arrondie à la seconde supérieure. La vidéo dure aussi longtemps que votre audio : le prix ci-dessous indique donc le total exact dès que votre audio est ajouté.

12 crédits/s

La vidéo parlante s’ouvre dans une session que vous pourrez retrouver, prête à être téléchargée ou utilisée dans un autre outil.

Fonctionnement

Faire parler une photo en trois étapes

  1. Étape 1

    Importer une photo

    Ajoutez une image avec un seul visage bien visible : un portrait, un animal ou un personnage illustré. Le visage doit être bien éclairé et non masqué.

  2. Étape 2

    Ajouter votre audio

    Ajoutez l’audio que la photo doit prononcer, d’une durée de 1 à 60 secondes : votre propre voix, un message enregistré ou une voix générée. Choisissez ensuite un modèle.

  3. Étape 3

    Générer et télécharger

    La vidéo parlante dure aussi longtemps que votre audio et s’ouvre dans une session qui vous appartient, prête à être téléchargée ou intégrée à un autre montage.

À quoi ça sert

Ce que l’on crée avec une photo parlante par IA

Un présentateur à partir d’une seule photo

Transformez un portrait de vous en courte vidéo explicative, en annonce ou en message de bienvenue, sans installer de caméra.

Personnages illustrés et générés par IA

Donnez une voix à une mascotte, à un personnage illustré ou à un portrait généré par IA pour une histoire, un cours ou une publication sur les réseaux sociaux.

Chiens, chats et autres animaux

Faites passer un message par la photo de votre chien ou de votre chat. Les animaux sont pris en charge par les deux modèles Kling, y compris le modèle par défaut.

Une photo, plusieurs versions

Enregistrez le même message dans plusieurs langues ou pour plusieurs publics, et réutilisez une seule photo pour chaque version.

Avant de commencer

Réussir une photo parlante

Aussi longue que votre audio

Une photo n’a pas de durée propre : la vidéo prend donc celle de l’audio, de 1 à 60 secondes, à la seconde près. C’est aussi ce que vous payez : supprimez d’abord les silences au début et à la fin de l’audio.

Choisir la bonne photo

Un seul visage, tourné vers l’objectif, bien éclairé et non masqué par des mains, des cheveux ou des lunettes de soleil : c’est ce qui fonctionne le mieux. Avec plusieurs visages sur une même image, le résultat est imprévisible : recadrez donc sur la personne ou le personnage qui doit parler.

Trois modèles au choix

Kling Avatar v2 Standard est le modèle par défaut : il gère les personnes, les animaux, les dessins animés et les personnages stylisés au prix le plus bas. Kling Avatar v2 Pro offre des détails plus nets et des mouvements de bouche plus clairs, pour un prix à la seconde plus élevé. Sync 3 — Photo parlante fonctionne sur une photo ou une illustration avec un seul visage net, de face.

Payer à la seconde, pas au mois

Une photo parlante est facturée à la seconde de vidéo finale : un message court coûte donc le prix d’un message court. Toutes les offres incluent des crédits, utilisables aussi avec tous les autres outils YouArt.

De base

Pour les amateurs et les curieux

$9.99/mois
Choisir une formule
  • 1000 crédits
  • Jusqu’à environ 200 images/mois
  • Jusqu’à environ 332 s de vidéo/mois
  • Agent créatif intelligent
  • Éditeur vidéo
  • Derniers modèles d’image, dont GPT Image 2.5, GPT Image 2 et Nano Banana Pro
  • Derniers modèles vidéo, dont Seedance 2
  • Importation de visages réalistes
  • Génération de voix avec ElevenLabs
  • Sans filigrane
  • Accès illimité aux modèles

Pro

Populaire

Pour les créateurs et les professionnels

$29.99/mois
Choisir une formule
  • 3300 crédits
  • Jusqu’à environ 1000 images/mois
  • Jusqu’à environ 1100 s de vidéo/mois
  • Agent créatif intelligent
  • Éditeur vidéo
  • Derniers modèles d’image, dont GPT Image 2.5, GPT Image 2 et Nano Banana Pro
  • Derniers modèles vidéo, dont Seedance 2
  • Importation de visages réalistes
  • Génération de voix avec ElevenLabs
  • Sans filigrane
  • Accès illimité aux modèles

Max

Meilleur rapport qualité-prix

Pour les utilisateurs avancés et les équipes

$149.99/mois
Choisir une formule
  • 18000 crédits
  • Jusqu’à environ 6000 images/mois
  • Jusqu’à environ 6000 s de vidéo/mois
  • Agent créatif intelligent
  • Éditeur vidéo
  • Derniers modèles d’image, dont GPT Image 2.5, GPT Image 2 et Nano Banana Pro
  • Derniers modèles vidéo, dont Seedance 2
  • Importation de visages réalistes
  • Génération de voix avec ElevenLabs
  • Sans filigrane
  • Accès illimité aux modèles

Équipe

Pour les équipes et les studios

$329.99/mois
Choisir une formule
  • 36300 crédits
  • Jusqu’à environ 12000 images/mois
  • Jusqu’à environ 12100 s de vidéo/mois
  • Importation de visages réalistes
  • Partager des canevas, des flux de travail et des ressources avec votre équipe
  • Jusqu’à 10 membres par équipe
  • Jusqu’à 5 équipes
  • Gestion par rôle
  • Gestion des crédits de l’équipe et plafonds de dépenses
  • Suivi de l’utilisation par membre

Questions

FAQ sur la photo parlante par IA

C’est une vidéo créée à partir d’une seule image fixe. Vous fournissez une photo et une piste audio, et l’IA anime le visage pour qu’il prononce les mots de l’audio, avec des mouvements de bouche qui suivent le son. Le résultat est une courte vidéo parlante qui dure aussi longtemps que votre audio.

Au-delà d’une seule photo

Besoin de plus d’une photo parlante ?

Cette page exécute une seule étape à la fois. Ouvrez l’éditeur de flux de travail pour écrire le script et le mettre en voix dans un même flux, partir d’un portrait que vous avez généré, ou transformer un lot de photos en vidéos parlantes.