YouArt

Sprechendes Foto mit KI

Sprechendes Foto mit KI: Foto lippensynchron zu deinem Audio sprechen lassen

Lade ein Foto und das Audio hoch, das es sprechen soll. Das Gesicht wird lebendig und spricht deine Worte – so lange, wie das Audio läuft. Das Standardmodell kommt mit Menschen, Haustieren und Cartoonfiguren gleichermaßen zurecht.

Foto

JPEG, PNG oder WebP mit einem deutlich erkennbaren Gesicht

Audiospur

MP3, WAV oder M4A, 1 bis 60 Sekunden, bis zu 30 MB

Mach aus einem Foto ein sprechendes Video, das deinem Audio folgt. Funktioniert mit Menschen, Tieren, Cartoons und stilisierten Figuren, und der Clip ist so lang wie die Audiospur.

Abgerechnet wird pro Sekunde des fertigen Videos, auf volle Sekunden aufgerundet. Das Video ist so lang wie dein Audio. Sobald du dein Audio hinzugefügt hast, zeigt der Preis unten den genauen Gesamtbetrag.

12 Credits/s

Das sprechende Video öffnet sich in einer Sitzung, zu der du jederzeit zurückkehren kannst – bereit zum Herunterladen oder zur Weiterverwendung in einem anderen Tool.

So funktioniert’s

So lässt du ein Foto in drei Schritten sprechen

  1. Schritt 1

    Foto hochladen

    Füge ein Bild mit einem deutlich erkennbaren Gesicht hinzu: ein Porträt, ein Haustier oder eine illustrierte Figur. Das Gesicht sollte gut ausgeleuchtet und nicht verdeckt sein.

  2. Schritt 2

    Dein Audio hinzufügen

    Füge das Audio hinzu, das das Foto sprechen soll – zwischen 1 und 60 Sekunden lang: deine eigene Stimme, eine aufgenommene Nachricht oder eine generierte Stimme. Wähle anschließend ein Modell.

  3. Schritt 3

    Generieren und herunterladen

    Das sprechende Video ist so lang wie dein Audio und öffnet sich in einer Sitzung, die dir gehört – bereit zum Herunterladen oder für den nächsten Bearbeitungsschritt.

Einsatzmöglichkeiten

Was du mit sprechenden Fotos erstellen kannst

Präsentieren mit nur einem Foto

Mach aus einem Porträtfoto von dir ein kurzes Erklärvideo, eine Ankündigung oder eine Begrüßung, ohne eine Kamera aufzubauen.

Illustrierte und KI-generierte Figuren

Gib einem Maskottchen, einer illustrierten Figur oder einem KI-generierten Porträt eine Stimme – für eine Geschichte, eine Lerneinheit oder einen Social-Media-Beitrag.

Haustiere und andere Tiere

Lass ein Foto deines Hundes oder deiner Katze eine Nachricht überbringen. Beide Kling-Modelle unterstützen Tiere, auch das Standardmodell.

Ein Foto, viele Versionen

Nimm dieselbe Nachricht in mehreren Sprachen oder für verschiedene Zielgruppen auf und verwende ein einziges Foto für alle Versionen.

Bevor du startest

So gelingt ein gutes sprechendes Foto

So lang wie dein Audio

Ein Foto hat keine eigene Länge, also übernimmt das Video die Länge des Audios: sekundengenau zwischen 1 und 60 Sekunden. Genau das bezahlst du auch – kürze deshalb vorher die Stille am Anfang und am Ende des Audios.

Das richtige Foto wählen

Am besten funktioniert ein einzelnes Gesicht, der Kamera zugewandt, gut ausgeleuchtet und nicht von Händen, Haaren oder einer Sonnenbrille verdeckt. Bei mehreren Gesichtern in einem Bild ist das Ergebnis unvorhersehbar. Schneide das Bild deshalb auf die Person oder Figur zu, die sprechen soll.

Drei Modelle zur Auswahl

Kling Avatar v2 Standard ist voreingestellt: Es eignet sich für Menschen, Haustiere, Cartoons und stilisierte Figuren – zum niedrigsten Preis. Kling Avatar v2 Pro liefert schärfere Details und deutlichere Mundbewegungen zu einem höheren Preis pro Sekunde. Sync 3 Talking Photo funktioniert mit einem Foto oder einer Illustration mit einem einzigen klaren, frontalen Gesicht.

Pro Sekunde bezahlen, nicht pro Monat

Ein sprechendes Foto wird nach Sekunden des fertigen Videos abgerechnet, damit eine kurze Nachricht auch entsprechend wenig kostet. Jeder Tarif enthält Credits, die du auch für alle anderen Tools auf YouArt nutzen kannst.

Basic

Für Hobbykreative und Neugierige

$9.99/Monat
Tarif auswählen
  • 1000 Credits
  • Bis zu ca. 200 Bilder/Monat
  • Bis zu ca. 332 s Video/Monat
  • Intelligenter Kreativagent
  • Videoeditor
  • Neueste Bildmodelle, darunter GPT Image 2.5, GPT Image 2 und Nano Banana Pro
  • Neueste Videomodelle, darunter Seedance 2
  • Realistische Gesichtsbilder hochladen
  • Sprachgenerierung mit ElevenLabs
  • Ohne Wasserzeichen
  • Unbegrenzter Zugriff auf Vorlagen

Pro

Beliebt

Für Kreative und Profis

$29.99/Monat
Tarif auswählen
  • 3300 Credits
  • Bis zu ca. 1000 Bilder/Monat
  • Bis zu ca. 1100 s Video/Monat
  • Intelligenter Kreativagent
  • Videoeditor
  • Neueste Bildmodelle, darunter GPT Image 2.5, GPT Image 2 und Nano Banana Pro
  • Neueste Videomodelle, darunter Seedance 2
  • Realistische Gesichtsbilder hochladen
  • Sprachgenerierung mit ElevenLabs
  • Ohne Wasserzeichen
  • Unbegrenzter Zugriff auf Vorlagen

Max

Bestes Preis-Leistungs-Verhältnis

Für Vielnutzer und Teams

$149.99/Monat
Tarif auswählen
  • 18000 Credits
  • Bis zu ca. 6000 Bilder/Monat
  • Bis zu ca. 6000 s Video/Monat
  • Intelligenter Kreativagent
  • Videoeditor
  • Neueste Bildmodelle, darunter GPT Image 2.5, GPT Image 2 und Nano Banana Pro
  • Neueste Videomodelle, darunter Seedance 2
  • Realistische Gesichtsbilder hochladen
  • Sprachgenerierung mit ElevenLabs
  • Ohne Wasserzeichen
  • Unbegrenzter Zugriff auf Vorlagen

Team

Für Teams und Studios

$329.99/Monat
Tarif auswählen
  • 36300 Credits
  • Bis zu ca. 12000 Bilder/Monat
  • Bis zu ca. 12100 s Video/Monat
  • Realistische Gesichtsbilder hochladen
  • Leinwand, Workflows und Medien mit deinem Team teilen
  • Bis zu 10 Mitglieder pro Team
  • Bis zu 5 Teams
  • Rollenbasierte Verwaltung
  • Credits-Verwaltung und Ausgabenlimits für Teams
  • Nutzungsübersicht pro Mitglied

Fragen

Häufige Fragen zum sprechenden Foto mit KI

Ein Video, das aus einem einzigen Standbild entsteht. Du gibst ein Foto und eine Audiospur vor, und die KI animiert das Gesicht so, dass es die Worte im Audio spricht – mit Mundbewegungen, die dem Ton folgen. Das Ergebnis ist ein kurzes sprechendes Video, so lang wie dein Audio.

Mehr als ein Foto

Du brauchst mehr als ein sprechendes Foto?

Diese Seite führt jeweils einen Schritt aus. Öffne den Workflow-Editor, um das Skript im selben Workflow zu schreiben und zu vertonen, mit einem selbst generierten Porträt zu starten oder mehrere Fotos in sprechende Videos zu verwandeln.