Präsentieren mit nur einem Foto
Mach aus einem Porträtfoto von dir ein kurzes Erklärvideo, eine Ankündigung oder eine Begrüßung, ohne eine Kamera aufzubauen.
Sprechendes Foto mit KI
Lade ein Foto und das Audio hoch, das es sprechen soll. Das Gesicht wird lebendig und spricht deine Worte – so lange, wie das Audio läuft. Das Standardmodell kommt mit Menschen, Haustieren und Cartoonfiguren gleichermaßen zurecht.
Mach aus einem Foto ein sprechendes Video, das deinem Audio folgt. Funktioniert mit Menschen, Tieren, Cartoons und stilisierten Figuren, und der Clip ist so lang wie die Audiospur.
Abgerechnet wird pro Sekunde des fertigen Videos, auf volle Sekunden aufgerundet. Das Video ist so lang wie dein Audio. Sobald du dein Audio hinzugefügt hast, zeigt der Preis unten den genauen Gesamtbetrag.
Das sprechende Video öffnet sich in einer Sitzung, zu der du jederzeit zurückkehren kannst – bereit zum Herunterladen oder zur Weiterverwendung in einem anderen Tool.
So funktioniert’s
Füge ein Bild mit einem deutlich erkennbaren Gesicht hinzu: ein Porträt, ein Haustier oder eine illustrierte Figur. Das Gesicht sollte gut ausgeleuchtet und nicht verdeckt sein.
Füge das Audio hinzu, das das Foto sprechen soll – zwischen 1 und 60 Sekunden lang: deine eigene Stimme, eine aufgenommene Nachricht oder eine generierte Stimme. Wähle anschließend ein Modell.
Das sprechende Video ist so lang wie dein Audio und öffnet sich in einer Sitzung, die dir gehört – bereit zum Herunterladen oder für den nächsten Bearbeitungsschritt.
Einsatzmöglichkeiten
Mach aus einem Porträtfoto von dir ein kurzes Erklärvideo, eine Ankündigung oder eine Begrüßung, ohne eine Kamera aufzubauen.
Gib einem Maskottchen, einer illustrierten Figur oder einem KI-generierten Porträt eine Stimme – für eine Geschichte, eine Lerneinheit oder einen Social-Media-Beitrag.
Lass ein Foto deines Hundes oder deiner Katze eine Nachricht überbringen. Beide Kling-Modelle unterstützen Tiere, auch das Standardmodell.
Nimm dieselbe Nachricht in mehreren Sprachen oder für verschiedene Zielgruppen auf und verwende ein einziges Foto für alle Versionen.
Bevor du startest
Ein Foto hat keine eigene Länge, also übernimmt das Video die Länge des Audios: sekundengenau zwischen 1 und 60 Sekunden. Genau das bezahlst du auch – kürze deshalb vorher die Stille am Anfang und am Ende des Audios.
Am besten funktioniert ein einzelnes Gesicht, der Kamera zugewandt, gut ausgeleuchtet und nicht von Händen, Haaren oder einer Sonnenbrille verdeckt. Bei mehreren Gesichtern in einem Bild ist das Ergebnis unvorhersehbar. Schneide das Bild deshalb auf die Person oder Figur zu, die sprechen soll.
Kling Avatar v2 Standard ist voreingestellt: Es eignet sich für Menschen, Haustiere, Cartoons und stilisierte Figuren – zum niedrigsten Preis. Kling Avatar v2 Pro liefert schärfere Details und deutlichere Mundbewegungen zu einem höheren Preis pro Sekunde. Sync 3 Talking Photo funktioniert mit einem Foto oder einer Illustration mit einem einzigen klaren, frontalen Gesicht.
Ein sprechendes Foto wird nach Sekunden des fertigen Videos abgerechnet, damit eine kurze Nachricht auch entsprechend wenig kostet. Jeder Tarif enthält Credits, die du auch für alle anderen Tools auf YouArt nutzen kannst.
Für Hobbykreative und Neugierige
Für Kreative und Profis
Für Vielnutzer und Teams
Für Teams und Studios
Fragen
Weitere Tools
Wähle ein weiteres Tool, um Bilder und Videos zu bearbeiten, zu verbessern oder umzuwandeln.
Mehr als ein Foto
Diese Seite führt jeweils einen Schritt aus. Öffne den Workflow-Editor, um das Skript im selben Workflow zu schreiben und zu vertonen, mit einem selbst generierten Porträt zu starten oder mehrere Fotos in sprechende Videos zu verwandeln.