Talking Head

Präsentationsvideo

Erstelle einen KI-Talking Head aus einem Porträt und einem Skript

Ein KI-Talking Head kann ein unbewegtes Gesicht so erscheinen lassen, als würde es eine gesprochene Botschaft übermitteln. Beginne mit einem klaren Porträt und einem kurzen Skript. Prüfe anschließend Stimme, Mundbewegungen und Bildausschnitt, bevor du das Video teilst.

Prüfe das Ergebnis, bevor du es teilst
Talking Head-Illustration für die Landingpage mit einem Sprechervideo

Dieser Einstieg im Vergleich zum allgemeinen Einstieg

Ein gefilmter Talking Head-Clip zeigt eine Person beim Sprechen. Der KI-Weg beginnt mit Ausgangsmaterial und erzeugt daraus einen Auftritt. Die folgenden Links unterscheiden diesen Weg von verwandten Formaten.

Die drei Besonderheiten dieses Wegs

Das sind die wesentlichen Unterschiede zur einfachen Aufnahme einer Person vor der Kamera – keine Garantie dafür, dass jeder generierte Clip natürlich aussieht.

  1. 1

    Ein unbewegtes Gesicht animieren

    Verwende ein geeignetes Porträt als visuellen Ausgangspunkt. Das System schätzt Veränderungen von Gesichtsausdruck und Mundform, statt einen Live-Auftritt aufzunehmen.

  2. 2

    Text in einen gesprochenen Vortrag verwandeln

    Gib den Text ein, den die präsentierende Person sprechen soll, und wähle, sofern verfügbar, eine Stimme aus. Kurze Sätze und leicht auszusprechende Namen machen es einfacher, das erste Ergebnis zu beurteilen.

  3. 3

    Überarbeiten ohne erneuten Dreh

    Ändere eine Zeile und generiere eine weitere Version, statt die sprechende Person erneut vor die Kamera zu holen. Sieh dir den neuen Clip vollständig an: Eine Skriptänderung kann das Sprechtempo und die Lippensynchronität verändern.

So fängst du an

Wähle dein Ausgangsmaterial, bevor du ein langes Skript schreibst. Dieser Vergleich zeigt, was sich ändert, wenn du ein Präsentationsvideo generierst, statt eine Person zu filmen.

1

Bildquelle

Gefilmtes Talking Head-Video

Eine Person, die bei der Aufnahme anwesend ist

KI-generiertes Moderatorenvideo

Ein Porträt oder ein unterstütztes Bild der präsentierenden Person

2

Sprachquelle

Gefilmtes Talking Head-Video

Die aufgezeichnete Stimme der sprechenden Person

KI-generiertes Moderatorenvideo

Ein bereitgestelltes Skript mit generiertem oder unterstütztem Audio

3

Erste Vorbereitung

Gefilmtes Talking Head-Video

Kamera, Licht und Mikrofon einrichten

KI-generiertes Moderatorenvideo

Ein deutliches Gesichtsbild auswählen und ein kurzes Skript schreiben

4

Einen Satz ändern

Gefilmtes Talking Head-Video

Die sprechende Person muss den Satz in der Regel neu aufnehmen

KI-generiertes Moderatorenvideo

Das Skript bearbeiten und eine neue Aufnahme generieren

5

Menschliche Darbietung

Gefilmtes Talking Head-Video

Erfasst die tatsächlichen Gesten und das Timing der sprechenden Person

KI-generiertes Moderatorenvideo

Schätzt Ausdruck und Timing anhand der Eingaben

6

Wichtigste erste Prüfung

Gefilmtes Talking Head-Video

Auf klaren Ton achten und den Bildausschnitt prüfen

KI-generiertes Moderatorenvideo

Aussprache, Einwilligung und Synchronität von Mundbewegungen und Ton prüfen

Was sich zwischen dem Ausgangsbild und dem Clip verändert

  • Porträtvorlage
  • Konzept für ein Moderatorenvideo

Dies sind illustrative Bilder auf der Seite, kein verifizierter Vorher-nachher-Vergleich einer Generierung. Prüfen Sie bei einem tatsächlichen Ergebnis die Übergänge zwischen Lauten und nicht nur einzelne Bilder.

Illustration eines Porträts, das als Vorlage für einen Sprecher ausgewählt wurde
Illustration eines KI-generierten sprechenden Präsentators

Grenzen, die Sie vor dem Teilen prüfen sollten

Ein überzeugendes Einzelbild bedeutet noch kein überzeugendes Video. Prüfen Sie Bewegungen, Sprache und Einwilligung getrennt.

  • Es kann keine Einwilligung nachweisen

    Dass ein Gesichtsbild technisch verwendbar ist, bedeutet nicht, dass die abgebildete Person zugestimmt hat, sprechend dargestellt zu werden. Lassen Sie eine reale Person nicht so erscheinen, als würde sie Aussagen befürworten, denen sie nicht zugestimmt hat.

    AbhilfeVerwenden Sie ein eigenes Bild oder holen Sie eine ausdrückliche Einwilligung für das Porträt, den Text und die beabsichtigte Verwendung ein.

  • Es kann keine natürlich klingende Sprache garantieren

    Namen, Akronyme, Pausen und emotionale Betonungen können unnatürlich klingen; zudem können Lippen oder Zähne bei bestimmten Lauten unstimmig wirken.

    AbhilfeSchreiben Sie einen kurzen Testsatz mit den schwierigen Wörtern, hören Sie genau hin und überarbeiten Sie ihn, bevor Sie einen längeren Clip erstellen.

  • Es kann nicht jedes Ausgangsporträt ausgleichen

    Verdeckte Lippen, harte Schatten, ein sehr kleines Gesicht oder ein extremer Blickwinkel liefern weniger verlässliche Informationen für die Animation.

    AbhilfeBeginnen Sie mit einem gut beleuchteten, frontal aufgenommenen Bild, auf dem das gesamte Gesicht zu sehen ist.

  • Es kann keine echte persönliche Empfehlung ersetzen

    Eine generierte Präsentation ist kein Beleg dafür, dass eine Person die Worte im Text gesagt, erlebt oder geglaubt hat.

    AlternativeNehmen Sie die Person selbst auf, wenn ihr Bericht aus erster Hand im Mittelpunkt des Videos steht.

Probieren Sie einen kurzen Sprechertext aus

Erstellen Sie einen ersten Clip, den Sie prüfen können

Wählen Sie ein Porträt, das Sie verwenden dürfen, und schreiben Sie zwei oder drei Sätze in einfacher Sprache. Erstellen Sie einen kurzen Clip und prüfen Sie ihn vollständig: Sind die Formulierungen korrekt, ist das Timing natürlich und ist klar erkennbar, dass generierte Sprache keine echte Aussage der abgebildeten Person ist?

Sprechervideo erstellen
  • Beginnen Sie mit einem klaren Porträt von vorn
  • Testen Sie schwierige Namen mit einem kurzen Text
  • Prüfen Sie den gesamten Clip, bevor Sie ihn teilen

Fragen zu KI-generierten Sprechern

Das ist ein Video, in dem ein Gesicht durch generierte Bewegungen, generierten Ton oder beides zu sprechen scheint. Anders als bei einer herkömmlichen Kameraaufnahme kann die sichtbare Darbietung aus einem Porträt und einem Text erstellt werden.

Manche Verfahren kommen mit einem geeigneten Porträt aus, doch welche Eingaben möglich sind, hängt vom jeweiligen Tool ab. Ein klares Foto von vorn, auf dem die Lippen sichtbar sind, bietet in der Regel eine bessere Grundlage als ein kleines oder verdecktes Gesicht.

Nicht unbedingt: Je nach Verfahren lässt sich Sprache aus Text erzeugen oder eine Audioaufnahme verwenden. Prüfen Sie die verfügbaren Eingabemöglichkeiten und hören Sie sich das gesamte Ergebnis auf Aussprache und Timing an.

Verwenden Sie das Abbild einer Person nur, wenn Sie für genau diese Nutzung ihre Einwilligung haben. Ein Foto ansehen oder besitzen zu dürfen, bedeutet nicht, dass Sie die abgebildete Person scheinbar sprechen lassen dürfen.

Sehen Sie sich den Clip mit Ton von Anfang bis Ende an. Prüfen Sie die gesprochenen Worte, die Lippensynchronität und die durchgängige Darstellung des Gesichts. Achten Sie auch darauf, ob Zuschauer die generierte Sprache für eine echte Aussage halten könnten.

Jetzt erstellen
Jetzt erstellen